Una población reúne todos los casos que queremos estudiar; una muestra contiene una parte de ellos y permite obtener información cuando observar el conjunto completo no es posible o conveniente.
Imaginemos que queremos conocer el tiempo de respuesta de una aplicación para todos sus usuarios. Registrar y analizar cada solicitud durante toda la vida del sistema sería imposible. En su lugar, podemos estudiar una parte de las solicitudes y utilizarla para aprender sobre el comportamiento general.
Esta idea da origen a dos conceptos fundamentales: población y muestra. La población es el conjunto que nos interesa conocer; la muestra es el subconjunto que observamos directamente.
La utilidad de una muestra depende de cómo se define la población, cómo se seleccionan los casos y qué tan bien representan al conjunto estudiado.
Una población estadística es el conjunto completo de personas, objetos, eventos o mediciones sobre el que queremos obtener conclusiones.
La población debe definirse con precisión. Expresiones como “los usuarios” o “las solicitudes” son ambiguas si no se especifican el sistema, el período, la región y las condiciones de inclusión.
Una población puede ser finita, como los 8.000 pedidos de un mes, o conceptualmente infinita, como todas las ejecuciones que podría producir un algoritmo bajo determinadas condiciones.
Una muestra es un subconjunto de la población seleccionado para ser observado y analizado. Su tamaño suele representarse con la letra n.
El objetivo habitual es utilizar la información de la muestra para describir o estimar características de la población. Para que esto sea razonable, la selección debe evitar favorecer sistemáticamente a determinados casos.
La unidad de análisis es el elemento sobre el que queremos obtener una conclusión. La unidad de observación es la fuente concreta de la que obtenemos los datos. En muchos estudios coinciden, pero no siempre.
| Pregunta | Unidad de análisis | Posible unidad de observación |
|---|---|---|
| ¿Cuánto demora cada solicitud? | Una solicitud. | Un registro del servidor. |
| ¿Qué porcentaje de usuarios regresa? | Un usuario. | Los eventos asociados a su identificador. |
| ¿Cuál es el consumo de cada servidor? | Un servidor. | Las mediciones de su sistema de monitoreo. |
Definir mal la unidad puede producir duplicaciones o comparaciones incorrectas. Por ejemplo, contar sesiones no equivale necesariamente a contar usuarios.
La población objetivo es el conjunto sobre el que deseamos concluir. La población accesible es la parte que realmente podemos identificar u observar.
Si ambos conjuntos difieren, las conclusiones deben expresarse con cuidado. Los usuarios observables podrían comportarse de forma diferente de aquellos que quedaron fuera del registro.
Un censo intenta observar todos los elementos de la población. Un muestreo observa solo una parte.
| Característica | Censo | Muestra |
|---|---|---|
| Cobertura | Busca incluir toda la población. | Incluye un subconjunto. |
| Costo y tiempo | Generalmente mayores. | Generalmente menores. |
| Incertidumbre por muestreo | No existe si se observa realmente toda la población. | Debe cuantificarse. |
| Riesgo de otros errores | Puede haber omisiones, duplicados o mediciones incorrectas. | También puede haberlos. |
Un censo no garantiza datos perfectos. Puede contener errores de medición o registros faltantes. Tampoco siempre es necesario: una muestra bien seleccionada puede responder la pregunta con menor costo.
Un parámetro es una medida numérica que describe a la población. Un estadístico es una medida calculada con los datos de una muestra.
| Característica | Población: parámetro | Muestra: estadístico |
|---|---|---|
| Tamaño | N | n |
| Media | μ (mu) | x̄ (x barra) |
| Proporción | p | p̂ (p estimada) |
| Desviación estándar | σ (sigma) | s |
El parámetro suele ser desconocido. Calculamos un estadístico para estimarlo. Por ejemplo, la media de una muestra de tiempos puede utilizarse para estimar la media de todos los tiempos de respuesta.
Una aplicación recibió 20.000 solicitudes durante un día. Queremos estimar su tiempo medio de respuesta sin procesar todos los registros.
Los 184 ms describen exactamente la media de la muestra, pero son una estimación de la media poblacional. Otra muestra probablemente produciría un valor algo diferente.
Una muestra es representativa cuando refleja adecuadamente las características relevantes de la población para la pregunta estudiada.
El tamaño es importante, pero no corrige una mala selección. Una muestra con un millón de solicitudes exclusivamente nocturnas puede representar mal el funcionamiento de todo el día.
La representatividad depende del diseño de selección y del contexto, no solamente del porcentaje de población incluido.
Existe sesgo de selección cuando el procedimiento favorece sistemáticamente a ciertos elementos y excluye a otros relacionados con la variable estudiada.
Aumentar el tamaño de una muestra sesgada produce una estimación más estable del grupo incorrecto; no elimina el sesgo.
Dos muestras seleccionadas correctamente de una misma población no tienen por qué contener exactamente los mismos elementos. Por eso, sus medias, proporciones y otras medidas pueden diferir.
Esta diferencia natural se denomina variabilidad muestral. En general, las muestras mayores producen estimaciones menos variables, siempre que el método de selección sea apropiado.
La inferencia estadística proporciona métodos para cuantificar esta incertidumbre mediante errores estándar e intervalos de confianza.
Conviene distinguir dos familias de errores:
Un tamaño de muestra mayor suele reducir el error de muestreo, pero no soluciona automáticamente los errores no muestrales.
El siguiente ejemplo selecciona una muestra aleatoria sin reemplazo. Cada elemento puede aparecer como máximo una vez:
function obtenerMuestra(datos, cantidad) {
if (cantidad > datos.length) {
throw new Error("La muestra supera el tamaño de la población");
}
const copia = [...datos];
for (let i = copia.length - 1; i > 0; i--) {
const j = Math.floor(Math.random() * (i + 1));
[copia[i], copia[j]] = [copia[j], copia[i]];
}
return copia.slice(0, cantidad);
}
const tiempos = [120, 135, 128, 142, 125, 190, 156, 133];
const muestra = obtenerMuestra(tiempos, 4);
console.log(muestra);
El algoritmo mezcla una copia de los datos y toma los primeros elementos. Así no modifica el arreglo original. En sistemas grandes, la selección puede realizarse en la base de datos o mediante algoritmos que eviten cargar toda la población en memoria.
Antes de recolectar o seleccionar datos, conviene responder:
Una definición precisa evita que el análisis responda una pregunta diferente de la planteada.
La distinción entre población y muestra establece el alcance real de un análisis. Una muestra permite estudiar conjuntos extensos, pero sus resultados solo son útiles cuando la población está bien definida y la selección es adecuada.
En el próximo tema profundizaremos en las variables cualitativas y cuantitativas, y en la forma de reconocerlas dentro de un conjunto de datos.