4. Población y muestra

Una población reúne todos los casos que queremos estudiar; una muestra contiene una parte de ellos y permite obtener información cuando observar el conjunto completo no es posible o conveniente.

4.1 Introducción

Imaginemos que queremos conocer el tiempo de respuesta de una aplicación para todos sus usuarios. Registrar y analizar cada solicitud durante toda la vida del sistema sería imposible. En su lugar, podemos estudiar una parte de las solicitudes y utilizarla para aprender sobre el comportamiento general.

Esta idea da origen a dos conceptos fundamentales: población y muestra. La población es el conjunto que nos interesa conocer; la muestra es el subconjunto que observamos directamente.

La utilidad de una muestra depende de cómo se define la población, cómo se seleccionan los casos y qué tan bien representan al conjunto estudiado.

4.2 Qué es una población

Una población estadística es el conjunto completo de personas, objetos, eventos o mediciones sobre el que queremos obtener conclusiones.

Pregunta: ¿cuál es el tiempo de respuesta de la API durante agosto?
Población: todas las solicitudes recibidas por la API durante agosto.

La población debe definirse con precisión. Expresiones como “los usuarios” o “las solicitudes” son ambiguas si no se especifican el sistema, el período, la región y las condiciones de inclusión.

Una población puede ser finita, como los 8.000 pedidos de un mes, o conceptualmente infinita, como todas las ejecuciones que podría producir un algoritmo bajo determinadas condiciones.

4.3 Qué es una muestra

Una muestra es un subconjunto de la población seleccionado para ser observado y analizado. Su tamaño suele representarse con la letra n.

Población: 50.000 solicitudes recibidas en una semana.
Muestra: 1.000 solicitudes seleccionadas para el análisis.
Tamaño de la muestra: n = 1.000

El objetivo habitual es utilizar la información de la muestra para describir o estimar características de la población. Para que esto sea razonable, la selección debe evitar favorecer sistemáticamente a determinados casos.

4.4 Unidad de análisis y unidad de observación

La unidad de análisis es el elemento sobre el que queremos obtener una conclusión. La unidad de observación es la fuente concreta de la que obtenemos los datos. En muchos estudios coinciden, pero no siempre.

Pregunta Unidad de análisis Posible unidad de observación
¿Cuánto demora cada solicitud? Una solicitud. Un registro del servidor.
¿Qué porcentaje de usuarios regresa? Un usuario. Los eventos asociados a su identificador.
¿Cuál es el consumo de cada servidor? Un servidor. Las mediciones de su sistema de monitoreo.

Definir mal la unidad puede producir duplicaciones o comparaciones incorrectas. Por ejemplo, contar sesiones no equivale necesariamente a contar usuarios.

4.5 Población objetivo y población accesible

La población objetivo es el conjunto sobre el que deseamos concluir. La población accesible es la parte que realmente podemos identificar u observar.

Población objetivo: todos los usuarios de la aplicación.
Población accesible: usuarios que aceptaron el registro de actividad
y utilizaron la aplicación durante el período analizado.

Si ambos conjuntos difieren, las conclusiones deben expresarse con cuidado. Los usuarios observables podrían comportarse de forma diferente de aquellos que quedaron fuera del registro.

4.6 Censo y muestreo

Un censo intenta observar todos los elementos de la población. Un muestreo observa solo una parte.

Característica Censo Muestra
Cobertura Busca incluir toda la población. Incluye un subconjunto.
Costo y tiempo Generalmente mayores. Generalmente menores.
Incertidumbre por muestreo No existe si se observa realmente toda la población. Debe cuantificarse.
Riesgo de otros errores Puede haber omisiones, duplicados o mediciones incorrectas. También puede haberlos.

Un censo no garantiza datos perfectos. Puede contener errores de medición o registros faltantes. Tampoco siempre es necesario: una muestra bien seleccionada puede responder la pregunta con menor costo.

4.7 Parámetros y estadísticos

Un parámetro es una medida numérica que describe a la población. Un estadístico es una medida calculada con los datos de una muestra.

Característica Población: parámetro Muestra: estadístico
Tamaño N n
Media μ (mu) x̄ (x barra)
Proporción p p̂ (p estimada)
Desviación estándar σ (sigma) s

El parámetro suele ser desconocido. Calculamos un estadístico para estimarlo. Por ejemplo, la media de una muestra de tiempos puede utilizarse para estimar la media de todos los tiempos de respuesta.

4.8 Ejemplo paso a paso

Una aplicación recibió 20.000 solicitudes durante un día. Queremos estimar su tiempo medio de respuesta sin procesar todos los registros.

Población: las 20.000 solicitudes del día.
N = 20.000
Variable: tiempo de respuesta en milisegundos.
Muestra: 500 solicitudes seleccionadas.
n = 500
Estadístico calculado: x̄ = 184 ms.

Los 184 ms describen exactamente la media de la muestra, pero son una estimación de la media poblacional. Otra muestra probablemente produciría un valor algo diferente.

4.9 Representatividad

Una muestra es representativa cuando refleja adecuadamente las características relevantes de la población para la pregunta estudiada.

El tamaño es importante, pero no corrige una mala selección. Una muestra con un millón de solicitudes exclusivamente nocturnas puede representar mal el funcionamiento de todo el día.

Calidad de la muestra = selección adecuada + datos confiables + tamaño suficiente

La representatividad depende del diseño de selección y del contexto, no solamente del porcentaje de población incluido.

4.10 Sesgo de selección

Existe sesgo de selección cuando el procedimiento favorece sistemáticamente a ciertos elementos y excluye a otros relacionados con la variable estudiada.

  • Medir rendimiento solo desde una conexión rápida excluye otras condiciones de uso.
  • Consultar satisfacción únicamente a quienes completaron una compra excluye a quienes abandonaron.
  • Analizar solo solicitudes exitosas oculta el comportamiento de las que fallaron.
  • Usar datos de un solo horario puede ignorar los momentos de mayor carga.

Aumentar el tamaño de una muestra sesgada produce una estimación más estable del grupo incorrecto; no elimina el sesgo.

4.11 Variabilidad muestral

Dos muestras seleccionadas correctamente de una misma población no tienen por qué contener exactamente los mismos elementos. Por eso, sus medias, proporciones y otras medidas pueden diferir.

Esta diferencia natural se denomina variabilidad muestral. En general, las muestras mayores producen estimaciones menos variables, siempre que el método de selección sea apropiado.

Muestra A → media = 181 ms
Muestra B → media = 187 ms
Muestra C → media = 184 ms

La inferencia estadística proporciona métodos para cuantificar esta incertidumbre mediante errores estándar e intervalos de confianza.

4.12 Errores de muestreo y errores no muestrales

Conviene distinguir dos familias de errores:

  • Error de muestreo: variación que aparece porque observamos una muestra en lugar de toda la población.
  • Error no muestral: problemas de medición, cobertura, registros faltantes, duplicados, respuestas incorrectas o procesamiento defectuoso.

Un tamaño de muestra mayor suele reducir el error de muestreo, pero no soluciona automáticamente los errores no muestrales.

4.13 Selección aleatoria en JavaScript

El siguiente ejemplo selecciona una muestra aleatoria sin reemplazo. Cada elemento puede aparecer como máximo una vez:

function obtenerMuestra(datos, cantidad) {
  if (cantidad > datos.length) {
    throw new Error("La muestra supera el tamaño de la población");
  }

  const copia = [...datos];

  for (let i = copia.length - 1; i > 0; i--) {
    const j = Math.floor(Math.random() * (i + 1));
    [copia[i], copia[j]] = [copia[j], copia[i]];
  }

  return copia.slice(0, cantidad);
}

const tiempos = [120, 135, 128, 142, 125, 190, 156, 133];
const muestra = obtenerMuestra(tiempos, 4);

console.log(muestra);

El algoritmo mezcla una copia de los datos y toma los primeros elementos. Así no modifica el arreglo original. En sistemas grandes, la selección puede realizarse en la base de datos o mediante algoritmos que eviten cargar toda la población en memoria.

4.14 Preguntas para definir un estudio

Antes de recolectar o seleccionar datos, conviene responder:

  1. ¿Cuál es la pregunta que queremos responder?
  2. ¿Cuál es la población objetivo y durante qué período?
  3. ¿Cuál es la unidad de análisis?
  4. ¿Qué elementos podemos observar realmente?
  5. ¿Cómo seleccionaremos la muestra?
  6. ¿Qué grupos podrían quedar excluidos?
  7. ¿Qué variable mediremos y con qué unidad?

Una definición precisa evita que el análisis responda una pregunta diferente de la planteada.

4.15 Qué debes recordar de este tema

  • La población es el conjunto completo sobre el que queremos obtener conclusiones.
  • La muestra es el subconjunto que observamos y analizamos.
  • Un parámetro describe la población; un estadístico describe la muestra.
  • La unidad de análisis debe definirse antes de seleccionar los datos.
  • Una muestra grande no es necesariamente representativa.
  • El sesgo de selección es sistemático y no desaparece aumentando el tamaño de la muestra.
  • Las estimaciones cambian entre muestras debido a la variabilidad muestral.

4.16 Conclusión

La distinción entre población y muestra establece el alcance real de un análisis. Una muestra permite estudiar conjuntos extensos, pero sus resultados solo son útiles cuando la población está bien definida y la selección es adecuada.

En el próximo tema profundizaremos en las variables cualitativas y cuantitativas, y en la forma de reconocerlas dentro de un conjunto de datos.