40. Muestreo estadístico

El muestreo permite estudiar una parte de una población y utilizar la información obtenida para describir, con cautela, al conjunto completo.

40.1 ¿Qué es el muestreo?

El muestreo es el proceso de seleccionar unidades de una población para observarlas y analizarlas. Las unidades pueden ser personas, productos, hogares, transacciones, mediciones o cualquier elemento definido por el estudio.

Cuando estudiar toda la población es imposible, costoso o innecesario, una muestra bien diseñada permite obtener información útil con menos recursos.

40.2 Población y muestra

ConceptoSignificadoEjemplo
PoblaciónConjunto completo que interesa estudiar.Todos los clientes de una aplicación.
MuestraParte de la población que se observa.500 clientes seleccionados.
UnidadElemento individual de la población.Un cliente.

La población no tiene que ser necesariamente enorme. Puede ser cualquier conjunto definido por el objetivo, el lugar y el período del estudio.

40.3 Censo y muestra

Un censo observa todas las unidades de la población. Una muestra observa solo una parte.

CensoMás información directa, pero puede requerir mucho tiempo y dinero.
MuestraMás rápida y económica, pero introduce incertidumbre.
DecisiónDepende del tamaño, accesibilidad y objetivo de la población.

40.4 Parámetros y estadísticos

Un parámetro describe una característica de toda la población, como la media poblacional μ. Un estadístico describe la muestra, como la media muestral x̄.

Población → parámetro
Muestra → estadístico

El objetivo de la inferencia estadística es utilizar estadísticos muestrales para estimar parámetros poblacionales, informando también el margen de incertidumbre.

40.5 Marco muestral

El marco muestral es la lista, registro o procedimiento que permite identificar las unidades que pueden ser seleccionadas. Por ejemplo, una lista actualizada de estudiantes o un registro de pedidos.

Si el marco omite sistemáticamente a un grupo, la muestra puede estar sesgada aunque la selección dentro de la lista sea aleatoria.

40.6 Representatividad

Una muestra es representativa cuando refleja de manera adecuada las características relevantes de la población para el objetivo del estudio. El tamaño por sí solo no garantiza representatividad.

Una muestra grande pero seleccionada únicamente entre usuarios voluntarios puede representar peor a la población que una muestra más pequeña y cuidadosamente seleccionada.

40.7 Muestreo aleatorio

En un muestreo aleatorio, la selección incorpora un mecanismo de azar conocido. Esto reduce la posibilidad de que la elección dependa de preferencias del investigador o de la facilidad de acceso.

El azar no garantiza que cada muestra sea idéntica a la población, pero permite cuantificar la variabilidad producida por la selección y construir métodos de inferencia.

40.8 Laboratorio interactivo

Observar una muestra de una población

40.9 Sesgo de selección

Existe sesgo de selección cuando el procedimiento hace que ciertos elementos tengan una probabilidad sistemáticamente distinta de ser incluidos, o cuando algunos grupos no pueden participar.

Ejemplos: encuestar solo a quienes responden voluntariamente, usar únicamente teléfonos fijos o medir satisfacción solo entre quienes terminaron una compra.

40.10 Error muestral

El error muestral es la diferencia entre un estadístico calculado con la muestra y el parámetro real de la población, producida por no observar todas las unidades.

Incluso con una selección aleatoria, dos muestras pueden producir medias distintas. El error muestral disminuye en general al aumentar el tamaño de muestra, aunque no desaparece por completo.

40.11 Error muestral y sesgo

ProblemaOrigen¿Aumentar n lo soluciona?
Error muestralVariación aleatoria entre muestras.Lo reduce, en general.
SesgoProcedimiento que favorece ciertos resultados.No; puede incluso hacerlo más preciso pero incorrecto.

Una muestra sesgada puede producir una estimación muy estable y aun así estar lejos de la realidad.

40.12 Tamaño de muestra

El tamaño necesario depende de la variabilidad, la precisión deseada, el nivel de confianza, el diseño y los recursos disponibles. También importa la tasa de no respuesta.

Para una proporción, una fórmula aproximada en una población grande es:

n ≈ z² · p(1 − p) / E²

Aquí z corresponde al nivel de confianza, p a una proporción esperada y E al margen de error tolerado. Esta fórmula debe adaptarse al diseño real.

40.13 Poblaciones finitas

Cuando la muestra representa una fracción importante de una población pequeña, puede aplicarse una corrección por población finita:

najustado = n / [1 + (n − 1)/N]

En esta expresión N es el tamaño de la población y n es el tamaño calculado inicialmente. La corrección evita pedir una muestra innecesariamente grande.

40.14 No respuesta

Una persona seleccionada puede no responder, abandonar el estudio o no estar disponible. Si quienes no responden son diferentes de quienes sí responden, aparece un sesgo de no respuesta.

Conviene registrar la tasa de respuesta, realizar recordatorios y comparar, cuando sea posible, características de participantes y no participantes.

40.15 Muestrear datos para programación

En programación, muestrear una colección puede ser útil para explorar datos grandes, probar algoritmos o construir conjuntos de entrenamiento y validación. Hay que fijar una semilla cuando se necesita reproducibilidad.

Una muestra para depurar un programa no necesariamente es adecuada para inferir sobre usuarios reales: el objetivo determina el diseño.

40.16 Implementación en JavaScript

El siguiente ejemplo crea una población de valores, extrae una muestra sin reemplazo, calcula ambas medias y dibuja la población junto con los elementos seleccionados.

const poblacion = [
  42, 45, 47, 49, 50, 51, 53, 54, 55, 56,
  58, 60, 61, 63, 64, 66, 68, 70, 73, 78
];
const tamanoMuestra = 6;
const copia = [...poblacion];
const muestra = [];

while (muestra.length < tamanoMuestra) {
  const indice = Math.floor(Math.random() * copia.length);
  muestra.push(copia.splice(indice, 1)[0]);
}

const media = valores => valores.reduce((suma, valor) => suma + valor, 0) / valores.length;
console.log('Media poblacional:', media(poblacion).toFixed(2));
console.log('Muestra:', muestra);
console.log('Media muestral:', media(muestra).toFixed(2));

if (typeof document !== 'undefined') {
  const canvas = document.getElementById('canvasMuestreoCodigo');
  const contexto = canvas.getContext('2d');
  const escala = valor => 60 + (valor - 40) / 40 * 700;
  contexto.clearRect(0, 0, canvas.width, canvas.height);
  contexto.strokeStyle = '#afd1e5'; contexto.lineWidth = 2;
  contexto.beginPath(); contexto.moveTo(60, 225); contexto.lineTo(760, 225); contexto.stroke();
  contexto.fillStyle = '#98c3dd';
  poblacion.forEach(valor => { contexto.beginPath(); contexto.arc(escala(valor), 225, 7, 0, Math.PI * 2); contexto.fill(); });
  contexto.fillStyle = '#286f97';
  muestra.forEach(valor => { contexto.beginPath(); contexto.arc(escala(valor), 225, 11, 0, Math.PI * 2); contexto.fill(); });
}

40.17 Errores frecuentes

  • Confundir una muestra grande con una muestra representativa.
  • Seleccionar casos por comodidad y generalizar sin advertir el sesgo.
  • Ignorar a quienes no responden.
  • Usar un tamaño de muestra sin justificar precisión ni nivel de confianza.
  • Confundir error muestral con un error de medición o de carga de datos.
  • Presentar un estadístico muestral como si fuera exactamente el parámetro poblacional.

40.18 Qué debes recordar

La calidad de una conclusión depende tanto de los datos observados como de cómo fueron seleccionados.
Una muestra debe definirse junto con su población, marco muestral, mecanismo de selección, tamaño, tasa de respuesta y margen de incertidumbre.

40.19 Conclusión

El muestreo transforma un problema potencialmente enorme en un estudio manejable. Para que sus resultados sean confiables no alcanza con calcular una media: hay que diseñar la selección, reconocer las fuentes de sesgo y comunicar qué población puede representar la muestra.