El muestreo permite estudiar una parte de una población y utilizar la información obtenida para describir, con cautela, al conjunto completo.
El muestreo es el proceso de seleccionar unidades de una población para observarlas y analizarlas. Las unidades pueden ser personas, productos, hogares, transacciones, mediciones o cualquier elemento definido por el estudio.
Cuando estudiar toda la población es imposible, costoso o innecesario, una muestra bien diseñada permite obtener información útil con menos recursos.
| Concepto | Significado | Ejemplo |
|---|---|---|
| Población | Conjunto completo que interesa estudiar. | Todos los clientes de una aplicación. |
| Muestra | Parte de la población que se observa. | 500 clientes seleccionados. |
| Unidad | Elemento individual de la población. | Un cliente. |
La población no tiene que ser necesariamente enorme. Puede ser cualquier conjunto definido por el objetivo, el lugar y el período del estudio.
Un censo observa todas las unidades de la población. Una muestra observa solo una parte.
Un parámetro describe una característica de toda la población, como la media poblacional μ. Un estadístico describe la muestra, como la media muestral x̄.
El objetivo de la inferencia estadística es utilizar estadísticos muestrales para estimar parámetros poblacionales, informando también el margen de incertidumbre.
El marco muestral es la lista, registro o procedimiento que permite identificar las unidades que pueden ser seleccionadas. Por ejemplo, una lista actualizada de estudiantes o un registro de pedidos.
Si el marco omite sistemáticamente a un grupo, la muestra puede estar sesgada aunque la selección dentro de la lista sea aleatoria.
Una muestra es representativa cuando refleja de manera adecuada las características relevantes de la población para el objetivo del estudio. El tamaño por sí solo no garantiza representatividad.
Una muestra grande pero seleccionada únicamente entre usuarios voluntarios puede representar peor a la población que una muestra más pequeña y cuidadosamente seleccionada.
En un muestreo aleatorio, la selección incorpora un mecanismo de azar conocido. Esto reduce la posibilidad de que la elección dependa de preferencias del investigador o de la facilidad de acceso.
El azar no garantiza que cada muestra sea idéntica a la población, pero permite cuantificar la variabilidad producida por la selección y construir métodos de inferencia.
Existe sesgo de selección cuando el procedimiento hace que ciertos elementos tengan una probabilidad sistemáticamente distinta de ser incluidos, o cuando algunos grupos no pueden participar.
Ejemplos: encuestar solo a quienes responden voluntariamente, usar únicamente teléfonos fijos o medir satisfacción solo entre quienes terminaron una compra.
El error muestral es la diferencia entre un estadístico calculado con la muestra y el parámetro real de la población, producida por no observar todas las unidades.
Incluso con una selección aleatoria, dos muestras pueden producir medias distintas. El error muestral disminuye en general al aumentar el tamaño de muestra, aunque no desaparece por completo.
| Problema | Origen | ¿Aumentar n lo soluciona? |
|---|---|---|
| Error muestral | Variación aleatoria entre muestras. | Lo reduce, en general. |
| Sesgo | Procedimiento que favorece ciertos resultados. | No; puede incluso hacerlo más preciso pero incorrecto. |
Una muestra sesgada puede producir una estimación muy estable y aun así estar lejos de la realidad.
El tamaño necesario depende de la variabilidad, la precisión deseada, el nivel de confianza, el diseño y los recursos disponibles. También importa la tasa de no respuesta.
Para una proporción, una fórmula aproximada en una población grande es:
Aquí z corresponde al nivel de confianza, p a una proporción esperada y E al margen de error tolerado. Esta fórmula debe adaptarse al diseño real.
Cuando la muestra representa una fracción importante de una población pequeña, puede aplicarse una corrección por población finita:
En esta expresión N es el tamaño de la población y n es el tamaño calculado inicialmente. La corrección evita pedir una muestra innecesariamente grande.
Una persona seleccionada puede no responder, abandonar el estudio o no estar disponible. Si quienes no responden son diferentes de quienes sí responden, aparece un sesgo de no respuesta.
Conviene registrar la tasa de respuesta, realizar recordatorios y comparar, cuando sea posible, características de participantes y no participantes.
En programación, muestrear una colección puede ser útil para explorar datos grandes, probar algoritmos o construir conjuntos de entrenamiento y validación. Hay que fijar una semilla cuando se necesita reproducibilidad.
Una muestra para depurar un programa no necesariamente es adecuada para inferir sobre usuarios reales: el objetivo determina el diseño.
El siguiente ejemplo crea una población de valores, extrae una muestra sin reemplazo, calcula ambas medias y dibuja la población junto con los elementos seleccionados.
const poblacion = [
42, 45, 47, 49, 50, 51, 53, 54, 55, 56,
58, 60, 61, 63, 64, 66, 68, 70, 73, 78
];
const tamanoMuestra = 6;
const copia = [...poblacion];
const muestra = [];
while (muestra.length < tamanoMuestra) {
const indice = Math.floor(Math.random() * copia.length);
muestra.push(copia.splice(indice, 1)[0]);
}
const media = valores => valores.reduce((suma, valor) => suma + valor, 0) / valores.length;
console.log('Media poblacional:', media(poblacion).toFixed(2));
console.log('Muestra:', muestra);
console.log('Media muestral:', media(muestra).toFixed(2));
if (typeof document !== 'undefined') {
const canvas = document.getElementById('canvasMuestreoCodigo');
const contexto = canvas.getContext('2d');
const escala = valor => 60 + (valor - 40) / 40 * 700;
contexto.clearRect(0, 0, canvas.width, canvas.height);
contexto.strokeStyle = '#afd1e5'; contexto.lineWidth = 2;
contexto.beginPath(); contexto.moveTo(60, 225); contexto.lineTo(760, 225); contexto.stroke();
contexto.fillStyle = '#98c3dd';
poblacion.forEach(valor => { contexto.beginPath(); contexto.arc(escala(valor), 225, 7, 0, Math.PI * 2); contexto.fill(); });
contexto.fillStyle = '#286f97';
muestra.forEach(valor => { contexto.beginPath(); contexto.arc(escala(valor), 225, 11, 0, Math.PI * 2); contexto.fill(); });
}El muestreo transforma un problema potencialmente enorme en un estudio manejable. Para que sus resultados sean confiables no alcanza con calcular una media: hay que diseñar la selección, reconocer las fuentes de sesgo y comunicar qué población puede representar la muestra.