42. Introducción a la inferencia estadística

La inferencia estadística utiliza una muestra para aprender sobre una población, siempre expresando la incertidumbre que surge al no observar todos sus elementos.

42.1 ¿Qué es la inferencia?

La estadística descriptiva organiza y resume los datos observados. La inferencia estadística va un paso más allá: utiliza una muestra para estimar características de una población o evaluar afirmaciones sobre ella.

Inferir no significa adivinar con certeza. Significa construir una conclusión basada en un procedimiento que permite medir su incertidumbre.

42.2 Población, muestra y parámetro

La población es el conjunto de interés, la muestra es la parte observada y el parámetro es la cantidad poblacional que se desea conocer, como μ, σ o una proporción p.

Población → parámetro desconocido
Muestra → estadístico calculable
Inferencia → estimación con incertidumbre

42.3 Dos grandes tareas

EstimaciónProponer valores o intervalos plausibles para un parámetro.
Pruebas de hipótesisEvaluar si los datos son compatibles con una afirmación.
PredicciónAnticipar observaciones futuras considerando su variabilidad.

Estas tareas utilizan modelos, supuestos y distribuciones muestrales.

42.4 Estadístico como estimador

Un estadístico es una función de los datos muestrales. La media muestral x̄ estima la media poblacional μ; la proporción muestral p̂ estima la proporción p.

Un buen estimador suele buscar poco sesgo, variabilidad reducida y un comportamiento estable al aumentar el tamaño de muestra.

42.5 Distribución muestral

Si se repitiera muchas veces el mismo procedimiento de muestreo, cada muestra produciría un estadístico diferente. La distribución de todos esos valores se llama distribución muestral.

Estudiarla permite conocer el centro, la dispersión y la forma de la variación de un estimador.

42.6 Teorema central del límite

Para muchas poblaciones, la distribución de las medias muestrales se aproxima a una distribución normal cuando el tamaño de muestra es suficientemente grande, incluso si los datos originales no son normales.

Media de x̄ = μ
Error estándar de x̄ ≈ σ / √n

La aproximación depende de la población, la independencia y el tamaño de muestra; no es una garantía automática para cualquier conjunto de datos.

42.7 Laboratorio interactivo

Simular medias muestrales

42.8 Error estándar

El error estándar mide la dispersión esperada de un estimador entre muestras. Para la media, si σ es conocida, se expresa como:

EE(x̄) = σ / √n

Al aumentar n, el error estándar disminuye con la raíz cuadrada. Para reducirlo a la mitad se necesita aproximadamente cuadruplicar el tamaño de muestra, si las demás condiciones permanecen iguales.

42.9 Estimación puntual

Una estimación puntual utiliza un único número, por ejemplo x̄ = 72,4. Es fácil de comunicar, pero no muestra cuánto podría variar el resultado si se repitiera el muestreo.

Por eso suele complementarse con un intervalo de confianza o un margen de error.

42.10 Intervalos de confianza

Un intervalo de confianza produce un rango de valores compatibles con los datos bajo un procedimiento y un nivel de confianza determinado. El siguiente tema desarrolla este concepto con detalle.

Un intervalo más amplio refleja mayor incertidumbre; aumentar n suele hacerlo más estrecho.

42.11 Hipótesis nula y alternativa

Una prueba de hipótesis comienza con una afirmación de referencia, llamada hipótesis nula H₀, y una afirmación que representa el cambio o efecto de interés, llamada hipótesis alternativa H₁.

Los datos se comparan con lo que sería esperable si H₀ fuera cierta. No se “prueba” una hipótesis de manera absoluta: se evalúa la evidencia disponible.

42.12 Valor p

El valor p es la probabilidad, suponiendo verdadera H₀, de obtener un resultado tan extremo como el observado o más. Un valor pequeño indica que los datos serían poco habituales bajo H₀.

No es la probabilidad de que H₀ sea verdadera, ni mide el tamaño o la importancia práctica del efecto.

42.13 Errores tipo I y tipo II

DecisiónRealidad: H₀ verdaderaRealidad: H₀ falsa
No rechazar H₀Decisión correctaError tipo II
Rechazar H₀Error tipo IDecisión correcta

El nivel de significancia α controla el riesgo máximo planificado de error tipo I bajo el procedimiento elegido. La potencia se relaciona con la capacidad de detectar un efecto real.

42.14 Significancia estadística y práctica

Un resultado estadísticamente significativo puede corresponder a un efecto demasiado pequeño para ser importante en la práctica. Por el contrario, un resultado no significativo puede deberse a una muestra pequeña y no demostrar que el efecto sea exactamente cero.

Conviene informar tamaño del efecto, intervalo de confianza, unidades y consecuencias concretas.

42.15 Supuestos y diseño

La inferencia depende de cómo se obtuvieron los datos. Independencia, selección probabilística, ausencia de sesgos graves y un modelo razonable son más importantes que aplicar una fórmula automáticamente.

Si los supuestos no son adecuados, se deben usar transformaciones, métodos robustos, técnicas no paramétricas o modelos que representen mejor el diseño.

42.16 Implementación en JavaScript

El siguiente ejemplo simula medias muestrales y dibuja su distribución. El canvas permanece oculto hasta ejecutar el código.

const poblacion = [42, 45, 47, 49, 50, 51, 53, 54, 55, 56, 58, 60, 61, 63, 64, 66, 68, 70, 73, 78];
const tamanoMuestra = 5;
const repeticiones = 300;
const medias = [];

for (let repeticion = 0; repeticion < repeticiones; repeticion++) {
  let suma = 0;
  for (let indice = 0; indice < tamanoMuestra; indice++) {
    const posicion = Math.floor(Math.random() * poblacion.length);
    suma += poblacion[posicion];
  }
  medias.push(suma / tamanoMuestra);
}

const mediaPoblacion = poblacion.reduce((suma, valor) => suma + valor, 0) / poblacion.length;
const mediaMedias = medias.reduce((suma, valor) => suma + valor, 0) / medias.length;
console.log('Media poblacional:', mediaPoblacion.toFixed(2));
console.log('Media de las medias:', mediaMedias.toFixed(2));

if (typeof document !== 'undefined') {
  const canvas = document.getElementById('canvasInferenciaCodigo');
  const contexto = canvas.getContext('2d');
  const minimo = 40; const maximo = 80; const barras = 10;
  const frecuencias = Array(barras).fill(0);
  medias.forEach(valor => { const indice = Math.min(barras - 1, Math.floor((valor - minimo) / (maximo - minimo) * barras)); frecuencias[indice]++; });
  const maxFrecuencia = Math.max(...frecuencias);
  contexto.clearRect(0, 0, canvas.width, canvas.height);
  frecuencias.forEach((frecuencia, indice) => { const ancho = 700 / barras; const alto = frecuencia / maxFrecuencia * 300; contexto.fillStyle = '#356fa3'; contexto.fillRect(60 + indice * ancho, 370 - alto, ancho - 4, alto); });
}

42.17 Errores frecuentes

  • Tratar una muestra sesgada como si fuera aleatoria.
  • Confundir el valor p con la probabilidad de que una hipótesis sea verdadera.
  • Interpretar un intervalo como una garantía para un parámetro fijo.
  • Concluir que no existe efecto porque el resultado no fue significativo.
  • Ignorar tamaño del efecto, unidades y consecuencias prácticas.
  • Aplicar métodos sin comprobar los supuestos del diseño.

42.18 Qué debes recordar

Inferir es generalizar con incertidumbre controlada.
Una muestra produce estadísticos; los estadísticos estiman parámetros; las distribuciones muestrales permiten cuantificar variación; y las conclusiones deben respetar el diseño y los supuestos.

42.19 Conclusión

La inferencia estadística proporciona un lenguaje para aprender sobre poblaciones a partir de muestras. Sus resultados son más confiables cuando el muestreo es adecuado, el modelo es razonable y se comunican tanto la evidencia como la incertidumbre. En los próximos temas se estudiarán intervalos de confianza y pruebas de hipótesis con mayor detalle.