47. Distribución F de Fisher

La distribución F de Fisher-Snedecor aparece al comparar dos variancias. Es una distribución continua, no negativa y con dos grados de libertad: uno para el numerador y otro para el denominador.

47.1 Construcción a partir de chi-cuadrado

Sean U y V variables chi-cuadrado independientes, con ν1 y ν2 grados de libertad. Entonces el cociente de sus versiones normalizadas sigue una distribución F:

F=(U/ν1)/(V/ν2) ∼ F(ν12)

Cada chi-cuadrado se divide por sus grados de libertad para convertirlo en una estimación de variabilidad promedio. La distribución F compara esas dos cantidades.

SoporteF solo puede tomar valores x≥0.
Parámetrosν1 pertenece al numerador y ν2 al denominador.
AsimetríaTiene cola derecha, especialmente con pocos grados.
ComparaciónValores grandes indican que el numerador domina al denominador.

47.2 Función de densidad

Para x>0, su densidad puede escribirse usando la función beta:

f(x)=((ν12)ν1/2 xν1/2−1)/(B(ν1/2,ν2/2)(1+ν1x/ν2)12)/2)

La función beta normaliza el área total para que sea 1. En la práctica, las calculadoras y bibliotecas estadísticas suelen trabajar con la densidad acumulada o con cuantiles.

47.3 Forma y grados de libertad

La forma de F depende de dos grados de libertad. El primer parámetro controla la variabilidad del numerador y el segundo la del denominador. Al aumentar ambos, la distribución se concentra alrededor de 1 y la cola derecha pierde peso.

La distribución no es simétrica: una variación grande del denominador puede hacer que el cociente sea muy pequeño, mientras que un denominador cercano a cero puede producir valores enormes.

47.4 Media y varianza

Si F∼F(ν12), la media existe cuando ν2>2:

E(F)=ν2/(ν2−2)

La varianza requiere ν2>4 y vale:

Var(F)=2ν2²(ν12−2)/(ν12−2)²(ν2−4))

Por eso la media no siempre es exactamente 1, aunque el cociente compare dos cantidades normalizadas con valor esperado cercano a 1.

47.5 Relación con chi-cuadrado y t

La distribución F se construye con dos chi-cuadrado independientes, mientras que la t usa una normal y una chi-cuadrado:

Si T∼t(ν), entonces T²∼F(1,ν)

Esta identidad conecta las pruebas t de dos colas con pruebas F cuyo numerador tiene un grado de libertad.

47.6 Cociente de varianzas muestrales

Si dos muestras normales independientes tienen varianzas poblacionales σ1² y σ2², entonces:

F=(S1²/σ1²)/(S2²/σ2²) ∼ F(n1−1,n2−1)

Cuando la hipótesis plantea σ1²=σ2², el cociente S1²/S2² se contrasta contra una distribución F. Conviene colocar la mayor varianza en el numerador cuando se busca una prueba de una cola superior.

47.7 Análisis de varianza ANOVA

En ANOVA se compara la variabilidad entre grupos con la variabilidad dentro de los grupos:

F=Cuadrado medio entre grupos/Cuadrado medio dentro de los grupos

Un valor F grande indica que las medias de los grupos están separadas en relación con el ruido interno. La prueba no demuestra por sí sola qué pares de medias son diferentes; para eso se requieren comparaciones posteriores.

47.8 Explorador de la distribución F

Modifica los grados de libertad y observa cómo cambia la densidad. La línea vertical muestra F=1, el punto natural de referencia cuando las dos varianzas comparadas son similares.

Densidad F de Fisher

Distribución FDensidad de la distribución F con dos grados de libertad.

47.9 Distribución F de Fisher en JavaScript

Para generar una observación F se generan dos chi-cuadrado independientes, se normalizan por sus grados de libertad y se calcula el cociente:

function normalEstandar() {
  return Math.sqrt(-2 * Math.log(Math.random()))
    * Math.cos(2 * Math.PI * Math.random());
}

function chiCuadrado(grados) {
  let suma = 0;
  for (let i = 0; i < grados; i++) {
    const z = normalEstandar();
    suma += z * z;
  }
  return suma;
}

function fisher(numerador, denominador) {
  return (chiCuadrado(numerador) / numerador)
    / (chiCuadrado(denominador) / denominador);
}

console.log(fisher(5, 10));

Pulsa Ejecutar para generar un valor aleatorio de F(5,10).

47.10 Simulación de cocientes

La simulación permite comparar la media observada con la media teórica cuando existe y contar qué proporción de valores queda por debajo del límite elegido.

Valores simulados

47.11 Pruebas de una y dos colas

Como F es no negativa, una prueba de una cola superior examina si el cociente es demasiado grande. Para una prueba bilateral de varianzas también importa un cociente demasiado pequeño; puede invertirse el orden de las varianzas o calcularse cada cola con cuidado.

La decisión se basa en un valor crítico o en un valor p, siempre especificando los grados de libertad de ambos parámetros.

47.12 Supuestos del modelo

  • Las observaciones de cada muestra son independientes.
  • Las poblaciones se modelan como normales, especialmente en muestras pequeñas.
  • Las muestras de los dos grupos son independientes entre sí.
  • La definición de grados de libertad corresponde al diseño y al estadístico usado.

La falta de normalidad o la presencia de valores extremos puede alterar notablemente un cociente de varianzas.

47.13 Aplicaciones

La distribución F se utiliza en comparación de varianzas, ANOVA, regresión lineal, pruebas de significación conjunta y construcción de intervalos para cocientes de varianzas. En regresión, una estadística F puede evaluar si un conjunto de variables explica una cantidad significativa de variación.

47.14 Errores frecuentes

  • Intercambiar ν1 y ν2: cambiar el orden cambia la distribución.
  • Confundir F con una probabilidad; F es un estadístico continuo.
  • Aplicar la prueba de varianzas sin revisar independencia y normalidad.
  • Concluir que todas las medias difieren después de un ANOVA significativo.
  • Usar la media teórica cuando los grados del denominador no permiten que exista.
  • Olvidar que una prueba bilateral requiere considerar ambas colas.

47.15 Qué debes recordar de este tema

F=(U/ν1)/(V/ν2)
U∼χ²(ν1), V∼χ²(ν2) independientes
T²∼F(1,ν)
F=CMentre/CMdentro en ANOVA

F es un cociente de variabilidades normalizadas. Sus dos grados de libertad son esenciales para interpretar la forma y los valores críticos.

47.16 Conclusión

La distribución F transforma la comparación de dos fuentes de variabilidad en un modelo probabilístico. Comprender su construcción desde chi-cuadrado permite interpretar pruebas de varianzas, ANOVA y muchos contrastes de regresión.

Volver al índice