45. Interpretación del valor p

El valor p mide qué tan extremos serían los datos si la hipótesis nula fuera cierta. Su significado depende del modelo, el diseño y la pregunta estadística.

45.1 Definición

El valor p es la probabilidad, suponiendo verdadera la hipótesis nula H₀, de obtener un estadístico de prueba tan extremo como el observado o más.

p = P(resultado tan extremo o más | H₀ verdadera)

El valor p se calcula bajo el modelo de H₀. No describe directamente la probabilidad de que H₀ sea verdadera.

45.2 Ejemplo conceptual

Supongamos que H₀ afirma que una moneda es equilibrada. Si al repetir muchos lanzamientos obtenemos un resultado muy poco habitual bajo esa afirmación, el valor p será pequeño.

Un valor p pequeño indica incompatibilidad entre los datos y H₀, pero la conclusión también depende de la calidad de los datos y de si el modelo era razonable.

45.3 Comparar p con α

ResultadoDecisión formalLectura
p ≤ αRechazar H₀La evidencia es suficientemente extrema bajo H₀.
p > αNo rechazar H₀No hay evidencia suficiente para rechazarla.

El valor p no cambia porque α cambie; lo que cambia es la regla de decisión aplicada.

45.4 El valor p no es P(H₀)

Una confusión frecuente es escribir “p = 0,03, por lo tanto hay un 3 % de probabilidad de que H₀ sea cierta”. Esa afirmación no corresponde a la definición frecuentista del valor p.

Para asignar probabilidades a hipótesis se necesita un modelo bayesiano con una distribución previa y una verosimilitud.

45.5 El valor p no mide el tamaño del efecto

Un valor p pequeño puede aparecer con un efecto minúsculo si la muestra es muy grande. Un efecto importante puede producir un valor p grande si la muestra es pequeña o muy variable.

pCompatibilidad de los datos con H₀.
EfectoMagnitud y dirección de la diferencia.
IntervaloValores plausibles y precisión de la estimación.

45.6 Laboratorio interactivo

Visualizar valores p

45.7 Valores p bilaterales y unilaterales

En una prueba bilateral se consideran resultados extremos en ambas direcciones. En una prueba unilateral solo se considera una dirección previamente definida.

Para el mismo estadístico, un valor p bilateral suele ser aproximadamente el doble del valor p unilateral cuando la observación está en la dirección planteada.

45.8 Significancia estadística

Decir que un resultado es estadísticamente significativo significa que p es menor o igual que el α elegido. No significa que el resultado sea grande, importante o causal.

La etiqueta “significativo” depende del umbral establecido y no debe reemplazar la comunicación del valor p, el efecto y su intervalo.

45.9 Valores p cercanos a α

Un resultado p = 0,049 y otro p = 0,051 no representan realidades científicas completamente opuestas. Una frontera rígida puede ocultar que la evidencia cambia de manera gradual.

Conviene informar el valor p con precisión razonable y describir la incertidumbre, en lugar de usar únicamente “pasó” o “no pasó” un umbral.

45.10 No rechazar H₀

Cuando p es mayor que α, no se rechaza H₀. Esto indica que los datos no aportan evidencia suficiente bajo el criterio elegido.

No demuestra que H₀ sea cierta. Para evaluar si los datos son compatibles con efectos pequeños o relevantes, son más informativos el intervalo de confianza y el análisis de potencia.

45.11 Múltiples pruebas

Si se realizan muchas pruebas, aumenta la probabilidad de obtener al menos un valor p pequeño por azar aunque todas las hipótesis nulas sean ciertas.

Algunas estrategias son definir las hipótesis antes de mirar los datos, corregir por multiplicidad, controlar la tasa de falsos descubrimientos y validar resultados en nuevos datos.

45.12 Prácticas problemáticas

Probar muchos análisis y reportar solo el que produce p pequeño, detener la recolección cuando aparece significancia o cambiar la hipótesis después de ver el resultado puede inflar la tasa de falsos positivos.

La transparencia sobre análisis planificados y exploratorios mejora la credibilidad.

45.13 Valor p y tamaño de muestra

Con n grande, el error estándar suele disminuir y diferencias pequeñas pueden generar valores p reducidos. Con n pequeño, una diferencia real puede no alcanzar significancia.

El valor p debe acompañarse con n, estimación, intervalo y unidades para evaluar la relevancia completa.

45.14 Interpretación en un informe

Una redacción clara puede ser:

“La diferencia estimada fue de 4,2 puntos (IC del 95 %: 1,1 a 7,3; p = 0,008). Bajo H₀, este resultado sería poco habitual. La relevancia práctica debe evaluarse según el contexto.”

Esta forma informa evidencia, magnitud y precisión sin convertir p en una medida de verdad.

45.15 Implementación en JavaScript

Este ejemplo toma un valor p y un nivel α, aplica la regla de decisión y muestra la región extrema en un gráfico. El canvas permanece oculto hasta ejecutar.

const valorP = 0.03;
const alfa = 0.05;
const tipo = 'bilateral';
const rechazar = valorP <= alfa;

console.log('Valor p:', valorP);
console.log('Alfa:', alfa);
console.log(rechazar ? 'Rechazar H0' : 'No rechazar H0');

if (typeof document !== 'undefined') {
  const canvas = document.getElementById('canvasPCodigo');
  const contexto = canvas.getContext('2d');
  const valores = { 0.40: 0.84, 0.10: 1.645, 0.05: 1.96, 0.03: 2.17, 0.01: 2.576 };
  const z = valores[valorP] || 2.17;
  const escalaX = valor => 60 + (valor + 4) / 8 * 700;
  const densidad = valor => Math.exp(-valor * valor / 2) / Math.sqrt(2 * Math.PI);
  contexto.clearRect(0, 0, canvas.width, canvas.height);
  contexto.strokeStyle = '#286f97'; contexto.lineWidth = 2; contexto.beginPath();
  for (let valor = -4; valor <= 4; valor += 0.05) { const x = escalaX(valor); const y = 360 - densidad(valor) * 600; if (valor === -4) contexto.moveTo(x, y); else contexto.lineTo(x, y); }
  contexto.stroke();
  contexto.fillStyle = '#b9d8ee'; contexto.fillRect(escalaX(z), 310, 760 - escalaX(z), 50); contexto.fillRect(60, 310, escalaX(-z) - 60, 50);
  contexto.fillStyle = '#216382'; contexto.beginPath(); contexto.arc(escalaX(z), 360 - densidad(z) * 600, 7, 0, Math.PI * 2); contexto.fill();
}

45.16 Errores frecuentes

  • Interpretar p como la probabilidad de que H₀ sea verdadera.
  • Usar p como medida del tamaño del efecto.
  • Creer que p grande prueba que no hay efecto.
  • Elegir α después de observar los datos.
  • Ignorar múltiples comparaciones y análisis exploratorios.
  • Reportar solo “significativo” sin estimación, intervalo ni contexto.

45.17 Qué debes recordar

El valor p mide la extremidad de los datos bajo H₀.
Se compara con α para una decisión formal, pero no mide la verdad de H₀, el tamaño del efecto ni la importancia práctica. Debe acompañarse con estimaciones, intervalos y contexto.

45.18 Conclusión

Interpretar el valor p correctamente evita decisiones basadas en una única frontera numérica. La evidencia estadística se entiende mejor combinando p, tamaño del efecto, intervalo de confianza, calidad del diseño, potencia y relevancia práctica. Así, una prueba se convierte en una parte del razonamiento y no en una respuesta automática.