El valor p mide qué tan extremos serían los datos si la hipótesis nula fuera cierta. Su significado depende del modelo, el diseño y la pregunta estadística.
El valor p es la probabilidad, suponiendo verdadera la hipótesis nula H₀, de obtener un estadístico de prueba tan extremo como el observado o más.
El valor p se calcula bajo el modelo de H₀. No describe directamente la probabilidad de que H₀ sea verdadera.
Supongamos que H₀ afirma que una moneda es equilibrada. Si al repetir muchos lanzamientos obtenemos un resultado muy poco habitual bajo esa afirmación, el valor p será pequeño.
Un valor p pequeño indica incompatibilidad entre los datos y H₀, pero la conclusión también depende de la calidad de los datos y de si el modelo era razonable.
| Resultado | Decisión formal | Lectura |
|---|---|---|
| p ≤ α | Rechazar H₀ | La evidencia es suficientemente extrema bajo H₀. |
| p > α | No rechazar H₀ | No hay evidencia suficiente para rechazarla. |
El valor p no cambia porque α cambie; lo que cambia es la regla de decisión aplicada.
Una confusión frecuente es escribir “p = 0,03, por lo tanto hay un 3 % de probabilidad de que H₀ sea cierta”. Esa afirmación no corresponde a la definición frecuentista del valor p.
Para asignar probabilidades a hipótesis se necesita un modelo bayesiano con una distribución previa y una verosimilitud.
Un valor p pequeño puede aparecer con un efecto minúsculo si la muestra es muy grande. Un efecto importante puede producir un valor p grande si la muestra es pequeña o muy variable.
En una prueba bilateral se consideran resultados extremos en ambas direcciones. En una prueba unilateral solo se considera una dirección previamente definida.
Para el mismo estadístico, un valor p bilateral suele ser aproximadamente el doble del valor p unilateral cuando la observación está en la dirección planteada.
Decir que un resultado es estadísticamente significativo significa que p es menor o igual que el α elegido. No significa que el resultado sea grande, importante o causal.
La etiqueta “significativo” depende del umbral establecido y no debe reemplazar la comunicación del valor p, el efecto y su intervalo.
Un resultado p = 0,049 y otro p = 0,051 no representan realidades científicas completamente opuestas. Una frontera rígida puede ocultar que la evidencia cambia de manera gradual.
Conviene informar el valor p con precisión razonable y describir la incertidumbre, en lugar de usar únicamente “pasó” o “no pasó” un umbral.
Cuando p es mayor que α, no se rechaza H₀. Esto indica que los datos no aportan evidencia suficiente bajo el criterio elegido.
No demuestra que H₀ sea cierta. Para evaluar si los datos son compatibles con efectos pequeños o relevantes, son más informativos el intervalo de confianza y el análisis de potencia.
Si se realizan muchas pruebas, aumenta la probabilidad de obtener al menos un valor p pequeño por azar aunque todas las hipótesis nulas sean ciertas.
Algunas estrategias son definir las hipótesis antes de mirar los datos, corregir por multiplicidad, controlar la tasa de falsos descubrimientos y validar resultados en nuevos datos.
Probar muchos análisis y reportar solo el que produce p pequeño, detener la recolección cuando aparece significancia o cambiar la hipótesis después de ver el resultado puede inflar la tasa de falsos positivos.
La transparencia sobre análisis planificados y exploratorios mejora la credibilidad.
Con n grande, el error estándar suele disminuir y diferencias pequeñas pueden generar valores p reducidos. Con n pequeño, una diferencia real puede no alcanzar significancia.
El valor p debe acompañarse con n, estimación, intervalo y unidades para evaluar la relevancia completa.
Una redacción clara puede ser:
Esta forma informa evidencia, magnitud y precisión sin convertir p en una medida de verdad.
Este ejemplo toma un valor p y un nivel α, aplica la regla de decisión y muestra la región extrema en un gráfico. El canvas permanece oculto hasta ejecutar.
const valorP = 0.03;
const alfa = 0.05;
const tipo = 'bilateral';
const rechazar = valorP <= alfa;
console.log('Valor p:', valorP);
console.log('Alfa:', alfa);
console.log(rechazar ? 'Rechazar H0' : 'No rechazar H0');
if (typeof document !== 'undefined') {
const canvas = document.getElementById('canvasPCodigo');
const contexto = canvas.getContext('2d');
const valores = { 0.40: 0.84, 0.10: 1.645, 0.05: 1.96, 0.03: 2.17, 0.01: 2.576 };
const z = valores[valorP] || 2.17;
const escalaX = valor => 60 + (valor + 4) / 8 * 700;
const densidad = valor => Math.exp(-valor * valor / 2) / Math.sqrt(2 * Math.PI);
contexto.clearRect(0, 0, canvas.width, canvas.height);
contexto.strokeStyle = '#286f97'; contexto.lineWidth = 2; contexto.beginPath();
for (let valor = -4; valor <= 4; valor += 0.05) { const x = escalaX(valor); const y = 360 - densidad(valor) * 600; if (valor === -4) contexto.moveTo(x, y); else contexto.lineTo(x, y); }
contexto.stroke();
contexto.fillStyle = '#b9d8ee'; contexto.fillRect(escalaX(z), 310, 760 - escalaX(z), 50); contexto.fillRect(60, 310, escalaX(-z) - 60, 50);
contexto.fillStyle = '#216382'; contexto.beginPath(); contexto.arc(escalaX(z), 360 - densidad(z) * 600, 7, 0, Math.PI * 2); contexto.fill();
}Interpretar el valor p correctamente evita decisiones basadas en una única frontera numérica. La evidencia estadística se entiende mejor combinando p, tamaño del efecto, intervalo de confianza, calidad del diseño, potencia y relevancia práctica. Así, una prueba se convierte en una parte del razonamiento y no en una respuesta automática.