01 · Punto de partida
Comparar es restar con error
A = 121, B = 124 no dice nada sin R y s. Comparar es estimar D = B − A con su intervalo: si el 0 queda fuera, hay ganador estadístico; si queda dentro, empate técnico aunque el punto difiera.
Con muestras comunes (mismas semillas) la diferencia se afina sin más R: el ruido compartido se cancela.
- ¿D = B − A con qué intervalo 95 %?
- ¿El 0 está dentro o fuera?
- ¿Usé mismas semillas para afinar?
- ¿La diferencia es relevante en plata/tiempo, no solo significativa?
02 · Definición
Diferencia con intervalo
Independientes
SE(D) = √(sA²/RA + sB²/RB). R iguales y s parecidas: SE ≈ s·√(2/R).
Apareadas
Mismas semillas: Dᵢ = Bᵢ − Aᵢ por réplica, SE = sD/√R. Suele pedir mitad de R.
Veredicto
0 fuera → significativo. 0 dentro → empate. Relevante = supera umbral práctico (plata, minutos).
| D | 3 | 1 | 0,5 |
|---|---|---|---|
| Intervalo | [0,8–5,2] gana | [−1,2–3,2] empate | empate |
03 · Diseño que afina
Mismas semillas, mitad de R
Independiente
Semillas distintas
Simple pero ruidoso: el azar distinto en A y B infla SE(D). Pide más R.
Apareado
Mismas semillas
Mismas demandas en A y B: lo común se cancela y D muestra el efecto puro del escenario.
- Práctica vs estadística
- D = 0,3 significativo con R enorme puede ser irrelevante en plata. Umbral práctico primero.
- Solape
- Intervalos A/B solapados no deciden: el de D sí. Comparar D, no ojos.
- Múltiple
- Comparar 5 escenarios infla falsos ganadores: ajustar (Bonferroni) o pre-registrar duelos.
- Proporciones
- D = p̂B − p̂A con SE = √(pA(1−pA)/RA + pB(1−pB)/RB). Tasas se comparan igual.
04 · Ejemplos
Duelos que se fallan con D
- 1Stock.
115 vs 125: D = +8 ± 6 gana 125. Con ±10 empatan: más R.
- 2Cajeros.
2 vs 3: D espera = −2,5 ± 0,5 gana 3. Relevante en SLA.
- 3Promo.
0,12 vs 0,15 ± 0,02: B gana y es plata (tema 33).
- 4Precio.
D = +1 ± 3: empate estadístico aunque el punto gane.
- 5Juego.
Balance A/B con 20000 peleas: D = 1 % ± 0,3 % gana sin discusión.
05 · Representación en Python
Diferencia apareada en 6 líneas
Python en tu navegador. Mismas Ds: el ruido se cancela.
import random, statistics, math
random.seed(431)
Ds = [random.uniform(80,140) for _ in range(300)]
A = [10*min(115,d)-6*115 for d in Ds]
B = [10*min(125,d)-6*125 for d in Ds]
D = [b-a for a,b in zip(A,B)]
m = statistics.mean(D); se = statistics.stdev(D)/math.sqrt(len(D))
print(round(m,1), "±", round(1.96*se,1))
Consejo: con semillas distintas el ± duplica: probá generar Ds separadas para A y B.
Proporciones A/B
import math
pA, pB, n = 0.12, 0.15, 2000
se = math.sqrt(pA*(1-pA)/n + pB*(1-pB)/n)
print(round(pB-pA,3), "±", round(1.96*se,3))
06 · Exploración
Laboratorio: duelo A(120) vs B(120+δ)
A ~ N(120, 8), B ~ N(120+δ, 8), R por brazo. Barras = medias ± 95 %; abajo D con su intervalo vs 0. Mové δ y R: con δ = 1 y R = 30 empatan; con R = 400 ganan.
D = B − A ± 1,96·SE
0 fuera = gana · dentro = empate
Con δ = 3 y R = 100, D ≈ 3 ± 2,2: gana B.
Arriba medias con intervalos; abajo diferencia con cero. Apareado angosta el intervalo ~40 %.
Preguntas para explorar
- Con δ = 1 y R = 30, ¿gana alguien? ¿Y con R = 500?
- Con δ = 0, ¿cuántas veces «gana» uno de 20 repeticiones? ¿Por qué 5 %?
- ¿Qué cambia a apareado con δ = 1 y R = 100?
Ver respuestas sugeridas
- No (intervalo ±4 tapa); sí con 500 (±1): la misma D pasa de ruido a señal con R.
- ~1 de 20: el 5 % de falsos del 95 %. Significancia no es certeza.
- El intervalo se angosta ~40 % y puede decidir sin más R: muestras comunes afinan gratis.
07 · Comprensión
Confusiones frecuentes
«Medias distintas ya ganan»
No sin intervalo: 124 vs 121 con ±4 empatan. El punto no decide, D ± E sí.
«Solape leve es empate seguro»
El test de D es más fino que ojos en solape: D puede excluir 0 con solape parcial.
«Significativo es importante»
Con R enorme todo es significativo. Relevancia = supera umbral práctico (plata, minutos).
«5 duelos al 95 % dan 95 % conjunto»
No: 1−0,95⁵ ≈ 23 % de algún falso. Ajustar o pre-registrar el duelo principal.
08 · Práctica guiada
Ejercicios con Python
Ejercicio 1: D con R = 100
A N(120,8), B N(123,8), R = 100. ¿D ± E? ¿Gana B?
import random, statistics, math
random.seed(431)
A = [random.gauss(120,8) for _ in range(100)]
B = [random.gauss(123,8) for _ in range(100)]
D = statistics.mean(B)-statistics.mean(A)
se = math.sqrt(statistics.variance(A)/100+statistics.variance(B)/100)
print(round(D,2), "±", round(1.96*se,2))
Ver solución razonada
D ≈ 3 ± 2,2: el 0 queda fuera → gana B al 95 %. Con R = 30 daría ±4 y empataría.
Ejercicio 2: apareado afina
Con las Ds comunes del bloque Python (stock 115/125), ¿E apareado vs independiente?
import statistics, math
# D ya calculada arriba como apareada; comparar con SE independiente aproximado
print("apareado usa s(D)/√R: menor que √(sA²+sB²)/√R")
Ver solución
Apareado ~40 % más angosto aquí: las mismas demandas cancelan el azar común y dejan el efecto puro del stock.
Ejercicio 3: relevancia
D = +0,4 ± 0,2 con umbral práctico 1. ¿Gana? ¿Y con D = +2 ± 0,5?
Ver una posible respuesta
print("D=0.4: significativo pero irrelevante (<1)")
print("D=2: significativo y relevante")
Significancia sin relevancia no compra nada. El umbral práctico va antes del test.
09 · Síntesis
Ideas para recordar
- Comparar = D ± 1,96·SE(D). 0 fuera gana; dentro empata.
- Apareado (mismas semillas) afina sin más R.
- Solape de A/B no decide; intervalo de D sí.
- Relevancia práctica antes que significancia.
- Informar D + rango + método + R.
En el próximo tema cerraremos con casos reales: aplicaciones prácticas en simulación.