Probabilidad y Estadística · Tema 15

Ley de los Grandes Números

Por qué más réplicas estabilizan el promedio: enunciado, condiciones, qué garantiza y qué no, y cómo se ve converger en Python.

01 · Punto de partida

El promedio se calma con volumen

Con 10 tiradas el promedio del dado salta entre 2,5 y 4,5. Con 10000 se clava en 3,5. La Ley de los Grandes Números garantiza eso: el promedio muestral x̄ₙ converge a μ cuando n crece, si las réplicas son independientes con igual media y varianza finita.

Es el teorema que sostiene todo el curso: justifica estimar probabilidades con frecuencias, esperados con promedios y decisiones con réplicas (temas 40 a 43).

  • ¿Cuántas réplicas para que x̄ se estabilice?
  • ¿Qué tan cerca de μ está x̄ con este N?
  • ¿Vale para frecuencias (p) y para promedios (μ)?
  • ¿Qué puede salir mal si las réplicas no son equivalentes?

02 · Definición

Enunciado operativo

x̄→μ

Promedios

Xᵢ independientes, misma μ, varianza finita: el promedio de n se pega a μ. Aplica a tiempos, demandas, costos.

f→p

Frecuencias

Caso 0/1: la frecuencia de éxitos tiende a p. Es la versión Bernoulli, la más usada en métricas «tasa de…».

1/√n

Velocidad

El error típico cae como σ/√n: para 10× precisión hacen falta 100× datos. Convergencia segura pero lenta.

Dado (μ = 3,5, σ ≈ 1,71): error típico por N.
N30300300030000
σ/√N0,310,100,030,01
Lecturasalta décimas±0,2±0,06clavado

03 · Condiciones y límites

Cuándo vale y qué no promete

Lo que garantiza

Estabilidad con N

Con réplicas independientes e igual distribución, x̄ se acerca a μ y se queda ahí. Más N, abanico más angosto.

Lo que no promete

Compensación ni velocidad

No «compensa» rachas (falacia del jugador), no dice cuán rápido para tu σ, no corrige sesgos del modelo.

Independencia
Réplicas que no se afectan. Si comparten semilla, historia o congestión, la ley no aplica directo.
Igual distribución
Mismo mecanismo cada vez. Si cambia el escenario a mitad, son dos experimentos.
Media finita
Sin E definido no hay a qué converger. Colas extremas piden otro análisis.
Sesgo
La ley estabiliza en E del modelo, no en la verdad: modelo sesgado converge a número equivocado.

04 · Ejemplos

Dónde la invocás sin darte cuenta

N chico: salta→N grande: se pega→Decide
  1. 1
    Dado.

    x̄ de 30 salta; de 30000 es 3,5. Referencia de manual.

  2. 2
    Conversión.

    Con 100 visitas la tasa salta ±5 puntos; con 10000 se define el dígito.

  3. 3
    Quiebre.

    P̂ con 200 réplicas orienta; con 5000 publica.

  4. 4
    Espera.

    Promedio de 1 día engaña; de 30 días dimensiona personal.

  5. 5
    Juego.

    Balance con 100 peleas es anécdota; con 20000 es estadística.

05 · Representación en Python

Ver converger el promedio del dado

Python en tu navegador. Compará N = 30 contra 30000.

import random
random.seed(151)

def promedio(n):
    return sum(random.randint(1, 6) for _ in range(n)) / n

for n in [30, 300, 3000, 30000]:
    print(n, round(promedio(n), 3))

Consejo: ejecutá dos veces con distinta semilla: con 30 difieren décimas, con 30000 centésimas.

Frecuencia que tiende a p

import random
random.seed(16)

# P(suma>=9)=10/36 ≈ 0.278
for n in [50, 500, 5000]:
    ex = sum(1 for _ in range(n) if random.randint(1,6)+random.randint(1,6) >= 9)
    print(n, round(ex/n, 3))

06 · Exploración

Laboratorio: 5 promedios persiguen 3,5

Cada curva es el promedio acumulado de un dado en N tiradas (5 réplicas). La recta blanca es μ = 3,5; la banda es ±σ/√n con σ ≈ 1,71: el abanico teórico donde deben vivir las curvas.

EXPERIMENTO 15

x̄(n) → 3,5

banda ± 1,71/√n

Los resultados numéricos aparecen debajo.
x̄ final (promedio réplicas)0,00
Error |x̄−3,5|0,00
Rango final0,00
Banda ±σ/√N0,00

Con N grande, las 5 curvas entran en la banda.

Eje y fijo 2,5 a 4,5 para ver el salto. En log se aprecia la estabilización temprana; en lineal, el detalle final.

Preguntas para explorar

  1. Con N = 50, ¿alguna curva está fuera de la banda? ¿Es grave?
  2. Pasá a N = 5000. ¿Entran todas? ¿Cuánto vale el rango final?
  3. Si σ fuera doble, ¿la banda sería más ancha o angosta? ¿Qué N pedirías?
Ver respuestas sugeridas
  1. Sí, alguna se escapa: con N chico la banda es ancha pero el ruido es mayor. No es grave, es esperado.
  2. Sí, rango de centésimas (~0,05). Ahí ya se publica el promedio.
  3. Más ancha (σ/√N): para igual banda harían falta 4× datos.

07 · Comprensión

Confusiones frecuentes

«Después de racha mala, toca buena»

No: independencia intacta. La ley habla del promedio con N grande, no del próximo tiro.

«Con 100 ya converge siempre»

Depende de σ: 100 alcanza para el dado, no para colas raras o σ grande. La banda σ/√N manda.

«Converge al valor verdadero»

Converge a μ del modelo. Si el modelo está sesgado, converge al sesgo con total seguridad.

«Más N arregla dependencia»

No: si las réplicas se copian (misma semilla, misma historia), más N repite el mismo error.

08 · Práctica guiada

Ejercicios con Python

Ejercicio 1: banda del dado

Calculá σ/√N para N = 100 y 10000 (σ = 1,71) y verificá que x̄ cae dentro con 5 réplicas.

import random
print("banda100:", round(1.71/100**0.5, 3), "| banda10000:", round(1.71/10000**0.5, 4))
for s in range(5):
    random.seed(s)
    print(s, round(sum(random.randint(1,6) for _ in range(10000))/10000, 3))
Ver solución razonada

Bandas 0,171 y 0,017. Con 10000 todas caen en 3,5 ± 0,05: la teoría anticipa el ruido que la sim confirma.

Ejercicio 2: N para ±0,01

¿Qué N pide el dado para banda 0,01? Verificalo estimando con ese N.

# sigma/sqrt(N) = 0.01 → N = (1.71/0.01)^2 ≈ 29241
import random
random.seed(99)
N = 29241
print(round(sum(random.randint(1,6) for _ in range(N))/N, 4))
Ver solución

N ≈ 30000. Cuesta 100× pasar de ±0,1 a ±0,01: la precisión decimal se paga cuadrática.

Ejercicio 3: frecuencia de cola

Estimá P(suma = 12) = 1/36 con N = 500 y 50000. ¿Converge igual que la media?

Ver una posible respuesta
import random
for N, s in [(500, 3), (50000, 3)]:
    random.seed(s)
    print(N, sum(1 for _ in range(N) if random.randint(1,6)+random.randint(1,6)==12)/N)

Sí, pero más lento en relativo: con 500 puede dar 0 o el doble; con 50000 se pega a 0,0278. Las colas raras convergen en absoluto, no en relativo.

09 · Síntesis

Ideas para recordar

  • x̄ₙ → μ y fₙ → p con réplicas independientes e igual distribución.
  • El error típico es σ/√N: cuadruplicar N parte el error a la mitad.
  • No hay compensación: el pasado no empuja el futuro.
  • La ley estabiliza en el modelo, no corrige sesgos.
  • Graficar x̄(n) con su banda es el test visual de N suficiente.

En el próximo tema acotaremos sin suponer forma: desigualdad de Chebyshev.