01 · Punto de partida
No medís todo: medís bien una parte
La población es todo lo que te interesa (todas las atenciones del mes); la muestra es la parte que medís (300 atenciones). Si es aleatoria y con n suficiente, su media estima μ con error σ/√n. Si es cómoda o chica, estima con sesgo o ruido.
En simulación, cada conjunto de réplicas es una muestra del modelo: el mismo marco decide cuántas corridas pedir (tema 41).
- ¿Cuál es la población exacta (qué, dónde, cuándo)?
- ¿Cada elemento tuvo igual chance de salir?
- ¿n alcanza para el error que necesito?
- ¿La muestra cubre estratos (pico/valle, sucursales)?
02 · Definición
Población, muestra y marco
Población
Conjunto completo con μ y σ (casi siempre desconocidos). Se define por alcance temporal y espacial.
Muestra aleatoria
n sorteos independientes de la población. Cada uno con igual chance: sin a dedo ni por comodidad.
Estadísticos
Media y desvío muestrales estiman μ y σ. Con n grande y aleatoriedad, se pegan (temas 15 y 32).
| n | 9 | 25 | 100 | 400 |
|---|---|---|---|---|
| σ/√n | 3,33 | 2 | 1 | 0,5 |
03 · Métodos
Cómo muestrear sin sesgar
Que sí representan
Aleatorio y estratificado
Simple: sorteo puro. Estratificado: sorteo dentro de cada tramo (pico/valle) con su peso. El segundo rinde más con picos.
Que sesgan
Conveniencia y juicio
Lo accesible, lo voluntario, «clientes típicos» a ojo. Rápidos y baratos… y sesgados (tema 27).
- Aleatorio simple
- Cada elemento igual chance. Base teórica; exige marco completo.
- Estratificado
- Se parte en estratos y se sortea en cada uno proporcional. Ideal con picos.
- Sistemático
- Cada k-ésimo (cada 10.º cliente). Vale si no hay periodicidad escondida.
- Tamaño
- n se calcula del margen deseado (tema 42), no del presupuesto de tiempo.
04 · Ejemplos
Muestras que calibran
- 1Atención.
300 tiempos sorteados del mes → μ y σ del servicio.
- 2Llegadas.
60 horas estratificadas pico/valle → λ por tramo.
- 3Conversión.
2000 visitas → p con ±2 puntos (tema 33).
- 4Réplicas.
500 corridas del simulador → media del escenario.
- 5Calidad.
50 piezas por lote → tasa de falla del lote.
05 · Representación en Python
Sortear y estimar
Python en tu navegador. Compará n = 9 contra 400.
import random, statistics
random.seed(281)
pob = [random.gauss(50, 10) for _ in range(20000)]
for n in [9, 100]:
m = random.sample(pob, n)
print(n, "x̄:", round(statistics.mean(m), 2), "| s:", round(statistics.stdev(m), 2))
Consejo: random.sample es sin reposición (muestra real); choices es con reposición (réplicas del modelo).
Estratificar picos
import random
random.seed(6)
# 75% valle lam=6, 25% pico lam=14 → ponderar, no promediar simple
valle = [6]*75
pico = [14]*25
print("media ponderada:", sum(valle+pico)/len(valle+pico))
06 · Exploración
Laboratorio: medias que se angostan con n
Población N(50, 10). Tomamos 500 muestras de tamaño n y graficamos sus medias: histograma vs campana teórica N(50, 10/√n). Subí n y mirá cómo se angosta.
Distribución de x̄
x̄ ~ N(μ, σ/√n)
Con n = 25, SE = 2: el 95 % de las medias cae en 50 ± 4.
Eje x 38 a 62. La curva blanca es la teórica; las barras/puntos, las 500 medias simuladas.
Preguntas para explorar
- Con n = 4, ¿qué ancho tiene el histograma? ¿Y con n = 100?
- ¿La media de medias se acerca a 50 en ambos? ¿Qué cambia: centro o ancho?
- ¿Qué n pedirías para SE = 0,5? Verificá en el laboratorio.
Ver respuestas sugeridas
- SE 5 vs 1: el segundo es 5× más angosto. n manda el ancho, no el centro.
- Ambas centran en 50 (insesgado); cambia el ancho. Aleatoriedad centra, n afina.
- n = 400 (10/√n = 0,5). Cuesta 16× pasar de n = 25 a 400 para 4× precisión.
07 · Comprensión
Confusiones frecuentes
«n grande arregla muestra cómoda»
No: centra mejor el sesgo. 10000 cómodos estiman el sesgo con precisión quirúrgica.
«La media muestral es μ»
La estima con error σ/√n. Informar x̄ sin n ni s esconde la precisión.
«Estratificar complica»
Simplifica el error: con picos, estratificar rinde más que agrandar n a ciegas.
«Réplicas y muestras son distintas»
Mismo marco: R réplicas son muestra de tamaño R del modelo. Todo lo de aquí aplica (tema 41).
08 · Práctica guiada
Ejercicios con Python
Ejercicio 1: SE a mano
Con σ = 10, calculá SE para n = 25 y 100. Verificá con 500 medias simuladas.
import random, statistics
random.seed(281)
for n in [25, 100]:
medias = [statistics.mean(random.gauss(50,10) for _ in range(n)) for _ in range(500)]
print(n, "SE sim:", round(statistics.stdev(medias), 2), "| teo:", round(10/n**0.5, 2))
Ver solución razonada
2 y 1: la sim calca σ/√n. Así se valida el N antes de medir en serio.
Ejercicio 2: n para margen
¿n para estimar μ ± 1 con 95 % (z ≈ 2) si σ = 10? Fórmula n = (2·10/1)².
print("n:", (2*10/1)**2)
Ver solución
n = 400. Precisión de 1 punto en escala σ = 10 cuesta cientos: planificar evita medir de menos.
Ejercicio 3: estratificar
Día 75 % valle (μ = 6) y 25 % pico (μ = 14). ¿Media ponderada? ¿Y el error de promediar simple 50/50?
Ver una posible respuesta
print("ponderada:", 0.75*6+0.25*14, "| simple:", (6+14)/2)
8 vs 10: el simple sesga +2. Estratificar con pesos reales corrige.
09 · Síntesis
Ideas para recordar
- Población (μ, σ) vs muestra (x̄, s, n).
- Aleatoria + estratificada por picos; conveniencia sesga.
- SE = σ/√n: n manda el ancho, aleatoriedad el centro.
- En Python:
samplesin reposición,choicescon reposición. - R réplicas = muestra del modelo: mismo cálculo de N.
En el próximo tema graficaremos la muestra: histogramas.