La ciencia de datos convierte observaciones en conclusiones y decisiones. La probabilidad permite cuantificar incertidumbre, estudiar muestras, comparar modelos y comunicar cuánto pueden variar los resultados.
Un conjunto de datos observado es una realización de un proceso que podría producir otros valores. Pensar en la población y en el mecanismo de muestreo ayuda a distinguir patrones reales de variaciones accidentales.
Una muestra debe reflejar la población objetivo para que sus conclusiones sean transferibles. El muestreo aleatorio simple asigna una probabilidad conocida a cada unidad.
El tamaño de una muestra no corrige por sí solo un sesgo de selección: una muestra grande y sesgada puede ser menos útil que una muestra menor y representativa.
Un parámetro describe la población, como μ o p. Un estadístico se calcula con la muestra, como X̄ o la proporción observada. El estadístico se trata como variable aleatoria antes de observar los datos.
La distribución muestral describe cómo variaría un estadístico si repitiéramos el muestreo muchas veces. Es la base para errores estándar, intervalos y pruebas.
Una distribución de los datos individuales no es lo mismo que la distribución del promedio o de otro estadístico.
El bootstrap aproxima la distribución de un estadístico remuestreando con reemplazo desde la muestra observada. Cada remuestra tiene el mismo tamaño que la muestra original.
La variabilidad entre remuestras permite estimar errores e intervalos cuando una fórmula teórica es difícil.
Un intervalo de confianza combina un estimador y una medida de incertidumbre. En el uso frecuentista, un procedimiento de confianza del 95% cubre el parámetro en aproximadamente 95% de muestras repetidas bajo sus supuestos.
No significa que, después de calcular un intervalo concreto, el parámetro tenga una probabilidad frecuentista de 95% de estar dentro.
Dos variables pueden moverse juntas por azar, por una causa común o porque una influye en la otra. La probabilidad ayuda a modelar asociaciones, pero observar una correlación no prueba causalidad.
Experimentos aleatorizados, diseños cuidadosos y modelos causales aportan información adicional.
Los valores faltantes no siempre son aleatorios. Si la ausencia depende de la variable estudiada o de otra característica, eliminar filas puede introducir sesgo.
El mecanismo de ausencia, la imputación y la sensibilidad de las conclusiones deben documentarse.
Este código calcula un promedio bootstrap para una muestra pequeña:
function promedioBootstrap(datos, repeticiones) {
const resultados = [];
for (let r = 0; r < repeticiones; r++) {
let suma = 0;
for (let i = 0; i < datos.length; i++) {
const indice = Math.floor(Math.random() * datos.length);
suma += datos[indice];
}
resultados.push(suma / datos.length);
}
return resultados;
}
console.log(promedioBootstrap([4, 5, 6, 7, 8], 1000));Pulsa Ejecutar para generar promedios remuestreados.
Observa cómo cambia la distribución del promedio al remuestrear los datos. El punto rojo marca el promedio original.
La incertidumbre no proviene solo del azar del muestreo. Errores de medición, duplicados, etiquetas incorrectas, cambios de definición y registros no representativos también afectan el análisis.
El preprocesamiento debe conservar la trazabilidad para conocer qué transformaciones se aplicaron.
Un modelo aprende una relación en datos históricos y se evalúa en datos nuevos. La probabilidad de acierto estimada depende de cómo se dividieron los datos y de si la distribución futura será similar.
La validación cruzada y los intervalos de rendimiento ayudan a expresar esta variabilidad.
En una prueba A/B se asignan unidades a dos alternativas y se compara un resultado. La asignación aleatoria ayuda a equilibrar factores de confusión, pero el tamaño de muestra y la duración deben permitir detectar efectos relevantes.
Revisar muchos resultados hasta encontrar uno significativo aumenta el riesgo de falsos positivos.
La probabilidad se aplica en encuestas, experimentos A/B, análisis de clientes, detección de anomalías, predicción de demanda, evaluación de modelos, control de calidad y análisis de riesgos.
La probabilidad convierte una colección de datos en evidencia cuantificada. Una buena ciencia de datos no solo calcula una predicción: explica de dónde proviene, cuánto puede variar y bajo qué condiciones es razonable.