58. Probabilidad aplicada a ciencia de datos

La ciencia de datos convierte observaciones en conclusiones y decisiones. La probabilidad permite cuantificar incertidumbre, estudiar muestras, comparar modelos y comunicar cuánto pueden variar los resultados.

58.1 Datos como observaciones aleatorias

Un conjunto de datos observado es una realización de un proceso que podría producir otros valores. Pensar en la población y en el mecanismo de muestreo ayuda a distinguir patrones reales de variaciones accidentales.

PoblaciónConjunto conceptual de interés.
MuestraObservaciones disponibles.
VariableCaracterística medida.
IncertidumbreVariación de posibles resultados.

58.2 Muestreo representativo

Una muestra debe reflejar la población objetivo para que sus conclusiones sean transferibles. El muestreo aleatorio simple asigna una probabilidad conocida a cada unidad.

estimador=función de los datos observados

El tamaño de una muestra no corrige por sí solo un sesgo de selección: una muestra grande y sesgada puede ser menos útil que una muestra menor y representativa.

58.3 Estadístico y parámetro

Un parámetro describe la población, como μ o p. Un estadístico se calcula con la muestra, como X̄ o la proporción observada. El estadístico se trata como variable aleatoria antes de observar los datos.

estimador puntual + incertidumbre = información estadística útil

58.4 Distribución muestral

La distribución muestral describe cómo variaría un estadístico si repitiéramos el muestreo muchas veces. Es la base para errores estándar, intervalos y pruebas.

Una distribución de los datos individuales no es lo mismo que la distribución del promedio o de otro estadístico.

58.5 Bootstrap

El bootstrap aproxima la distribución de un estadístico remuestreando con reemplazo desde la muestra observada. Cada remuestra tiene el mismo tamaño que la muestra original.

muestra bootstrap: seleccionar n observaciones con reemplazo

La variabilidad entre remuestras permite estimar errores e intervalos cuando una fórmula teórica es difícil.

58.6 Intervalos de confianza

Un intervalo de confianza combina un estimador y una medida de incertidumbre. En el uso frecuentista, un procedimiento de confianza del 95% cubre el parámetro en aproximadamente 95% de muestras repetidas bajo sus supuestos.

No significa que, después de calcular un intervalo concreto, el parámetro tenga una probabilidad frecuentista de 95% de estar dentro.

58.7 Correlación y causalidad

Dos variables pueden moverse juntas por azar, por una causa común o porque una influye en la otra. La probabilidad ayuda a modelar asociaciones, pero observar una correlación no prueba causalidad.

Experimentos aleatorizados, diseños cuidadosos y modelos causales aportan información adicional.

58.8 Datos faltantes

Los valores faltantes no siempre son aleatorios. Si la ausencia depende de la variable estudiada o de otra característica, eliminar filas puede introducir sesgo.

El mecanismo de ausencia, la imputación y la sensibilidad de las conclusiones deben documentarse.

58.9 Ciencia de datos en JavaScript

Este código calcula un promedio bootstrap para una muestra pequeña:

function promedioBootstrap(datos, repeticiones) {
  const resultados = [];
  for (let r = 0; r < repeticiones; r++) {
    let suma = 0;
    for (let i = 0; i < datos.length; i++) {
      const indice = Math.floor(Math.random() * datos.length);
      suma += datos[indice];
    }
    resultados.push(suma / datos.length);
  }
  return resultados;
}

console.log(promedioBootstrap([4, 5, 6, 7, 8], 1000));

Pulsa Ejecutar para generar promedios remuestreados.

58.10 Laboratorio bootstrap

Observa cómo cambia la distribución del promedio al remuestrear los datos. El punto rojo marca el promedio original.

Distribución bootstrap

Bootstrap de un promedioDistribución de promedios remuestreados.

58.11 Calidad de datos

La incertidumbre no proviene solo del azar del muestreo. Errores de medición, duplicados, etiquetas incorrectas, cambios de definición y registros no representativos también afectan el análisis.

El preprocesamiento debe conservar la trazabilidad para conocer qué transformaciones se aplicaron.

58.12 Modelos predictivos

Un modelo aprende una relación en datos históricos y se evalúa en datos nuevos. La probabilidad de acierto estimada depende de cómo se dividieron los datos y de si la distribución futura será similar.

La validación cruzada y los intervalos de rendimiento ayudan a expresar esta variabilidad.

58.13 Pruebas A/B

En una prueba A/B se asignan unidades a dos alternativas y se compara un resultado. La asignación aleatoria ayuda a equilibrar factores de confusión, pero el tamaño de muestra y la duración deben permitir detectar efectos relevantes.

Revisar muchos resultados hasta encontrar uno significativo aumenta el riesgo de falsos positivos.

58.14 Aplicaciones

La probabilidad se aplica en encuestas, experimentos A/B, análisis de clientes, detección de anomalías, predicción de demanda, evaluación de modelos, control de calidad y análisis de riesgos.

58.15 Errores frecuentes

  • Confundir correlación con causalidad.
  • Usar una muestra sesgada y compensarlo solo aumentando su tamaño.
  • Interpretar un intervalo concreto como una probabilidad posterior automática.
  • Ignorar datos faltantes no aleatorios.
  • Evaluar un modelo con los mismos datos usados para ajustarlo.
  • Reportar muchos decimales sin considerar el error de medición.

58.16 Qué debes recordar y conclusión

estadístico=función de una muestra
bootstrap≈remuestreo con reemplazo
conclusión=estimación + incertidumbre + supuestos

La probabilidad convierte una colección de datos en evidencia cuantificada. Una buena ciencia de datos no solo calcula una predicción: explica de dónde proviene, cuánto puede variar y bajo qué condiciones es razonable.

Volver al índice