46. Estadística aplicada a ciencia de datos

La ciencia de datos utiliza estadística para convertir observaciones en decisiones: conocer los datos, cuantificar la incertidumbre, validar conclusiones y comunicar resultados reproducibles.

46.1 El papel de la estadística

La estadística aporta herramientas para describir datos, detectar patrones, estimar cantidades desconocidas, comparar grupos y evaluar predicciones. La programación permite automatizar estos procesos, pero no reemplaza el razonamiento sobre el diseño y el contexto.

Un análisis técnicamente sofisticado puede ser inútil si mide la variable equivocada o responde una pregunta distinta de la que importa.

46.2 El ciclo de un análisis

  1. Definir la pregunta y la población objetivo.
  2. Obtener datos con un procedimiento documentado.
  3. Revisar calidad, tipos, faltantes y duplicados.
  4. Explorar distribuciones, relaciones y subgrupos.
  5. Construir un modelo o una comparación.
  6. Validar, comunicar limitaciones y reproducir.

46.3 Población y unidad de análisis

Antes de calcular una métrica hay que establecer qué representa una fila y cuál es la población. Una fila puede ser una persona, una sesión, una compra o un día.

Si se mezclan unidades, por ejemplo compras individuales con usuarios, las medias y conteos pueden duplicar ciertos casos y producir conclusiones engañosas.

46.4 Calidad de datos

Completitud¿Qué proporción de valores está ausente?
Validez¿Los valores respetan rango y formato?
Consistencia¿Las columnas y fuentes coinciden?
Duplicación¿Hay registros repetidos o eventos contados dos veces?

La limpieza debe conservar un registro de las transformaciones. Cambiar datos sin documentarlo dificulta revisar y reproducir el análisis.

46.5 Estadística descriptiva

Las medidas de centro, dispersión y posición ayudan a conocer una variable. La media puede ser sensible a valores extremos; la mediana suele representar mejor una distribución asimétrica.

Una tabla de frecuencias, un histograma, un boxplot y medidas numéricas suelen complementarse: cada uno muestra una parte distinta de la información.

46.6 Análisis exploratorio

El análisis exploratorio busca comprender los datos antes de fijar un modelo. Conviene observar tendencias, grupos, relaciones no lineales, valores atípicos y cambios en el tiempo.

Explorar no autoriza a presentar cualquier patrón como confirmación. Las hipótesis descubiertas al explorar deben validarse con nuevos datos o un diseño posterior.

46.7 Laboratorio interactivo

Comparar métricas según el conjunto de datos

46.8 Valores faltantes

Los faltantes pueden aparecer por errores de carga, abandono, límites del instrumento o porque una variable no aplica. El tratamiento depende de por qué faltan y de cómo se relacionan con las demás variables.

Eliminar filas sin análisis puede reducir la muestra y crear sesgo. Imputar valores debe hacerse con un método justificado y registrarse como parte del pipeline.

46.9 Valores atípicos

Un valor atípico puede ser un error o una observación real poco frecuente. Las reglas automáticas ayudan a detectarlo, pero no deciden por sí solas qué hacer.

Conviene comparar métricas robustas y no robustas, revisar el registro original y analizar la influencia del caso en la conclusión.

46.10 Asociación y causalidad

Una correlación encontrada en una base de datos no prueba causalidad. Puede haber confusión, selección, causalidad inversa o una tendencia temporal compartida.

Las afirmaciones causales requieren diseño, temporalidad y control de variables. Un modelo predictivo puede ser útil aunque no represente un mecanismo causal.

46.11 División de datos

Cuando el objetivo es evaluar predicciones, no se debe medir el modelo en los mismos datos utilizados para ajustarlo. Se separan conjuntos de entrenamiento, validación y prueba, respetando el orden temporal cuando corresponde.

La separación evita confundir memoria de los datos con capacidad de generalización.

46.12 Métricas y objetivo

La métrica debe reflejar el costo del error. La media del error absoluto es interpretable en las unidades originales; el error cuadrático penaliza más los errores grandes; una proporción de aciertos puede ocultar clases minoritarias.

No existe una métrica universalmente mejor. La elección depende de la decisión que se desea tomar.

46.13 Incertidumbre y reproducibilidad

Una estimación debe acompañarse de su incertidumbre, mediante intervalos, remuestreo o validación. También conviene informar tamaño de muestra, filtros, transformaciones y versión de los datos.

Fijar semillas, conservar el código y automatizar el pipeline facilita obtener el mismo resultado y detectar cambios.

46.14 Comunicación de resultados

Un buen informe comienza con la pregunta y termina con una conclusión en unidades comprensibles. Debe mostrar el resultado principal, su incertidumbre, los supuestos y las limitaciones relevantes.

Resultado → evidencia → magnitud → incertidumbre → decisión

Los gráficos deben tener títulos, unidades, escalas honestas y una leyenda accesible.

46.15 Implementación en JavaScript

Este ejemplo calcula media, mediana y desviación estándar de una colección. El canvas aparece al ejecutar el código.

const datos = [12, 14, 15, 15, 16, 18, 19, 22, 35];
const media = datos.reduce((suma, valor) => suma + valor, 0) / datos.length;
const ordenados = [...datos].sort((a, b) => a - b);
const mediana = ordenados[Math.floor(ordenados.length / 2)];
const varianza = datos.reduce((suma, valor) => suma + (valor - media) ** 2, 0) / datos.length;
const desviacion = Math.sqrt(varianza);

console.log('Media:', media.toFixed(2));
console.log('Mediana:', mediana.toFixed(2));
console.log('Desviación estándar:', desviacion.toFixed(2));

if (typeof document !== 'undefined') {
  const canvas = document.getElementById('canvasDatosCodigo');
  const contexto = canvas.getContext('2d');
  const escalaX = valor => 60 + (valor - 10) / 30 * 700;
  contexto.clearRect(0, 0, canvas.width, canvas.height);
  contexto.strokeStyle = '#acd5c2'; contexto.lineWidth = 2;
  contexto.beginPath(); contexto.moveTo(60, 230); contexto.lineTo(760, 230); contexto.stroke();
  contexto.fillStyle = '#277d5d';
  datos.forEach(valor => { contexto.beginPath(); contexto.arc(escalaX(valor), 230, 8, 0, Math.PI * 2); contexto.fill(); });
  contexto.strokeStyle = '#d97726'; contexto.lineWidth = 3;
  contexto.beginPath(); contexto.moveTo(escalaX(media), 100); contexto.lineTo(escalaX(media), 350); contexto.stroke();
}

46.16 Errores frecuentes

  • Calcular una métrica sin definir la unidad de análisis.
  • Eliminar faltantes o atípicos sin investigar su origen.
  • Confundir correlación con causalidad.
  • Evaluar un modelo sobre los mismos datos usados para ajustarlo.
  • Elegir una métrica porque es habitual y no porque represente la decisión.
  • Comunicar un número sin incertidumbre ni limitaciones.

46.17 Qué debes recordar

La estadística aplicada empieza con una buena pregunta y datos bien definidos.
Explorar, medir, modelar y comunicar son etapas conectadas. La reproducibilidad, la incertidumbre y el contexto importan tanto como el cálculo.

46.18 Conclusión

La ciencia de datos necesita estadística para separar señales de ruido y transformar datos en evidencia. Programar el análisis permite repetirlo a escala, pero las decisiones sobre población, medición, sesgo, validación y comunicación siguen requiriendo criterio estadístico.