La estadística evolucionó desde el registro de poblaciones y recursos hasta convertirse en una herramienta esencial para la ciencia, la programación y las decisiones basadas en datos.
La necesidad de contar personas, tierras, cosechas e impuestos existe desde las primeras civilizaciones. Sin embargo, registrar cantidades no era todavía hacer estadística en el sentido actual: faltaban métodos para analizar los datos, comparar grupos y obtener conclusiones.
La estadística moderna se formó mediante la unión de tres elementos: la recolección sistemática de datos, el desarrollo de la teoría de la probabilidad y la creación de métodos matemáticos para estudiar la variación.
Con las computadoras, estos métodos pudieron aplicarse a volúmenes de datos cada vez mayores. Hoy forman parte del desarrollo de software, la ciencia de datos, la inteligencia artificial y muchas otras disciplinas.
En la Antigüedad, distintos gobiernos realizaban recuentos de población y bienes. Estos registros se utilizaban para organizar impuestos, distribuir tierras, planificar obras y conocer la cantidad de personas disponibles para los ejércitos.
Los censos y registros administrativos tenían una finalidad principalmente práctica. Su importancia histórica reside en haber establecido la idea de que una sociedad podía describirse mediante datos organizados.
La palabra estadística se relaciona precisamente con el estudio de asuntos del Estado. Con el tiempo, su significado se amplió mucho más allá de la administración pública.
En el siglo XVII comenzaron a analizarse registros de nacimientos y defunciones de manera sistemática. En 1662, el comerciante inglés John Graunt publicó un estudio de los registros de mortalidad de Londres.
Graunt agrupó datos, comparó cantidades e identificó regularidades. Entre otras cosas, analizó causas de muerte y diferencias entre nacimientos de varones y mujeres. Su trabajo es considerado un antecedente fundamental de la demografía y la estadística aplicada.
El cambio fue importante: los registros dejaron de ser simples listas y comenzaron a utilizarse para descubrir patrones en una población.
También durante el siglo XVII, los estudios sobre juegos de azar impulsaron el desarrollo de la teoría de la probabilidad. Los trabajos de Blaise Pascal, Pierre de Fermat, Christiaan Huygens y Jacob Bernoulli proporcionaron herramientas para cuantificar la incertidumbre.
La relación entre probabilidad y estadística puede resumirse así:
Esta conexión permitió no solo describir datos, sino también estimar valores desconocidos y evaluar la confiabilidad de las conclusiones.
Durante los siglos XVIII y XIX, la astronomía y la geodesia necesitaban combinar mediciones que nunca coincidían exactamente. Esto llevó al desarrollo de métodos para estudiar los errores de observación.
Adrien-Marie Legendre publicó el método de mínimos cuadrados en 1805. Carl Friedrich Gauss también desarrolló y justificó este método, además de relacionar los errores de medición con la distribución normal.
El método de mínimos cuadrados permite encontrar una línea o modelo que se ajuste a los datos minimizando la suma de los errores al cuadrado. Esta idea continúa siendo fundamental en la regresión y el aprendizaje automático.
En el siglo XIX, Adolphe Quetelet aplicó métodos estadísticos al estudio de poblaciones y fenómenos sociales. Buscó describir características humanas mediante promedios y regularidades observadas en grandes grupos.
Este enfoque ayudó a consolidar la idea de que la variación entre individuos podía estudiarse matemáticamente. También mostró una precaución que sigue vigente: un promedio resume un grupo, pero no describe necesariamente a cada uno de sus integrantes.
A fines del siglo XIX y comienzos del XX se desarrollaron muchas herramientas de la estadística moderna:
Estos avances permitieron diseñar mejores experimentos y distinguir entre una diferencia que podría deberse al azar y otra respaldada por evidencia suficiente.
Muchos cálculos estadísticos eran lentos cuando debían realizarse manualmente. Las computadoras cambiaron esta situación: hicieron posible procesar grandes conjuntos de datos, repetir cálculos, crear simulaciones y aplicar modelos complejos.
La disponibilidad de bases de datos, sensores, dispositivos conectados e Internet multiplicó la cantidad de información registrada. La estadística pasó a integrarse directamente con la programación.
Actualmente, un mismo programa puede recolectar datos, validarlos, calcular indicadores, generar gráficos y producir alertas en tiempo real.
| Período | Desarrollo | Aporte principal |
|---|---|---|
| Antigüedad | Censos y registros | Recuento de población, tierras y recursos. |
| 1662 | John Graunt | Análisis sistemático de datos de mortalidad. |
| Siglos XVII y XVIII | Teoría de la probabilidad | Fundamentos para estudiar la incertidumbre. |
| Siglo XIX | Legendre, Gauss y Quetelet | Medición de errores, ajuste de modelos y estadística social. |
| Finales del siglo XIX | Galton y Pearson | Regresión, correlación y nuevas pruebas estadísticas. |
| Siglo XX | Gosset, Fisher, Neyman y Pearson | Inferencia, experimentación y pruebas de hipótesis. |
| Actualidad | Computación y datos masivos | Análisis automatizado, ciencia de datos y aprendizaje automático. |
La estadística se aplica en casi todas las actividades que producen datos:
| Área | Aplicación | Ejemplo |
|---|---|---|
| Salud | Evaluación de tratamientos y factores de riesgo. | Comparar la recuperación de distintos grupos de pacientes. |
| Industria | Control de calidad y mejora de procesos. | Medir la proporción de productos defectuosos. |
| Economía | Análisis de precios, empleo y producción. | Estudiar la evolución mensual de la inflación. |
| Marketing | Segmentación y evaluación de campañas. | Comparar la conversión de dos anuncios. |
| Medio ambiente | Análisis de mediciones y tendencias. | Estudiar cambios en temperatura o contaminación. |
| Software | Rendimiento, confiabilidad y comportamiento de usuarios. | Detectar un aumento anormal en los tiempos de respuesta. |
Un programador utiliza estadística cada vez que resume mediciones, compara comportamientos o construye una regla basada en datos. Algunos casos habituales son:
Este ejemplo calcula la tasa de errores de un servicio:
const solicitudes = 2500;
const solicitudesConError = 35;
const tasaDeError = solicitudesConError / solicitudes;
const porcentajeDeError = tasaDeError * 100;
console.log(`Tasa de error: ${porcentajeDeError.toFixed(2)}%`);
El resultado es 1.40%. Esta medida resume lo ocurrido, pero para interpretarla necesitamos contexto: el período analizado, los tipos de error incluidos y el nivel de error considerado aceptable.
La ciencia de datos combina estadística, programación y conocimiento del área estudiada. La estadística ayuda a formular preguntas, explorar datos, seleccionar métodos y comunicar la incertidumbre de los resultados.
En aprendizaje automático, los modelos identifican patrones a partir de ejemplos. Los conceptos estadísticos permiten:
La capacidad de ejecutar un algoritmo no garantiza un análisis correcto. Es necesario comprender qué representan los datos y qué supuestos utiliza el método.
La estadística evolucionó en respuesta a problemas concretos: administrar recursos, estudiar poblaciones, reducir errores de medición y evaluar experimentos. Hoy esos mismos principios ayudan a comprender el funcionamiento de aplicaciones, usuarios, algoritmos y modelos predictivos.
En el próximo tema estudiaremos los tipos de datos y las escalas de medición, conceptos esenciales para elegir correctamente cada técnica estadística.