El teorema central del límite no arregla una mala muestra

¿Cómo puede una encuesta realizada a poco más de mil personas decirnos lo que piensa todo un país? La respuesta se encuentra, en buena medida, en el teorema central del límite, una de las ideas fundamentales de la estadística.

Este teorema permite utilizar muestras relativamente pequeñas para realizar estimaciones sobre poblaciones mucho mayores. Sin embargo, su poder suele interpretarse de forma demasiado optimista: reunir muchos datos no garantiza que las conclusiones sean fiables.

En Naked Statistics, Charles Wheelan insiste en una condición esencial: la muestra debe haber sido obtenida adecuadamente. Aumentar su tamaño reduce los errores causados por el azar, pero no corrige una selección sesgada.

Seguir leyendo «El teorema central del límite no arregla una mala muestra»

Actualizar creencias: la lección bayesiana de Monty Hall

Imagina que participas en un concurso con tres puertas. Detrás de una hay un coche y detrás de las otras dos, una cabra. Escoges una puerta, pero antes de mostrarte su contenido, el presentador abre otra y deja ver una cabra. Después te ofrece cambiar tu elección por la única puerta que continúa cerrada.

La respuesta intuitiva suele ser que da igual: quedan dos puertas y, aparentemente, cada una tiene un 50 % de probabilidades. Sin embargo, cambiar duplica las posibilidades de ganar, que pasan de 1/3 a 2/3.

El problema de Monty Hall (basado en un concurso de TV real presentado por su epónimo presentador), explicado por Charles Wheelan en Naked Statistics, no es solo un acertijo. Es una lección bayesiana sobre cómo debemos actualizar nuestras creencias cuando recibimos nueva información.

Seguir leyendo «Actualizar creencias: la lección bayesiana de Monty Hall»

Cómo escoger el indicador adecuado para describir una realidad

Los datos no hablan por sí solos. Para que resulten comprensibles tenemos que resumirlos mediante indicadores: una media, una tasa, un porcentaje, una mediana o un índice. Estas cifras nos permiten comparar situaciones complejas, detectar cambios y tomar decisiones.

Pero todo resumen implica una pérdida de información. Un indicador puede ser matemáticamente correcto y, aun así, ofrecer una imagen incompleta o incluso engañosa. No porque los datos sean falsos, sino porque la cifra elegida destaca una parte de la realidad y oculta otras.

Esta es una de las primeras lecciones de Naked Statistics: antes de interpretar un indicador debemos preguntarnos qué mide exactamente, qué información deja fuera y si responde realmente a la pregunta que queremos resolver.

Seguir leyendo «Cómo escoger el indicador adecuado para describir una realidad»

Reseña del libro «Naked Statistics: Stripping the Dread from the Data»

Naked Statistics: Stripping the Dread from the Data, publicado en 2013 por Charles Wheelan, parte de una idea sencilla: para comprender la estadística no es imprescindible comenzar por las fórmulas. Antes de calcular medias, probabilidades o regresiones, conviene entender qué preguntas intentan responder estas herramientas.

El propósito del libro no es formar estadísticos, sino reducir el temor que suele provocar la estadística. Wheelan recurre a historias y ejemplos relacionados con la economía, la medicina, las encuestas, los seguros o el deporte para mostrar cómo los datos intervienen constantemente en nuestras decisiones.

A lo largo de trece capítulos, el libro avanza desde la estadística descriptiva hasta la probabilidad, el muestreo, la inferencia, la regresión y la causalidad. Su argumento central es que una cifra puede ser matemáticamente correcta y, aun así, ofrecer una representación engañosa de la realidad.

Seguir leyendo «Reseña del libro «Naked Statistics: Stripping the Dread from the Data»»

Al-Ghazali y la incertidumbre: ¿podemos confiar en las causas?

En los artículos anteriores hemos visto distintas formas de enfrentarse a la incertidumbre. Sócrates nos enseñó a reconocer nuestra ignorancia, Epicteto a aceptar lo que no controlamos y Sexto Empírico a suspender el juicio cuando faltan razones suficientes.

Al-Ghazali introduce una nueva pregunta, especialmente relevante para la predicción: cuando observamos que dos acontecimientos se repiten juntos, ¿podemos afirmar que uno causa necesariamente el otro?

Seguir leyendo «Al-Ghazali y la incertidumbre: ¿podemos confiar en las causas?»

Sexto Empírico y la incertidumbre: el valor de suspender el juicio

En los artículos anteriores vimos cómo Sócrates convirtió el reconocimiento de la ignorancia en el punto de partida del conocimiento y cómo Epicteto enseñó a distinguir entre aquello que depende de nosotros y aquello que escapa a nuestro control. Sexto Empírico propone una tercera forma de relacionarnos con la incertidumbre: no apresurarnos a elegir una respuesta cuando las razones disponibles no permiten hacerlo.

Su propuesta puede parecer incómoda en una época en la que se espera que tengamos una opinión inmediata sobre casi todo. Sin embargo, el escepticismo de Sexto no consiste en negar la verdad ni en desconfiar sistemáticamente de cualquier conocimiento. Consiste en investigar, comparar argumentos y aprender a suspender el juicio cuando ninguno resulta claramente superior.

Seguir leyendo «Sexto Empírico y la incertidumbre: el valor de suspender el juicio»

Predecir nuevas maternidades mensuales: un proyecto de regresión lineal múltiple paso a paso

En predicción cuantitativa, el primer reto no suele ser elegir un algoritmo complicado, sino formular bien el problema. Antes de entrenar un modelo, hay que decidir qué queremos predecir, cómo vamos a medirlo y qué información puede ayudarnos a anticiparlo.

Con esa idea he preparado un nuevo proyecto en GitHub aplicado a un problema de gestión de personal hospitalario: la predicción mensual de nuevas bajas maternales equivalentes de trabajadoras de un hospital. La pregunta es concreta: ¿podemos estimar cuántas nuevas bajas maternales equivalentes se producirán cada mes entre las trabajadoras de un hospital usando datos agregados sobre plantilla, estabilidad contractual, estructura familiar aproximada y riesgo durante el embarazo?

El objetivo no es predecir decisiones individuales ni explicar la maternidad como fenómeno personal. El proyecto se centra en algo más práctico: construir una estimación mensual agregada que pueda ayudar a planificar sustituciones, prever carga organizativa y reducir parte de la incertidumbre en la gestión de personal.

Seguir leyendo «Predecir nuevas maternidades mensuales: un proyecto de regresión lineal múltiple paso a paso»

La regresión lineal múltiple: cuando la realidad depende de varias causas

3D scatter plot with blue data points and a semi-transparent fitted regression plane

En muchos fenómenos reales, una sola variable no basta para explicar lo que ocurre. El precio de una vivienda no depende únicamente de sus metros cuadrados, sino también de su ubicación, su antigüedad o su estado de conservación. El rendimiento académico no se relaciona sólo con las horas de estudio, sino también con el descanso, el contexto familiar o la dificultad de la materia.

La pregunta que aparece entonces es una extensión natural de la que ya planteaba la regresión lineal simple: si una variable puede ayudarnos a predecir otra, ¿qué ocurre cuando intervienen varias al mismo tiempo?

Uno de los modelos más importantes para abordar esta situación es la regresión lineal múltiple. Su idea central sigue siendo sencilla, pero su alcance es mucho mayor: permite estimar cómo se relaciona una variable con varias explicaciones simultáneas y construir predicciones más ricas y realistas.

Seguir leyendo «La regresión lineal múltiple: cuando la realidad depende de varias causas»

Ernst Bloch y la predicción: el “todavía-no” del futuro

Cuando pensamos en predicción, lo habitual es imaginar datos, modelos y probabilidades. Intentos de reducir la incertidumbre para tomar mejores decisiones. Pero hay una cuestión más profunda: ¿de dónde nace realmente esa necesidad de anticipar el futuro?

El filósofo Ernst Bloch ofrece una respuesta sugerente: el ser humano no vive solo en el presente, sino proyectado constantemente hacia lo que aún no existe. Antes de calcular escenarios, ya imaginamos posibilidades. Antes de construir modelos, ya vivimos orientados hacia el futuro.

Seguir leyendo «Ernst Bloch y la predicción: el “todavía-no” del futuro»

Pensar antes de predecir: una guía práctica con el AI canvas

Cuando se habla de inteligencia artificial, muchas veces se empieza por el modelo. Pero antes de elegir una técnica conviene hacerse una pregunta más importante: qué decisión queremos mejorar.

Para eso resulta útil el AI canvas, una herramienta explicada en el libro Máquinas predictivas. Su función es muy simple: ayudar a ordenar un caso de uso de IA antes de construirlo. En lugar de quedarse en una idea vaga como “aquí podríamos usar IA”, obliga a concretar qué queremos predecir, para qué serviría esa predicción, qué datos harían falta y cómo sabríamos si el sistema funciona bien.

Seguir leyendo «Pensar antes de predecir: una guía práctica con el AI canvas»