Actualizar creencias: la lección bayesiana de Monty Hall

Imagina que participas en un concurso con tres puertas. Detrás de una hay un coche y detrás de las otras dos, una cabra. Escoges una puerta, pero antes de mostrarte su contenido, el presentador abre otra y deja ver una cabra. Después te ofrece cambiar tu elección por la única puerta que continúa cerrada.

La respuesta intuitiva suele ser que da igual: quedan dos puertas y, aparentemente, cada una tiene un 50 % de probabilidades. Sin embargo, cambiar duplica las posibilidades de ganar, que pasan de 1/3 a 2/3.

El problema de Monty Hall (basado en un concurso de TV real presentado por su epónimo presentador), explicado por Charles Wheelan en Naked Statistics, no es solo un acertijo. Es una lección bayesiana sobre cómo debemos actualizar nuestras creencias cuando recibimos nueva información.

Seguir leyendo «Actualizar creencias: la lección bayesiana de Monty Hall»

Cómo escoger el indicador adecuado para describir una realidad

Los datos no hablan por sí solos. Para que resulten comprensibles tenemos que resumirlos mediante indicadores: una media, una tasa, un porcentaje, una mediana o un índice. Estas cifras nos permiten comparar situaciones complejas, detectar cambios y tomar decisiones.

Pero todo resumen implica una pérdida de información. Un indicador puede ser matemáticamente correcto y, aun así, ofrecer una imagen incompleta o incluso engañosa. No porque los datos sean falsos, sino porque la cifra elegida destaca una parte de la realidad y oculta otras.

Esta es una de las primeras lecciones de Naked Statistics: antes de interpretar un indicador debemos preguntarnos qué mide exactamente, qué información deja fuera y si responde realmente a la pregunta que queremos resolver.

Seguir leyendo «Cómo escoger el indicador adecuado para describir una realidad»

Reseña del libro «Naked Statistics: Stripping the Dread from the Data»

Naked Statistics: Stripping the Dread from the Data, publicado en 2013 por Charles Wheelan, parte de una idea sencilla: para comprender la estadística no es imprescindible comenzar por las fórmulas. Antes de calcular medias, probabilidades o regresiones, conviene entender qué preguntas intentan responder estas herramientas.

El propósito del libro no es formar estadísticos, sino reducir el temor que suele provocar la estadística. Wheelan recurre a historias y ejemplos relacionados con la economía, la medicina, las encuestas, los seguros o el deporte para mostrar cómo los datos intervienen constantemente en nuestras decisiones.

A lo largo de trece capítulos, el libro avanza desde la estadística descriptiva hasta la probabilidad, el muestreo, la inferencia, la regresión y la causalidad. Su argumento central es que una cifra puede ser matemáticamente correcta y, aun así, ofrecer una representación engañosa de la realidad.

Seguir leyendo «Reseña del libro «Naked Statistics: Stripping the Dread from the Data»»

Machine Learning vs. superforecasters: quién gana depende de la pregunta

Como ya vimos en el post sobre el mapa de métodos de previsión, no todas las predicciones pertenecen a la misma familia. El método adecuado depende mucho del tipo de problema que queremos anticipar: no es lo mismo prever una serie mensual de ventas, estimar el gasto de personal de una organización o asignar una probabilidad a un acontecimiento político.

Por eso resulta útil una distinción propuesta recientemente en el debate sobre ForecastBench: la diferencia entre dataset questions y market questions. Dicho de forma sencilla: hay preguntas que se parecen mucho a un problema de datos y otras que se parecen más a un problema de juicio.

Seguir leyendo «Machine Learning vs. superforecasters: quién gana depende de la pregunta»

Predecir nuevas maternidades mensuales: un proyecto de regresión lineal múltiple paso a paso

En predicción cuantitativa, el primer reto no suele ser elegir un algoritmo complicado, sino formular bien el problema. Antes de entrenar un modelo, hay que decidir qué queremos predecir, cómo vamos a medirlo y qué información puede ayudarnos a anticiparlo.

Con esa idea he preparado un nuevo proyecto en GitHub aplicado a un problema de gestión de personal hospitalario: la predicción mensual de nuevas bajas maternales equivalentes de trabajadoras de un hospital. La pregunta es concreta: ¿podemos estimar cuántas nuevas bajas maternales equivalentes se producirán cada mes entre las trabajadoras de un hospital usando datos agregados sobre plantilla, estabilidad contractual, estructura familiar aproximada y riesgo durante el embarazo?

El objetivo no es predecir decisiones individuales ni explicar la maternidad como fenómeno personal. El proyecto se centra en algo más práctico: construir una estimación mensual agregada que pueda ayudar a planificar sustituciones, prever carga organizativa y reducir parte de la incertidumbre en la gestión de personal.

Seguir leyendo «Predecir nuevas maternidades mensuales: un proyecto de regresión lineal múltiple paso a paso»

La regresión lineal múltiple: cuando la realidad depende de varias causas

3D scatter plot with blue data points and a semi-transparent fitted regression plane

En muchos fenómenos reales, una sola variable no basta para explicar lo que ocurre. El precio de una vivienda no depende únicamente de sus metros cuadrados, sino también de su ubicación, su antigüedad o su estado de conservación. El rendimiento académico no se relaciona sólo con las horas de estudio, sino también con el descanso, el contexto familiar o la dificultad de la materia.

La pregunta que aparece entonces es una extensión natural de la que ya planteaba la regresión lineal simple: si una variable puede ayudarnos a predecir otra, ¿qué ocurre cuando intervienen varias al mismo tiempo?

Uno de los modelos más importantes para abordar esta situación es la regresión lineal múltiple. Su idea central sigue siendo sencilla, pero su alcance es mucho mayor: permite estimar cómo se relaciona una variable con varias explicaciones simultáneas y construir predicciones más ricas y realistas.

Seguir leyendo «La regresión lineal múltiple: cuando la realidad depende de varias causas»

Del absentismo a la contratación temporal: un proyecto de regresión lineal simple paso a paso

A menudo se habla de predicción cuantitativa como si fuera un terreno reservado a modelos complejos, librerías sofisticadas y sistemas difíciles de explicar. Pero no siempre hace falta empezar por ahí. De hecho, muchas veces creo que ocurre lo contrario: para entender bien qué significa predecir con datos, conviene empezar por un modelo pequeño, transparente y fácil de interpretar.

Por eso he querido compartir en GitHub un proyecto completo construido alrededor de una pregunta muy concreta: cómo estimar cuántos días de contratos temporales de cobertura pueden generarse cuando aumenta el absentismo laboral por incapacidad temporal (IT). No he preparado este repositorio para presentar un gran sistema productivo ni una solución definitiva. Lo he hecho para mostrar, de forma reproducible, cómo puede utilizarse una regresión lineal simple como método de predicción cuantitativa.

La idea del proyecto no es solo enseñar una ecuación. Es enseñar un recorrido. Cómo se parte de una pregunta real, cómo se traduce esa pregunta a variables medibles, cómo se preparan los datos, cómo se comprueba si la relación tiene sentido y cómo se convierte finalmente el modelo en una pequeña aplicación utilizable. En el fondo, lo que me interesaba compartir no era solo el resultado, sino el proceso.

Seguir leyendo «Del absentismo a la contratación temporal: un proyecto de regresión lineal simple paso a paso»

La regresión lineal simple: el primer puente entre datos y predicción

En muchos contextos cotidianos observamos relaciones entre variables: más horas de estudio suelen asociarse con mejores notas, viviendas más grandes suelen tener precios más altos, y más entrenamiento suele mejorar el rendimiento deportivo.

La pregunta que surge de forma natural es sencilla pero profunda: ¿podemos cuantificar estas relaciones para anticipar lo que ocurrirá en el futuro?

Uno de los modelos más simples y elegantes para responder a esta pregunta es la regresión lineal simple. A pesar de su aparente sencillez, este modelo constituye uno de los pilares fundamentales de la predicción cuantitativa.

Seguir leyendo «La regresión lineal simple: el primer puente entre datos y predicción»

Historia de la regresión: de la regla de tres al machine learning

Cuando hoy escuchamos palabras como machine learning o inteligencia artificial, es fácil imaginar algoritmos sofisticados trabajando sobre enormes bases de datos. Sin embargo, la idea fundamental detrás de muchos de estos modelos es mucho más antigua. En el fondo, todos intentan responder una pregunta sencilla: si una variable cambia, cómo cambia otra.

Responder a esa pregunta con números ha sido una preocupación constante durante siglos. Mucho antes de que existiera la estadística formal, científicos, comerciantes y astrónomos ya intentaban encontrar patrones que permitieran anticipar resultados.

La regresión moderna es el resultado de ese largo esfuerzo intelectual. Su historia no es una ruptura tecnológica reciente, sino una evolución gradual de ideas que comienzan con cálculos muy simples y terminan en los algoritmos de aprendizaje automático actuales.

1. Cuando predecir era hacer cuentas

Seguir leyendo «Historia de la regresión: de la regla de tres al machine learning»

De la pregunta a la predicción: cómo se construye un modelo cuantitativo

Cuando se habla de inteligencia artificial o aprendizaje automático, muchas veces se piensa inmediatamente en algoritmos complejos. Sin embargo, en la práctica los modelos son solo una pequeña parte del trabajo.

La predicción cuantitativa no consiste simplemente en “aplicar un algoritmo”. Consiste en recorrer un proceso estructurado que transforma datos en conocimiento útil para tomar decisiones.

Ese proceso es lo que en ciencia de datos se conoce como el ciclo de vida de un proyecto de Machine Learning.

Aunque los modelos puedan ser muy diferentes —desde una simple regresión hasta sistemas avanzados de deep learning—, casi todos los proyectos siguen una lógica muy similar.

En términos generales, este recorrido puede resumirse en seis etapas:

  1. Definir el objetivo
  2. Adquirir los datos
  3. Explorar la información
  4. Preparar el dataset
  5. Construir el modelo
  6. Desplegar y monitorizar

En este post veremos brevemente qué ocurre en cada una de estas fases. En futuras publicaciones iré mostrando proyectos reales que siguen exactamente esta misma estructura. Estos nos servirán de ejemplo de los modelos de predicción cuantitativa más utilizados

Seguir leyendo «De la pregunta a la predicción: cómo se construye un modelo cuantitativo»