NovaMarket tiene 8.000 empleados y, desde hace dos años, un programa de bienestar (fisioterapia preventiva, pausas activas en almacén, apoyo psicológico) gestionado junto a una aseguradora. La aseguradora ha propuesto evaluar juntos los resultados, y sus informes hablan un idioma propio: prevalencias, riesgos relativos, odds ratios, sensibilidad de los cribados, curvas de supervivencia. Es el idioma de la bioestadística, y esta lección te lo enseña a leer con las herramientas que ya tienes — porque casi todo es Bayes, tablas 2×2, intervalos y diseño de experimentos con otros nombres. El objetivo no es que hagas de sanitario: es que, como analista, puedas colaborar con quienes lo son y leer críticamente un informe o un titular de salud.
Advertencia importante: los datos de salud son categoría especial bajo el RGPD y cualquier análisis sobre empleados exige base legal, anonimización y revisión previa por el delegado de protección de datos y el servicio de prevención/médico. Y las decisiones sanitarias — diagnósticos, tratamientos, cribados — corresponden siempre a profesionales sanitarios: esta lección enseña a leer la evidencia, nunca a sustituirlos.
Contenido
- Medir la enfermedad: incidencia vs prevalencia
- La tabla 2×2 del programa de bienestar: riesgo relativo y odds ratio
- Cribados: sensibilidad, especificidad y el engaño de los positivos
- Diseño de estudios: la jerarquía de la evidencia
- Análisis de supervivencia: leer una curva de Kaplan-Meier
- Lectura crítica: titulares, riesgos relativos y absolutos
Medir la enfermedad: incidencia vs prevalencia
Primera distinción, y fuente inagotable de confusiones en los informes:
- Prevalencia: proporción de personas que tienen la condición en un momento dado. Es una foto. Ejemplo: en la encuesta de salud laboral, el 18 % del personal de almacén declara dolor lumbar actualmente.
- Incidencia: ritmo al que aparecen casos nuevos en quienes no la tenían. Es una película, y se mide sobre tiempo de observación: 6 nuevos episodios de lumbalgia con baja por cada 100 personas-año en almacén.
Se relacionan pero no se intercambian: prevalencia ≈ incidencia × duración media. Una condición crónica de larga duración puede tener incidencia baja y prevalencia alta (diabetes); una gripe, incidencia altísima y prevalencia modesta en cualquier foto. Consecuencia práctica: un programa preventivo eficaz baja la incidencia casi de inmediato, pero la prevalencia puede tardar años en notarse (los casos ya existentes siguen ahí) — juzgar la prevención con la foto equivocada la condena injustamente. El paralelismo con el Club Nova es exacto: la tasa de baja del 14 % anual es una incidencia; el 64 % de socios activos, una prevalencia.
La tabla 2×2 del programa de bienestar: riesgo relativo y odds ratio
De los 4.000 empleados de logística, 1.200 participan en el programa de fisioterapia preventiva. Episodios de lumbalgia con baja en el último año:
| Lumbalgia | Sin lumbalgia | Total | Riesgo | |
|---|---|---|---|---|
| Participa | 60 | 1.140 | 1.200 | 5,0 % |
| No participa | 224 | 2.576 | 2.800 | 8,0 % |
| Total | 284 | 3.716 | 4.000 | 7,1 % |
Riesgo relativo (RR)
El cociente de riesgos (probabilidades condicionadas, como en Reglas de Probabilidad):
\[ RR = \frac{60/1,200}{224/2,800} = \frac{0{,}050}{0{,}080} = 0{,}625 \]
Los participantes tienen un 62,5 % del riesgo de los no participantes: una reducción relativa del 37,5 %. Y en absoluto: la reducción absoluta de riesgo es \(8{,}0 - 5{,}0 = 3\) puntos porcentuales, de donde sale el NNT (número necesario a tratar): \(1/0{,}03 \approx 34\) — hay que incluir a 34 empleados en el programa para evitar un episodio al año. El NNT es la traducción de la eficacia a recursos, el equivalente sanitario de "pasar el efecto a euros".
Odds ratio (OR)
La odds de un suceso es \(p/(1-p)\) — la forma "3 contra 1" de las apuestas. El OR compara odds:
\[ OR = \frac{60/1,140}{224/2,576} = \frac{0{,}0526}{0{,}0870} = 0{,}605 \]
¿Cuándo se usa cada uno?
| Riesgo relativo | Odds ratio | |
|---|---|---|
| Interpretación | Directa ("la mitad de riesgo") | Menos intuitiva (odds, no probabilidades) |
| Requiere | Poder estimar incidencias → estudios de cohortes y ensayos | Solo la tabla → también en casos y controles |
| Aparece en | Informes de cohortes, ensayos | Casos-controles y regresión logística |
| Con evento raro | — | OR ≈ RR |
Aquí OR (0,605) y RR (0,625) casi coinciden porque la lumbalgia con baja es relativamente infrecuente; con eventos frecuentes el OR exagera respecto al RR y leerlo como si fuera un RR es un error clásico de titular. Ya conocías el OR sin saberlo del todo: la regresión logística de bajas del Club Nova devolvía OR = 0,30 para los socios activos — mismo objeto, ahora con partida de nacimiento.
Una cautela antes de brindar: la participación en el programa es voluntaria. Esto es un estudio observacional, y quien se apunta a fisioterapia preventiva quizá ya se cuidaba más (el "sesgo del usuario sano") — la variable de confusión de la lección anterior en versión sanitaria. El RR de 0,625 es prometedor, no probatorio; en el apartado de diseños se ve qué haría falta para probarlo.
Cribados: sensibilidad, especificidad y el engaño de los positivos
La aseguradora ofrece un cribado voluntario de una condición metabólica cuya prevalencia en población trabajadora es del 0,8 %. La prueba tiene:
- Sensibilidad = 90 %: \(P(\text{positivo} \mid \text{enfermo})\) — de cada 100 enfermos, detecta 90.
- Especificidad = 95 %: \(P(\text{negativo} \mid \text{sano})\) — de cada 100 sanos, acierta 95 (y alarma en falso a 5).
La pregunta que importa a quien recibe el resultado es la inversa: "he dado positivo, ¿estoy enfermo?" — es decir, el valor predictivo positivo \(P(\text{enfermo} \mid \text{positivo})\). Invertir condicionales es exactamente el teorema de Bayes, y el método de la tabla de frecuencias naturales lo hace transparente. Imagina 10.000 empleados cribados:
| Positivo | Negativo | Total | |
|---|---|---|---|
| Enfermos (0,8 %) | 72 | 8 | 80 |
| Sanos | 496 | 9.424 | 9.920 |
| Total | 568 | 9.432 | 10.000 |
\[ VPP = \frac{72}{568} \approx 12{,}7\ % \qquad VPN = \frac{9,424}{9,432} \approx 99{,}9\ % \]
Resultado contraintuitivo y capital: con una prueba "del 90/95 %", casi 9 de cada 10 positivos son falsas alarmas, porque la enfermedad es rara: 496 sanos alarmados aplastan a los 72 enfermos detectados. Por eso:
- Los cribados poblacionales encadenan una prueba barata y sensible con una prueba de confirmación más específica para los positivos.
- La misma prueba rinde distinto según a quién se aplique: en un grupo de alto riesgo con prevalencia 10 %, el VPP sube a \(0{,}9 \times 0{,}10 / (0{,}9 \times 0{,}10 + 0{,}05 \times 0{,}90) = 66{,}7\ %\). La prevalencia — la probabilidad a priori de Bayes — manda.
- Comunicarlo mal genera angustia y sobrediagnóstico; comunicarlo bien ("un positivo significa pasar a la prueba de confirmación, y la mayoría se resuelven en nada") es parte del diseño del cribado.
Diseño de estudios: la jerarquía de la evidencia
¿Cómo se llega a saber si algo — el programa de fisioterapia, un fármaco — funciona? Tres grandes diseños, de menos a más control:
- Casos y controles (retrospectivo): se parte del resultado — empleados con lumbalgia (casos) y sin ella (controles) — y se mira hacia atrás qué exposiciones tuvieron. Rápido y barato, ideal para condiciones raras; pero vive amenazado por el sesgo de memoria y de selección, y solo puede estimar OR (al fijar tú cuántos casos y controles reclutas, las incidencias reales quedan fuera de alcance).
- Cohortes (prospectivo): se parte de la exposición — participantes y no participantes — y se les sigue en el tiempo contando casos nuevos. Permite incidencias y RR; sigue siendo observacional: la confusión (el usuario sano) no desaparece, solo puede ajustarse por lo medido.
- Ensayo controlado aleatorizado (ECA): la exposición se asigna al azar. La aleatorización reparte por igual los confusores — medidos y no medidos — entre los grupos: es el test A/B de Estadística en Negocios con bata blanca, y el único diseño que autoriza la palabra "causa" sin nota al pie. Dos refuerzos propios del ámbito: el placebo (el grupo control recibe algo indistinguible, porque la mera expectativa mejora síntomas) y el doble ciego (ni participante ni evaluador saben el grupo, para que la esperanza no contamine ni la respuesta ni la medición).
La jerarquía de la evidencia ordena la confianza: revisiones sistemáticas y metaanálisis de ECA > ECA individual > cohortes > casos-controles > series de casos > opinión de experto. No es un dogma — un ECA pequeño y torpe puede valer menos que una cohorte enorme y limpia — pero es el mapa por defecto. Para el programa de bienestar, la propuesta del equipo a la aseguradora fue de manual: ofertar la próxima ampliación por sorteo entre los interesados (lista de espera aleatorizada), convirtiendo la expansión en un ECA sin negar el programa a nadie.
Análisis de supervivencia: leer una curva de Kaplan-Meier
Los informes de la aseguradora incluyen "curvas de supervivencia sin episodio". A pesar del nombre, la técnica sirve para el tiempo hasta cualquier evento — muerte, recaída, primera baja... o la baja de un socio del Club Nova. Su dificultad característica es la censura: empleados que dejan la empresa a mitad de seguimiento, o que llegan al final sin evento. No sabes cuándo les habría ocurrido, pero sí que no les ocurrió mientras los viste — tirar esa información sesgaría el resultado, y el estimador de Kaplan-Meier está construido para aprovecharla.
La curva \(S(t)\) parte de 1 (todos sin evento) y baja con escalones en cada evento observado. Lectura de la curva del informe (seguimiento de 24 meses, "supervivencia sin episodio lumbar"):
| Mes | \(S(t)\) participantes | \(S(t)\) no participantes |
|---|---|---|
| 6 | 0,98 | 0,96 |
| 12 | 0,95 | 0,92 |
| 18 | 0,93 | 0,87 |
| 24 | 0,91 | 0,83 |
Claves de lectura:
- Altura en un instante: a 24 meses, el 91 % de participantes sigue sin episodio frente al 83 % — coherente con el RR de la tabla 2×2, pero ahora viendo cuándo se separan (aquí, sobre todo a partir del mes 12: la prevención tarda en rendir).
- Mediana de supervivencia: el instante en que la curva cruza 0,50. Ninguna de estas dos lo hace en 24 meses ("mediana no alcanzada", buena noticia); la mediana de 25,5 h de las entregas era, en el fondo, la misma idea.
- Comparación formal: el contraste habitual entre curvas es el log-rank (un pariente de chi-cuadrado que compara eventos observados y esperados en cada instante); quédate con que su valor p responde "¿son distinguibles las curvas?" y con que los modelos de regresión de supervivencia (Cox) devuelven hazard ratios, primos del RR.
- Colas poco pobladas: al final del seguimiento quedan pocos individuos en riesgo y la curva se vuelve inestable; los informes serios imprimen debajo la tabla de "pacientes en riesgo" por ese motivo.
Lectura crítica: titulares, riesgos relativos y absolutos
Cierra la lección el músculo más transferible: leer un titular de salud sin dejarse arrastrar.
Titular: "Un complemento reduce un 50 % el riesgo de cierta complicación." Letra pequeña: la complicación pasa de 2 casos a 1 por cada 10.000 personas-año.
- Reducción relativa: 50 %. Cierto y espectacular.
- Reducción absoluta: 0,01 puntos porcentuales. \(NNT = 1/0{,}0001 = 10,000\) personas tratadas un año para evitar un caso.
- Con el precio del complemento y sus posibles efectos adversos multiplicados por 10.000, la decisión racional puede invertirse por completo. Regla: exigir siempre los riesgos absolutos; el relativo solo, sin base, es marketing.
Lista de comprobación rápida ante cualquier afirmación de salud:
- ¿Riesgo absoluto y NNT, o solo relativo?
- ¿Intervalo de confianza o solo valor p? Un RR de 0,60 con IC \((0{,}45;; 0{,}80)\) es un efecto sólido; con IC \((0{,}35;; 1{,}05)\) es un "quizá" que cruza el 1 (el RR nulo). El IC informa de magnitud y precisión; el asterisco, de casi nada — la vieja lección de Pruebas de Hipótesis.
- ¿Qué diseño? ¿ECA o una cohorte con confusores al acecho?
- ¿Resultado principal preespecificado o hallazgo entre veinte subgrupos? (Con 20 contrastes a \(\alpha = 0{,}05\), uno sale solo — el problema de las comparaciones múltiples.)
- ¿En quién se midió? Un efecto en varones de 60 años con patología previa no se extrapola a la plantilla de un supermercado.
Y la advertencia final, repetida a propósito: este criterio sirve para leer y para hacer mejores preguntas a los profesionales — no para automedicarse ni para tomar decisiones clínicas u organizativas de salud sin ellos.
Errores Comunes y Consejos
- Confundir prevalencia con incidencia. La foto no mide el ritmo: un programa preventivo se evalúa por incidencia; juzgarlo por prevalencia a corto plazo lo infravalora.
- Leer un OR como si fuera un RR. Solo se parecen con eventos raros; con eventos frecuentes el OR exagera. Mira siempre qué medida es y qué frecuencia tiene el evento.
- Olvidar la prevalencia al interpretar un positivo. Sensibilidad y especificidad son propiedades de la prueba; el VPP depende de a quién se la haces. Con prevalencia baja, la mayoría de positivos son falsos: tabla de 10.000 y Bayes antes de alarmar(se).
- Dar por causal un estudio observacional. Participación voluntaria = usuario sano = confusión. Pregunta siempre por el diseño antes que por el valor p.
- Comprar reducciones relativas sin base absoluta. "Reduce un 50 %" puede ser 2→1 por 10.000. Exige riesgo absoluto y NNT.
- Ignorar la censura. Excluir del análisis a quien abandonó el seguimiento sesga las curvas; Kaplan-Meier existe precisamente para eso.
- Analizar datos de salud como si fueran tickets. Categoría especial RGPD: anonimización, base legal y revisión por compliance y el servicio médico antes de la primera consulta a la base de datos.
Ejercicios
Ejercicio 1
En una cohorte de 1.000 empleados de oficina, 400 pasan más de 9 horas sentados (expuestos) y 600 no. Episodios de dolor cervical en el año: 60 entre los expuestos y 54 entre los no expuestos. Calcula riesgo en cada grupo, RR, OR y reducción/aumento absoluto. ¿Por qué se parecen RR y OR?
Ejercicio 2
Un cribado tiene sensibilidad 85 % y especificidad 92 %, y la prevalencia es del 2 %. Con la tabla de 10.000 personas, calcula el VPP e interpreta el resultado para quien recibe un positivo.
Ejercicio 3
Titular: "Un nuevo hábito reduce un 40 % el riesgo de cierta lesión". El estudio: observacional, riesgo de 5 por 1.000 en no practicantes frente a 3 por 1.000 en practicantes, RR = 0,60 con IC 95 % \((0{,}33;; 1{,}08)\). Haz la crítica completa: absolutos, NNT, precisión y diseño.
Soluciones
Ejercicio 1.
Riesgos: \(60/400 = 15{,}0\ %\) y \(54/600 = 9{,}0\ %\). \(RR = 0{,}15/0{,}09 = 1{,}67\): un 67 % más de riesgo relativo. \(OR = (60/340)/(54/546) = 0{,}1765/0{,}0989 = 1{,}78\). Aumento absoluto: 6 puntos porcentuales (equivale a un "número necesario para dañar" de \(1/0{,}06 \approx 17\)). RR y OR se parecen (1,67 vs 1,78) porque el evento ronda el 10 %; ya se aprecia que el OR abulta algo más. Recordatorio: es una cohorte observacional — sedentarismo y dolor cervical comparten confusores (edad, puesto, ergonomía) y este RR no prueba causalidad.
Ejercicio 2.
De 10.000: 200 enfermos → 170 positivos verdaderos, 30 falsos negativos; 9.800 sanos → 784 falsos positivos, 9.016 negativos verdaderos. Positivos totales: 954. \(VPP = 170/954 \approx 17{,}8\ %\). Interpretación: incluso positivo, lo más probable (82 %) es no tener la condición; el resultado significa "pasar a confirmación", no "diagnóstico". Error frecuente: responder 85 % (la sensibilidad) — es la confusión de condicionales \(P(+\mid E) \neq P(E \mid +)\) que Bayes existe para deshacer.
Ejercicio 3.
(1) Absolutos: de 5 a 3 por 1.000 = reducción absoluta de 2 por 1.000; \(NNT = 1/0{,}002 = 500\) practicantes-año por lesión evitada — el "40 %" relativo era mucho menos glamuroso en absoluto. (2) Precisión: el IC \((0{,}33;; 1{,}08)\) cruza el 1: los datos son compatibles tanto con una reducción notable como con ningún efecto (o leve aumento); en términos de contraste, no significativo al 5 %. (3) Diseño: observacional — quienes adoptan el hábito probablemente difieren en todo lo demás (usuario sano). Veredicto: hipótesis interesante que pedirá un estudio mejor, no un titular. Consejo: esta terna — absolutos, IC, diseño — desmonta o valida el 90 % de los titulares de salud.
Conclusión
Ya sabes leer el idioma sanitario con tus propias herramientas: incidencia y prevalencia como película y foto; el RR de 0,625 del programa de bienestar con su NNT de 34, y el OR como el pariente que sobrevive en casos-controles y en la logística que ya usaste; el cribado donde el 87 % de los positivos eran falsos — Bayes en estado puro —; la jerarquía que corona el ensayo aleatorizado (tu test A/B con placebo y doble ciego); las curvas de Kaplan-Meier que respetan la censura; y la lectura crítica que exige absolutos e intervalos antes de creerse un titular. Y dos límites que no son opcionales: los datos de salud pasan por compliance, y las decisiones sanitarias, por profesionales.
Con esto termina el recorrido sectorial. Queda la última pieza del curso, la más pragmática de todas: con qué herramientas — de la hoja de cálculo a Python, pasando por jamovi y la IA generativa — se hace todo esto en el día a día, y cómo elegir la adecuada para cada tarea. Es el cierre del viaje: Herramientas Estadísticas en la Práctica.
Curso de Estadística
Módulo 1: Introducción a la Estadística
Módulo 2: Descripción de Datos
- Medidas de Tendencia Central
- Medidas de Dispersión
- Medidas de Posición y Valores Atípicos
- Representación Gráfica de Datos
Módulo 3: Probabilidad
- Conceptos Básicos de Probabilidad
- Reglas de Probabilidad
- Variables Aleatorias y Distribuciones de Probabilidad
Módulo 4: Distribuciones de Probabilidad
- Distribución Binomial
- Distribución Normal
- Otras Distribuciones Importantes
- El Teorema Central del Límite
Módulo 5: Inferencia Estadística
- Estimación de Parámetros
- Intervalos de Confianza
- Pruebas de Hipótesis
- Errores, Potencia y Tamaño Muestral
Módulo 6: Análisis de Datos
- Análisis de Correlación
- Análisis de Regresión
- Análisis de Varianza (ANOVA)
- Análisis de Datos Categóricos: Chi-Cuadrado
