NovaMarket tiene 8.000 empleados y, desde hace dos años, un programa de bienestar (fisioterapia preventiva, pausas activas en almacén, apoyo psicológico) gestionado junto a una aseguradora. La aseguradora ha propuesto evaluar juntos los resultados, y sus informes hablan un idioma propio: prevalencias, riesgos relativos, odds ratios, sensibilidad de los cribados, curvas de supervivencia. Es el idioma de la bioestadística, y esta lección te lo enseña a leer con las herramientas que ya tienes — porque casi todo es Bayes, tablas 2×2, intervalos y diseño de experimentos con otros nombres. El objetivo no es que hagas de sanitario: es que, como analista, puedas colaborar con quienes lo son y leer críticamente un informe o un titular de salud.

Advertencia importante: los datos de salud son categoría especial bajo el RGPD y cualquier análisis sobre empleados exige base legal, anonimización y revisión previa por el delegado de protección de datos y el servicio de prevención/médico. Y las decisiones sanitarias — diagnósticos, tratamientos, cribados — corresponden siempre a profesionales sanitarios: esta lección enseña a leer la evidencia, nunca a sustituirlos.

Contenido

  1. Medir la enfermedad: incidencia vs prevalencia
  2. La tabla 2×2 del programa de bienestar: riesgo relativo y odds ratio
  3. Cribados: sensibilidad, especificidad y el engaño de los positivos
  4. Diseño de estudios: la jerarquía de la evidencia
  5. Análisis de supervivencia: leer una curva de Kaplan-Meier
  6. Lectura crítica: titulares, riesgos relativos y absolutos

Medir la enfermedad: incidencia vs prevalencia

Primera distinción, y fuente inagotable de confusiones en los informes:

  • Prevalencia: proporción de personas que tienen la condición en un momento dado. Es una foto. Ejemplo: en la encuesta de salud laboral, el 18 % del personal de almacén declara dolor lumbar actualmente.
  • Incidencia: ritmo al que aparecen casos nuevos en quienes no la tenían. Es una película, y se mide sobre tiempo de observación: 6 nuevos episodios de lumbalgia con baja por cada 100 personas-año en almacén.

Se relacionan pero no se intercambian: prevalencia ≈ incidencia × duración media. Una condición crónica de larga duración puede tener incidencia baja y prevalencia alta (diabetes); una gripe, incidencia altísima y prevalencia modesta en cualquier foto. Consecuencia práctica: un programa preventivo eficaz baja la incidencia casi de inmediato, pero la prevalencia puede tardar años en notarse (los casos ya existentes siguen ahí) — juzgar la prevención con la foto equivocada la condena injustamente. El paralelismo con el Club Nova es exacto: la tasa de baja del 14 % anual es una incidencia; el 64 % de socios activos, una prevalencia.

La tabla 2×2 del programa de bienestar: riesgo relativo y odds ratio

De los 4.000 empleados de logística, 1.200 participan en el programa de fisioterapia preventiva. Episodios de lumbalgia con baja en el último año:

Lumbalgia Sin lumbalgia Total Riesgo
Participa 60 1.140 1.200 5,0 %
No participa 224 2.576 2.800 8,0 %
Total 284 3.716 4.000 7,1 %

Riesgo relativo (RR)

El cociente de riesgos (probabilidades condicionadas, como en Reglas de Probabilidad):

\[ RR = \frac{60/1,200}{224/2,800} = \frac{0{,}050}{0{,}080} = 0{,}625 \]

Los participantes tienen un 62,5 % del riesgo de los no participantes: una reducción relativa del 37,5 %. Y en absoluto: la reducción absoluta de riesgo es \(8{,}0 - 5{,}0 = 3\) puntos porcentuales, de donde sale el NNT (número necesario a tratar): \(1/0{,}03 \approx 34\) — hay que incluir a 34 empleados en el programa para evitar un episodio al año. El NNT es la traducción de la eficacia a recursos, el equivalente sanitario de "pasar el efecto a euros".

Odds ratio (OR)

La odds de un suceso es \(p/(1-p)\) — la forma "3 contra 1" de las apuestas. El OR compara odds:

\[ OR = \frac{60/1,140}{224/2,576} = \frac{0{,}0526}{0{,}0870} = 0{,}605 \]

¿Cuándo se usa cada uno?

Riesgo relativo Odds ratio
Interpretación Directa ("la mitad de riesgo") Menos intuitiva (odds, no probabilidades)
Requiere Poder estimar incidencias → estudios de cohortes y ensayos Solo la tabla → también en casos y controles
Aparece en Informes de cohortes, ensayos Casos-controles y regresión logística
Con evento raro — OR ≈ RR

Aquí OR (0,605) y RR (0,625) casi coinciden porque la lumbalgia con baja es relativamente infrecuente; con eventos frecuentes el OR exagera respecto al RR y leerlo como si fuera un RR es un error clásico de titular. Ya conocías el OR sin saberlo del todo: la regresión logística de bajas del Club Nova devolvía OR = 0,30 para los socios activos — mismo objeto, ahora con partida de nacimiento.

Una cautela antes de brindar: la participación en el programa es voluntaria. Esto es un estudio observacional, y quien se apunta a fisioterapia preventiva quizá ya se cuidaba más (el "sesgo del usuario sano") — la variable de confusión de la lección anterior en versión sanitaria. El RR de 0,625 es prometedor, no probatorio; en el apartado de diseños se ve qué haría falta para probarlo.

Cribados: sensibilidad, especificidad y el engaño de los positivos

La aseguradora ofrece un cribado voluntario de una condición metabólica cuya prevalencia en población trabajadora es del 0,8 %. La prueba tiene:

  • Sensibilidad = 90 %: \(P(\text{positivo} \mid \text{enfermo})\) — de cada 100 enfermos, detecta 90.
  • Especificidad = 95 %: \(P(\text{negativo} \mid \text{sano})\) — de cada 100 sanos, acierta 95 (y alarma en falso a 5).

La pregunta que importa a quien recibe el resultado es la inversa: "he dado positivo, ¿estoy enfermo?" — es decir, el valor predictivo positivo \(P(\text{enfermo} \mid \text{positivo})\). Invertir condicionales es exactamente el teorema de Bayes, y el método de la tabla de frecuencias naturales lo hace transparente. Imagina 10.000 empleados cribados:

Positivo Negativo Total
Enfermos (0,8 %) 72 8 80
Sanos 496 9.424 9.920
Total 568 9.432 10.000

\[ VPP = \frac{72}{568} \approx 12{,}7\ % \qquad VPN = \frac{9,424}{9,432} \approx 99{,}9\ % \]

Resultado contraintuitivo y capital: con una prueba "del 90/95 %", casi 9 de cada 10 positivos son falsas alarmas, porque la enfermedad es rara: 496 sanos alarmados aplastan a los 72 enfermos detectados. Por eso:

  • Los cribados poblacionales encadenan una prueba barata y sensible con una prueba de confirmación más específica para los positivos.
  • La misma prueba rinde distinto según a quién se aplique: en un grupo de alto riesgo con prevalencia 10 %, el VPP sube a \(0{,}9 \times 0{,}10 / (0{,}9 \times 0{,}10 + 0{,}05 \times 0{,}90) = 66{,}7\ %\). La prevalencia — la probabilidad a priori de Bayes — manda.
  • Comunicarlo mal genera angustia y sobrediagnóstico; comunicarlo bien ("un positivo significa pasar a la prueba de confirmación, y la mayoría se resuelven en nada") es parte del diseño del cribado.

Diseño de estudios: la jerarquía de la evidencia

¿Cómo se llega a saber si algo — el programa de fisioterapia, un fármaco — funciona? Tres grandes diseños, de menos a más control:

  1. Casos y controles (retrospectivo): se parte del resultado — empleados con lumbalgia (casos) y sin ella (controles) — y se mira hacia atrás qué exposiciones tuvieron. Rápido y barato, ideal para condiciones raras; pero vive amenazado por el sesgo de memoria y de selección, y solo puede estimar OR (al fijar tú cuántos casos y controles reclutas, las incidencias reales quedan fuera de alcance).
  2. Cohortes (prospectivo): se parte de la exposición — participantes y no participantes — y se les sigue en el tiempo contando casos nuevos. Permite incidencias y RR; sigue siendo observacional: la confusión (el usuario sano) no desaparece, solo puede ajustarse por lo medido.
  3. Ensayo controlado aleatorizado (ECA): la exposición se asigna al azar. La aleatorización reparte por igual los confusores — medidos y no medidos — entre los grupos: es el test A/B de Estadística en Negocios con bata blanca, y el único diseño que autoriza la palabra "causa" sin nota al pie. Dos refuerzos propios del ámbito: el placebo (el grupo control recibe algo indistinguible, porque la mera expectativa mejora síntomas) y el doble ciego (ni participante ni evaluador saben el grupo, para que la esperanza no contamine ni la respuesta ni la medición).

La jerarquía de la evidencia ordena la confianza: revisiones sistemáticas y metaanálisis de ECA > ECA individual > cohortes > casos-controles > series de casos > opinión de experto. No es un dogma — un ECA pequeño y torpe puede valer menos que una cohorte enorme y limpia — pero es el mapa por defecto. Para el programa de bienestar, la propuesta del equipo a la aseguradora fue de manual: ofertar la próxima ampliación por sorteo entre los interesados (lista de espera aleatorizada), convirtiendo la expansión en un ECA sin negar el programa a nadie.

Análisis de supervivencia: leer una curva de Kaplan-Meier

Los informes de la aseguradora incluyen "curvas de supervivencia sin episodio". A pesar del nombre, la técnica sirve para el tiempo hasta cualquier evento — muerte, recaída, primera baja... o la baja de un socio del Club Nova. Su dificultad característica es la censura: empleados que dejan la empresa a mitad de seguimiento, o que llegan al final sin evento. No sabes cuándo les habría ocurrido, pero sí que no les ocurrió mientras los viste — tirar esa información sesgaría el resultado, y el estimador de Kaplan-Meier está construido para aprovecharla.

La curva \(S(t)\) parte de 1 (todos sin evento) y baja con escalones en cada evento observado. Lectura de la curva del informe (seguimiento de 24 meses, "supervivencia sin episodio lumbar"):

Mes \(S(t)\) participantes \(S(t)\) no participantes
6 0,98 0,96
12 0,95 0,92
18 0,93 0,87
24 0,91 0,83

Claves de lectura:

  • Altura en un instante: a 24 meses, el 91 % de participantes sigue sin episodio frente al 83 % — coherente con el RR de la tabla 2×2, pero ahora viendo cuándo se separan (aquí, sobre todo a partir del mes 12: la prevención tarda en rendir).
  • Mediana de supervivencia: el instante en que la curva cruza 0,50. Ninguna de estas dos lo hace en 24 meses ("mediana no alcanzada", buena noticia); la mediana de 25,5 h de las entregas era, en el fondo, la misma idea.
  • Comparación formal: el contraste habitual entre curvas es el log-rank (un pariente de chi-cuadrado que compara eventos observados y esperados en cada instante); quédate con que su valor p responde "¿son distinguibles las curvas?" y con que los modelos de regresión de supervivencia (Cox) devuelven hazard ratios, primos del RR.
  • Colas poco pobladas: al final del seguimiento quedan pocos individuos en riesgo y la curva se vuelve inestable; los informes serios imprimen debajo la tabla de "pacientes en riesgo" por ese motivo.

Lectura crítica: titulares, riesgos relativos y absolutos

Cierra la lección el músculo más transferible: leer un titular de salud sin dejarse arrastrar.

Titular: "Un complemento reduce un 50 % el riesgo de cierta complicación." Letra pequeña: la complicación pasa de 2 casos a 1 por cada 10.000 personas-año.

  • Reducción relativa: 50 %. Cierto y espectacular.
  • Reducción absoluta: 0,01 puntos porcentuales. \(NNT = 1/0{,}0001 = 10,000\) personas tratadas un año para evitar un caso.
  • Con el precio del complemento y sus posibles efectos adversos multiplicados por 10.000, la decisión racional puede invertirse por completo. Regla: exigir siempre los riesgos absolutos; el relativo solo, sin base, es marketing.

Lista de comprobación rápida ante cualquier afirmación de salud:

  1. ¿Riesgo absoluto y NNT, o solo relativo?
  2. ¿Intervalo de confianza o solo valor p? Un RR de 0,60 con IC \((0{,}45;; 0{,}80)\) es un efecto sólido; con IC \((0{,}35;; 1{,}05)\) es un "quizá" que cruza el 1 (el RR nulo). El IC informa de magnitud y precisión; el asterisco, de casi nada — la vieja lección de Pruebas de Hipótesis.
  3. ¿Qué diseño? ¿ECA o una cohorte con confusores al acecho?
  4. ¿Resultado principal preespecificado o hallazgo entre veinte subgrupos? (Con 20 contrastes a \(\alpha = 0{,}05\), uno sale solo — el problema de las comparaciones múltiples.)
  5. ¿En quién se midió? Un efecto en varones de 60 años con patología previa no se extrapola a la plantilla de un supermercado.

Y la advertencia final, repetida a propósito: este criterio sirve para leer y para hacer mejores preguntas a los profesionales — no para automedicarse ni para tomar decisiones clínicas u organizativas de salud sin ellos.

Errores Comunes y Consejos

  • Confundir prevalencia con incidencia. La foto no mide el ritmo: un programa preventivo se evalúa por incidencia; juzgarlo por prevalencia a corto plazo lo infravalora.
  • Leer un OR como si fuera un RR. Solo se parecen con eventos raros; con eventos frecuentes el OR exagera. Mira siempre qué medida es y qué frecuencia tiene el evento.
  • Olvidar la prevalencia al interpretar un positivo. Sensibilidad y especificidad son propiedades de la prueba; el VPP depende de a quién se la haces. Con prevalencia baja, la mayoría de positivos son falsos: tabla de 10.000 y Bayes antes de alarmar(se).
  • Dar por causal un estudio observacional. Participación voluntaria = usuario sano = confusión. Pregunta siempre por el diseño antes que por el valor p.
  • Comprar reducciones relativas sin base absoluta. "Reduce un 50 %" puede ser 2→1 por 10.000. Exige riesgo absoluto y NNT.
  • Ignorar la censura. Excluir del análisis a quien abandonó el seguimiento sesga las curvas; Kaplan-Meier existe precisamente para eso.
  • Analizar datos de salud como si fueran tickets. Categoría especial RGPD: anonimización, base legal y revisión por compliance y el servicio médico antes de la primera consulta a la base de datos.

Ejercicios

Ejercicio 1

En una cohorte de 1.000 empleados de oficina, 400 pasan más de 9 horas sentados (expuestos) y 600 no. Episodios de dolor cervical en el año: 60 entre los expuestos y 54 entre los no expuestos. Calcula riesgo en cada grupo, RR, OR y reducción/aumento absoluto. ¿Por qué se parecen RR y OR?

Ejercicio 2

Un cribado tiene sensibilidad 85 % y especificidad 92 %, y la prevalencia es del 2 %. Con la tabla de 10.000 personas, calcula el VPP e interpreta el resultado para quien recibe un positivo.

Ejercicio 3

Titular: "Un nuevo hábito reduce un 40 % el riesgo de cierta lesión". El estudio: observacional, riesgo de 5 por 1.000 en no practicantes frente a 3 por 1.000 en practicantes, RR = 0,60 con IC 95 % \((0{,}33;; 1{,}08)\). Haz la crítica completa: absolutos, NNT, precisión y diseño.

Soluciones

Ejercicio 1.

Riesgos: \(60/400 = 15{,}0\ %\) y \(54/600 = 9{,}0\ %\). \(RR = 0{,}15/0{,}09 = 1{,}67\): un 67 % más de riesgo relativo. \(OR = (60/340)/(54/546) = 0{,}1765/0{,}0989 = 1{,}78\). Aumento absoluto: 6 puntos porcentuales (equivale a un "número necesario para dañar" de \(1/0{,}06 \approx 17\)). RR y OR se parecen (1,67 vs 1,78) porque el evento ronda el 10 %; ya se aprecia que el OR abulta algo más. Recordatorio: es una cohorte observacional — sedentarismo y dolor cervical comparten confusores (edad, puesto, ergonomía) y este RR no prueba causalidad.

Ejercicio 2.

De 10.000: 200 enfermos → 170 positivos verdaderos, 30 falsos negativos; 9.800 sanos → 784 falsos positivos, 9.016 negativos verdaderos. Positivos totales: 954. \(VPP = 170/954 \approx 17{,}8\ %\). Interpretación: incluso positivo, lo más probable (82 %) es no tener la condición; el resultado significa "pasar a confirmación", no "diagnóstico". Error frecuente: responder 85 % (la sensibilidad) — es la confusión de condicionales \(P(+\mid E) \neq P(E \mid +)\) que Bayes existe para deshacer.

Ejercicio 3.

(1) Absolutos: de 5 a 3 por 1.000 = reducción absoluta de 2 por 1.000; \(NNT = 1/0{,}002 = 500\) practicantes-año por lesión evitada — el "40 %" relativo era mucho menos glamuroso en absoluto. (2) Precisión: el IC \((0{,}33;; 1{,}08)\) cruza el 1: los datos son compatibles tanto con una reducción notable como con ningún efecto (o leve aumento); en términos de contraste, no significativo al 5 %. (3) Diseño: observacional — quienes adoptan el hábito probablemente difieren en todo lo demás (usuario sano). Veredicto: hipótesis interesante que pedirá un estudio mejor, no un titular. Consejo: esta terna — absolutos, IC, diseño — desmonta o valida el 90 % de los titulares de salud.

Conclusión

Ya sabes leer el idioma sanitario con tus propias herramientas: incidencia y prevalencia como película y foto; el RR de 0,625 del programa de bienestar con su NNT de 34, y el OR como el pariente que sobrevive en casos-controles y en la logística que ya usaste; el cribado donde el 87 % de los positivos eran falsos — Bayes en estado puro —; la jerarquía que corona el ensayo aleatorizado (tu test A/B con placebo y doble ciego); las curvas de Kaplan-Meier que respetan la censura; y la lectura crítica que exige absolutos e intervalos antes de creerse un titular. Y dos límites que no son opcionales: los datos de salud pasan por compliance, y las decisiones sanitarias, por profesionales.

Con esto termina el recorrido sectorial. Queda la última pieza del curso, la más pragmática de todas: con qué herramientas — de la hoja de cálculo a Python, pasando por jamovi y la IA generativa — se hace todo esto en el día a día, y cómo elegir la adecuada para cada tarea. Es el cierre del viaje: Herramientas Estadísticas en la Práctica.

© Copyright 2026. Todos los derechos reservados