En la lección anterior aprendimos a asignar probabilidades a sucesos aislados: la probabilidad de que un ticket se pague con tarjeta es 0,61; la de que una respuesta de la encuesta sea de un cliente satisfecho, 0,712. Pero las preguntas que Marta lleva al comité combinan sucesos: «¿qué porcentaje de respuestas son de la app y además insatisfechas?», «sabiendo que un pedido llegó tarde, ¿qué transportista lo llevaba probablemente?». Esta lección presenta las herramientas para calcular probabilidades combinadas: la regla de la suma, la probabilidad condicionada, la regla del producto, la distinción entre independencia e incompatibilidad (fuente del error más clásico de todo el curso), y dos resultados que valen su peso en oro en la empresa: el teorema de la probabilidad total y el teorema de Bayes. Como herramientas de trabajo usaremos tablas de contingencia y diagramas de árbol.

Contenido

  1. La regla de la suma (con y sin incompatibilidad)
  2. Probabilidad condicionada
  3. La regla del producto
  4. Independencia vs dependencia (y por qué no es lo mismo que incompatibilidad)
  5. Tablas de contingencia: canal × satisfacción
  6. Diagramas de árbol y el teorema de la probabilidad total
  7. El teorema de Bayes y la falacia de la tasa base: fraude en pedidos online

La regla de la suma

Queremos \( P(A \cup B) \): la probabilidad de que ocurra \( A \), \( B \) o ambos.

Caso fácil: sucesos incompatibles. Si \( A \cap B = \varnothing \), basta sumar (es el tercer axioma de Kolmogórov):

\[ P(A \cup B) = P(A) + P(B) \]

Ejemplo: probabilidad de que un euro de venta sea de fresca o de bebidas: \( 0{,}38 + 0{,}14 = 0{,}52 \).

Caso general: sucesos compatibles. Si \( A \) y \( B \) pueden coincidir, sumar sus probabilidades cuenta la intersección dos veces (una dentro de \( P(A) \) y otra dentro de \( P(B) \)), así que hay que restarla una vez:

\[ P(A \cup B) = P(A) + P(B) - P(A \cap B) \]

Ejemplo NovaMarket: elegimos un ticket al azar. El 61 % de los tickets se pagan con tarjeta (\( P(T)=0{,}61 \)), el 45 % incluyen algún producto fresco (\( P(F)=0{,}45 \) — ojo, esto es una proporción de tickets, no la cuota del 38 % sobre euros de venta que vimos en el Módulo 2), y el 29 % cumplen ambas cosas a la vez (\( P(T \cap F)=0{,}29 \)). Entonces:

\[ P(T \cup F) = 0{,}61 + 0{,}45 - 0{,}29 = 0{,}77 \]

El 77 % de los tickets se pagan con tarjeta, llevan producto fresco, o ambas cosas. Si hubiéramos sumado sin restar habríamos obtenido 1,06 — una probabilidad mayor que 1, señal inequívoca de que algo se contó dos veces.

Probabilidad condicionada

La probabilidad condicionada \( P(A \mid B) \) — se lee «probabilidad de A dado B» — es la probabilidad de \( A \) sabiendo que \( B \) ha ocurrido. La información recorta el espacio muestral: ya no consideramos todos los resultados posibles, solo aquellos en los que \( B \) ocurre.

\[ P(A \mid B) = \frac{P(A \cap B)}{P(B)} \qquad \text{(siempre que } P(B) > 0\text{)} \]

La intuición: de la «tarta» de casos en los que ocurre \( B \), ¿qué porción corresponde también a \( A \)?

Ejemplo rápido: con los tickets de antes, ¿qué probabilidad hay de que un ticket lleve producto fresco sabiendo que se pagó con tarjeta?

\[ P(F \mid T) = \frac{P(F \cap T)}{P(T)} = \frac{0{,}29}{0{,}61} \approx 0{,}475 \]

Entre los tickets con tarjeta, el 47,5 % llevan fresco — algo más que el 45 % general. Condicionar cambia la probabilidad porque cambia la población de referencia. Fíjate también en que el orden importa: \( P(F \mid T) = 0{,}475 \) no es lo mismo que \( P(T \mid F) = 0{,}29/0{,}45 \approx 0{,}644 \). Confundir \( P(A \mid B) \) con \( P(B \mid A) \) es un error tan frecuente que tiene nombre (falacia de la condicional traspuesta) y volveremos a él con el teorema de Bayes.

La regla del producto

Despejando de la definición anterior obtenemos la regla del producto, que sirve para calcular la probabilidad de que dos sucesos ocurran a la vez:

\[ P(A \cap B) = P(B) \cdot P(A \mid B) = P(A) \cdot P(B \mid A) \]

Ejemplo: el 20 % de las respuestas de la encuesta llegan por online (\( P(O) = 0{,}20 \)) y, entre ellas, el 62,5 % son de satisfechos (\( P(S \mid O) = 0{,}625 \), lo justificaremos con la tabla de contingencia). Probabilidad de que una respuesta al azar sea «online y satisfecho»:

\[ P(O \cap S) = 0{,}20 \times 0{,}625 = 0{,}125 \]

Independencia vs dependencia (y vs incompatibilidad)

Dos sucesos son independientes cuando saber que uno ha ocurrido no cambia la probabilidad del otro:

\[ A \text{ y } B \text{ independientes} \iff P(A \mid B) = P(A) \iff P(A \cap B) = P(A) \cdot P(B) \]

Si condicionar cambia la probabilidad, los sucesos son dependientes (lo que no implica causalidad: solo asociación, matiz que desarrollaremos en el análisis de correlación).

  • En el ejemplo de los tickets, \( P(F) = 0{,}45 \) pero \( P(F \mid T) = 0{,}475 \): pagar con tarjeta y llevar fresco son (ligeramente) dependientes.
  • En cambio, si la probabilidad de que un pedido online llegue tarde es la misma los lunes que cualquier otro día, «llegar tarde» y «ser lunes» son independientes.

El error clásico: confundir independencia con incompatibilidad. Son ideas casi opuestas:

Incompatibles Independientes
Definición No pueden ocurrir a la vez: \( P(A \cap B) = 0 \) Uno no informa sobre el otro: \( P(A \cap B) = P(A)P(B) \)
Saber que ocurrió \( B \)… …garantiza que \( A \) no ocurrió …no cambia nada sobre \( A \)
¿Relación entre ambas? Dos sucesos incompatibles con probabilidad positiva son siempre dependientes (¡y de la forma más extrema!) —
Ejemplo NovaMarket «Respuesta por tienda» y «respuesta por app» «Ticket con tarjeta» y «ticket en día par»

Si \( A \) y \( B \) son incompatibles y ocurre \( B \), la probabilidad de \( A \) pasa a ser 0: la información de \( B \) lo cambia todo. Máxima dependencia, no independencia.

Tablas de contingencia: canal × satisfacción

Cuando cruzamos dos variables cualitativas, la tabla de contingencia convierte todos los cálculos anteriores en simples divisiones. Marta cruza las 640 respuestas de la encuesta por canal y por nivel de satisfacción (satisfecho = nota ≥ 8):

Satisfecho (≥ 8) No satisfecho (≤ 7) Total
Tienda 336 112 448
Online 80 48 128
App 40 24 64
Total 456 184 640

Comprobación: \( 456/640 = 0{,}7125 \approx 71{,}2,% \) de satisfechos, coherente con el Módulo 2. De la tabla salen directamente los tres tipos de probabilidad:

  • Conjunta (celda / total global): \( P(\text{Online} \cap \text{Satisfecho}) = 80/640 = 0{,}125 \).
  • Marginal (margen / total global): \( P(\text{Online}) = 128/640 = 0{,}20 \).
  • Condicionada (celda / total de su fila o columna): \( P(\text{Satisfecho} \mid \text{Online}) = 80/128 = 0{,}625 \).

Y la pregunta de independencia se responde comparando condicionadas con marginales:

\[ P(\text{Satisfecho} \mid \text{Tienda}) = \frac{336}{448} = 0{,}75 \qquad P(\text{Satisfecho} \mid \text{Online}) = 0{,}625 \qquad P(\text{Satisfecho} \mid \text{App}) = \frac{40}{64} = 0{,}625 \]

Como no coinciden con la marginal \( P(\text{Satisfecho}) = 0{,}7125 \), canal y satisfacción son dependientes: la satisfacción es más alta en tienda que en los canales digitales, en línea con las medias que ya conocíamos (8,3 / 7,6 / 7,9). Si esa dependencia es «estadísticamente significativa» o atribuible al azar muestral es otra pregunta, que responderá el test chi-cuadrado mucho más adelante.

Diagramas de árbol y el teorema de la probabilidad total

Cuando el experimento ocurre en etapas (primero una cosa, luego otra), el diagrama de árbol es la herramienta natural: cada rama lleva su probabilidad, las ramas que salen de un mismo nudo suman 1, y la probabilidad de un camino completo es el producto de sus ramas (regla del producto en acción).

Caso NovaMarket: entregas e-commerce. NovaMarket reparte sus pedidos online con dos transportistas: LogiExpress mueve el 70 % de los envíos y entrega tarde (fuera del SLA de 48 h) el 8 % de las veces; RápidoSur mueve el 30 % restante y llega tarde el 15 % de las veces.

flowchart LR
    R((Pedido)) -->|0,70| L[LogiExpress]
    R -->|0,30| S[RápidoSur]
    L -->|0,08| LT["Tarde: 0,70 × 0,08 = 0,056"]
    L -->|0,92| LO["A tiempo: 0,70 × 0,92 = 0,644"]
    S -->|0,15| ST["Tarde: 0,30 × 0,15 = 0,045"]
    S -->|0,85| SO["A tiempo: 0,30 × 0,85 = 0,255"]

¿Qué probabilidad tiene un pedido cualquiera de llegar tarde? Un pedido tarde llega por uno de dos caminos incompatibles (tarde con LogiExpress, o tarde con RápidoSur), así que sumamos los caminos:

\[ P(\text{Tarde}) = P(L),P(\text{Tarde} \mid L) + P(S),P(\text{Tarde} \mid S) = 0{,}70 \times 0{,}08 + 0{,}30 \times 0{,}15 = 0{,}056 + 0{,}045 = 0{,}101 \]

Esto es el teorema de la probabilidad total: si \( B_1, B_2, \dots, B_k \) forman una partición del espacio muestral (incompatibles entre sí y cubriéndolo todo),

\[ P(A) = \sum_{i=1}^{k} P(B_i),P(A \mid B_i) \]

Es una media ponderada de las condicionadas, con las probabilidades de los escenarios como pesos — la misma lógica de la media ponderada que vimos en el Módulo 2. Resultado de negocio: un 10,1 % de pedidos tarde significa un cumplimiento del SLA del 89,9 %, justo por debajo del objetivo «90 % en < 48 h». Marta quiere saber dónde apretar, y para eso necesita darle la vuelta a la pregunta.

El teorema de Bayes y la falacia de la tasa base

Hasta ahora razonamos «hacia delante»: del transportista al retraso. El teorema de Bayes permite razonar «hacia atrás»: observado el efecto (el pedido llegó tarde), ¿qué probabilidad tiene cada causa (cada transportista)?

\[ P(B_i \mid A) = \frac{P(B_i),P(A \mid B_i)}{P(A)} = \frac{P(B_i),P(A \mid B_i)}{\sum_j P(B_j),P(A \mid B_j)} \]

El numerador es el camino del árbol que nos interesa; el denominador, la probabilidad total (todos los caminos que producen \( A \)).

Aplicación al reparto: un cliente llama porque su pedido llegó tarde. ¿Probabilidad de que lo llevara RápidoSur?

\[ P(S \mid \text{Tarde}) = \frac{0{,}30 \times 0{,}15}{0{,}101} = \frac{0{,}045}{0{,}101} \approx 0{,}446 \]

RápidoSur solo mueve el 30 % de los pedidos, pero está detrás del 44,6 % de los retrasos: la información «llegó tarde» casi duplica su probabilidad (de 0,30 a priori a 0,446 a posteriori). Ese es exactamente el tipo de actualización de creencias que Bayes formaliza.

Caso práctico completo: detección de fraude en pedidos online

El equipo de e-commerce estrena un sistema antifraude. Datos del problema:

  • El 0,5 % de los pedidos online son fraudulentos: \( P(\text{Fraude}) = 0{,}005 \) (la tasa base).
  • Si un pedido es fraudulento, el sistema lo marca el 92 % de las veces: \( P(\text{Alerta} \mid \text{Fraude}) = 0{,}92 \) (sensibilidad).
  • Si un pedido es legítimo, el sistema se equivoca y lo marca el 4 % de las veces: \( P(\text{Alerta} \mid \text{Legítimo}) = 0{,}04 \) (tasa de falsos positivos).

El sistema marca un pedido. El responsable de e-commerce exclama: «¡92 % seguro que es fraude, cancelémoslo!». Veamos qué dice Bayes. Paso 1, probabilidad total de recibir una alerta:

\[ P(\text{Alerta}) = \underbrace{0{,}005 \times 0{,}92}{\text{fraudes marcados}} + \underbrace{0{,}995 \times 0{,}04}{\text{legítimos marcados}} = 0{,}0046 + 0{,}0398 = 0{,}0444 \]

Paso 2, Bayes:

\[ P(\text{Fraude} \mid \text{Alerta}) = \frac{0{,}0046}{0{,}0444} \approx 0{,}104 \]

Solo el 10,4 % de las alertas son fraudes reales. Para verlo sin fórmulas, imagina 10.000 pedidos:

10.000 pedidos Con alerta Sin alerta Total
Fraudulentos 46 4 50
Legítimos 398 9.552 9.950
Total 444 9.556 10.000

De 444 alertas, solo 46 son fraude: \( 46/444 \approx 0{,}104 \). El responsable confundió \( P(\text{Alerta} \mid \text{Fraude}) = 0{,}92 \) con \( P(\text{Fraude} \mid \text{Alerta}) = 0{,}104 \). Ignorar que el fraude es rarísimo de partida (0,5 %) se llama falacia de la tasa base: cuando el suceso buscado es raro, incluso un detector bueno genera mayoritariamente falsos positivos. Consecuencia práctica: las alertas no deben cancelar pedidos automáticamente, sino disparar una verificación adicional barata (y la nota positiva: sin alerta, \( P(\text{Fraude} \mid \text{Sin alerta}) = 4/9.556 \approx 0{,}0004 \), el sistema sí sirve para descartar).

Errores Comunes y Consejos

  • Sumar probabilidades de sucesos compatibles sin restar la intersección. Si el resultado supera 1, es la señal de este error. La fórmula general \( P(A)+P(B)-P(A \cap B) \) nunca falla; la versión corta solo vale con incompatibles.
  • Confundir \( P(A \mid B) \) con \( P(B \mid A) \). «El 92 % de los fraudes generan alerta» no es «el 92 % de las alertas son fraude». Ante la duda, construye la tabla de 10.000 casos: hace el error imposible.
  • Tratar sucesos incompatibles como independientes. Incompatibles con probabilidad positiva = dependencia extrema. Repítelo hasta interiorizarlo.
  • Multiplicar \( P(A) \cdot P(B) \) sin comprobar la independencia. La regla del producto general usa \( P(A),P(B \mid A) \); el atajo \( P(A)P(B) \) solo es válido si la independencia está justificada (por diseño del proceso o verificada con datos).
  • Olvidar la tasa base. Toda probabilidad a posteriori mezcla dos ingredientes: la evidencia (sensibilidad, falsos positivos) y la prevalencia a priori. Omitir la segunda infla dramáticamente el resultado.
  • Consejo práctico: ante cualquier problema de probabilidad con dos variables, dibuja primero la tabla de contingencia o el árbol. El 90 % de los errores desaparecen al organizar los datos antes de calcular.

Ejercicios

Ejercicio 1. Con la tabla de contingencia canal × satisfacción de la lección, calcula: (a) \( P(\text{App} \cup \text{Satisfecho}) \); (b) \( P(\text{No satisfecho} \mid \text{App}) \); (c) ¿son «App» y «Satisfecho» independientes? Justifícalo con números.

Ejercicio 2. En Madrid-Chamberí, el 61 % de los tickets se pagan con tarjeta. El 25 % de los tickets con tarjeta superan los 50 €, mientras que solo el 10 % de los tickets sin tarjeta superan esa cifra. (a) Dibuja mentalmente (o en papel) el árbol y calcula la probabilidad de que un ticket cualquiera supere los 50 €. (b) Un ticket supera los 50 €: ¿probabilidad de que se pagara con tarjeta?

Ejercicio 3. Marta prepara un modelo de predicción de bajas del Club Nova: el 3 % de los socios se dan de baja cada año; el modelo señala al 80 % de los que se darán de baja, pero también (incorrectamente) al 9 % de los que no. Un socio aparece señalado: ¿cuál es la probabilidad de que realmente vaya a darse de baja? ¿Merece la pena llamarle para ofrecerle un descuento de retención que cuesta 15 € si un socio retenido aporta de media 120 € al año? Razónalo.

Soluciones

Solución 1. (a) Regla de la suma general: \( P(\text{App}) + P(\text{S}) - P(\text{App} \cap \text{S}) = \frac{64}{640} + \frac{456}{640} - \frac{40}{640} = \frac{480}{640} = 0{,}75 \). (b) \( P(\text{No S} \mid \text{App}) = 24/64 = 0{,}375 \). (c) No: \( P(\text{S} \mid \text{App}) = 0{,}625 \neq 0{,}7125 = P(\text{S}) \). Saber que la respuesta vino de la app rebaja la probabilidad de satisfacción, luego son dependientes. Error frecuente en (a): olvidar restar los 40 satisfechos de la app, que están contados en ambos sumandos.

Solución 2. (a) Probabilidad total: \( P(>50) = 0{,}61 \times 0{,}25 + 0{,}39 \times 0{,}10 = 0{,}1525 + 0{,}039 = 0{,}1915 \), un 19,15 % de los tickets. (b) Bayes: \( P(\text{Tarjeta} \mid >50) = 0{,}1525 / 0{,}1915 \approx 0{,}796 \). Casi el 80 % de los tickets grandes van con tarjeta, frente al 61 % general: el importe alto «tira» hacia la tarjeta. Error frecuente: responder 0,25 en (b) — eso es \( P(>50 \mid \text{Tarjeta}) \), la condicional traspuesta.

Solución 3. Probabilidad total de ser señalado: \( P(\text{Señal}) = 0{,}03 \times 0{,}80 + 0{,}97 \times 0{,}09 = 0{,}024 + 0{,}0873 = 0{,}1113 \). Bayes: \( P(\text{Baja} \mid \text{Señal}) = 0{,}024/0{,}1113 \approx 0{,}216 \). Solo 1 de cada 5 señalados se dará de baja realmente — la tasa base del 3 % pesa mucho. ¿Merece la pena? Cálculo orientativo por socio señalado: coste seguro de 15 €; beneficio esperado si evita la baja ≈ \( 0{,}216 \times 120 = 25{,}92 \) € (suponiendo, simplificando, que el descuento retiene al socio). Como 25,92 € > 15 €, la llamada compensa aunque el 78 % de las llamadas «sobren». Retroalimentación: este razonamiento de «valor esperado» lo formalizaremos en la siguiente lección; y ojo con la trampa habitual de descartar el modelo «porque falla el 78 % de las veces»: con sucesos raros, la vara de medir no es el porcentaje de aciertos sino si la probabilidad a posteriori (21,6 %) mejora lo suficiente la tasa base (3 %) para actuar con rentabilidad — aquí la multiplica por 7.

Conclusión

Ya sabemos operar con probabilidades: la regla de la suma (restando la intersección cuando los sucesos son compatibles), la probabilidad condicionada como recorte del espacio muestral, la regla del producto para intersecciones, y la diferencia crucial entre independencia (la información no cambia nada) e incompatibilidad (la información lo cambia todo). Con las tablas de contingencia y los diagramas de árbol como soporte, el teorema de la probabilidad total nos dio la visión «hacia delante» (el 10,1 % de pedidos llega tarde) y el teorema de Bayes la visión «hacia atrás» (una alerta de fraude solo acierta el 10,4 % de las veces), con la falacia de la tasa base como advertencia permanente.

Hasta aquí hemos trabajado con sucesos descritos con palabras. El siguiente paso es traducir el azar a números: en lugar de «el pedido llega tarde», definir una variable que cuente cuántos pedidos llegan tarde o mida cuántas horas tarda cada uno, y asignar probabilidades a todos sus valores posibles de una vez. Esa es la idea de variable aleatoria, y con ella la de esperanza matemática — el fundamento del «valor esperado» que acabamos de usar en el ejercicio de retención. Lo vemos en Variables Aleatorias y Distribuciones de Probabilidad.

© Copyright 2026. Todos los derechos reservados