Con la binomial y la normal cubrimos mucho terreno, pero no todo: ¿cuántos clientes llegarán a una caja en los próximos 10 minutos? (no hay un \( n \) fijo de ensayos); ¿cuántos clientes tendrá que abordar el promotor del Club Nova hasta captar al primer socio? (el número de intentos es justo la incógnita); ¿cuántas unidades defectuosas aparecerán al inspeccionar 8 de una caja de 50? (sin reemplazo, la \( p \) cambia en cada extracción); ¿cuánto tiempo pasará hasta el próximo pedido online? (una espera continua y asimétrica, donde ya vimos que la normal fracasa). Cada pregunta tiene su plantilla: Poisson, geométrica, hipergeométrica, uniforme y exponencial. Esta lección las presenta una a una con el criterio del analista — reconocer la situación, identificar los parámetros, calcular — y termina con la tabla resumen que te permitirá elegir la distribución correcta de un vistazo.
Contenido
- Distribución de Poisson: sucesos por unidad de tiempo o espacio
- Poisson como límite de la binomial: el caso del fraude
- Distribución geométrica: intentos hasta el primer éxito
- Distribución hipergeométrica: muestreo sin reemplazo
- Distribución uniforme continua: la ignorancia repartida
- Distribución exponencial: el tiempo entre sucesos
- Tabla resumen: qué plantilla usar en cada situación
Distribución de Poisson: sucesos por unidad de tiempo o espacio
La Poisson modela el número de sucesos que ocurren en un intervalo fijo de tiempo (o de espacio), cuando los sucesos ocurren de forma independiente, a un ritmo medio constante y de uno en uno. Ejemplos NovaMarket: pedidos online por hora, clientes que llegan a una caja en 10 minutos, incidencias de reparto por día, erratas por página de catálogo.
Su único parámetro es \( \lambda \) (lambda): el número medio de sucesos por intervalo. Si \( X \sim \text{Poisson}(\lambda) \):
\[ P(X = k) = \frac{e^{-\lambda} , \lambda^k}{k!} \qquad k = 0, 1, 2, \dots \]
donde \( e \approx 2{,}71828 \). Dos rasgos muy característicos:
- \( X \) no tiene máximo: puede tomar cualquier valor entero desde 0 en adelante (a diferencia de la binomial, que se detiene en \( n \)).
- Media y varianza coinciden: \( E(X) = \lambda \) y \( \operatorname{Var}(X) = \lambda \) (luego \( \sigma = \sqrt{\lambda} \)). Es una firma útil: si en tus datos de recuentos la varianza es mucho mayor que la media, la Poisson probablemente no encaja.
- \( \lambda \) escala con el intervalo: si llegan 6 pedidos por hora, en media hora \( \lambda = 3 \) y en un día de 24 h, \( \lambda = 144 \).
Ejemplo trabajado: incidencias de reparto. El servicio e-commerce registra de media \( \lambda = 3 \) incidencias de reparto al día (direcciones erróneas, ausencias, roturas), estables e independientes entre sí. El equipo de atención al cliente puede absorber hasta 4 incidencias diarias; con 5 o más hay que reforzar. ¿Con qué frecuencia hará falta refuerzo?
Calculamos la cola con el complementario, término a término (con \( e^{-3} \approx 0{,}0498 \)):
| \( k \) | Cálculo | \( P(X=k) \) |
|---|---|---|
| 0 | \( e^{-3} \) | 0,0498 |
| 1 | \( e^{-3} \cdot 3^1 / 1! = 0{,}0498 \times 3 \) | 0,1494 |
| 2 | \( e^{-3} \cdot 3^2 / 2! = 0{,}0498 \times 4{,}5 \) | 0,2240 |
| 3 | \( e^{-3} \cdot 3^3 / 3! = 0{,}0498 \times 4{,}5 \) | 0,2240 |
| 4 | \( e^{-3} \cdot 3^4 / 4! = 0{,}0498 \times 3{,}375 \) | 0,1680 |
| Suma \( P(X \leq 4) \): | 0,8153 |
\[ P(X \geq 5) = 1 - 0{,}8153 = 0{,}1847 \]
Casi uno de cada cinco días habrá que reforzar, aunque la media sea solo 3. De nuevo el mensaje del Módulo 4: el valor esperado no basta; la distribución completa dice con qué frecuencia llegan los días malos. (Fíjate también en que lo más probable no es un único valor: \( k = 2 \) y \( k = 3 \) empatan — ocurre siempre que \( \lambda \) es entero.)
Poisson como límite de la binomial: el caso del fraude
La Poisson no cae del cielo: es la binomial llevada al extremo de \( n \) grande y \( p \) pequeña. Cuando hay muchísimos ensayos, cada uno con probabilidad minúscula de éxito, la binomial \( B(n, p) \) se aproxima muy bien por una Poisson con \( \lambda = np \). Regla práctica habitual: \( n \geq 100 \) y \( p \leq 0{,}05 \) (mejor cuanto mayor \( n \) y menor \( p \)).
Comprobación con el fraude online. La prevalencia de fraude es \( p = 0{,}005 \). En un día con \( n = 400 \) pedidos, el número de fraudes es \( B(400;\ 0{,}005) \), con \( \lambda = np = 2 \).
- Binomial exacta: \( P(X = 0) = 0{,}995^{400} \approx 0{,}1347 \).
- Poisson: \( P(X = 0) = e^{-2} \approx 0{,}1353 \).
Diferencia: 6 diezmilésimas. La ganancia es enorme en comodidad: nada de \( \binom{400}{k} \); la Poisson responde con \( e^{-2} \lambda^k / k! \). Por ejemplo, \( P(X \geq 4) = 1 - e^{-2}(1 + 2 + 2 + \tfrac{4}{3}) = 1 - 0{,}1353 \times 6{,}3333 \approx 1 - 0{,}8569 = 0{,}1431 \): un 14 % de los días de 400 pedidos traerán 4 o más intentos de fraude. Por eso a la Poisson se la llama a veces «la ley de los sucesos raros»: fraudes, accidentes, reclamaciones, roturas — individualmente improbables, pero con muchísimas ocasiones de ocurrir.
Distribución geométrica: intentos hasta el primer éxito
Cambio de pregunta: ya no contamos éxitos en \( n \) ensayos, sino cuántos ensayos hacen falta hasta el primer éxito. Si los ensayos son Bernoulli independientes con probabilidad \( p \), la variable \( X \) = «número del intento en el que llega el primer éxito» sigue una distribución geométrica:
\[ P(X = k) = (1-p)^{k-1} , p \qquad k = 1, 2, 3, \dots \]
La lógica es pura regla del producto: \( k-1 \) fracasos seguidos y luego un éxito. Su esperanza es intuitiva y potente:
\[ E(X) = \frac{1}{p} \]
Si el éxito tiene probabilidad 1/8, en promedio hace falta esperar 8 intentos.
Ejemplo trabajado: captación en tienda. NovaMarket instala un stand del Club Nova en Barcelona-Gràcia. La experiencia de campañas anteriores dice que 1 de cada 8 clientes abordados acaba haciéndose socio (\( p = 0{,}125 \)).
- Intentos esperados hasta el primer socio: \( E(X) = 1/0{,}125 = 8 \) clientes abordados.
- Probabilidad de captarlo justo al tercer intento: \( P(X = 3) = 0{,}875^2 \times 0{,}125 = 0{,}7656 \times 0{,}125 \approx 0{,}0957 \).
- Probabilidad de tener el primer socio en los 5 primeros contactos: lo más cómodo es el complementario, «que los 5 primeros fallen»: \( P(X \leq 5) = 1 - 0{,}875^5 = 1 - 0{,}5129 = 0{,}4871 \).
La geométrica tiene una propiedad famosa: carece de memoria. Si el promotor lleva 10 fracasos seguidos, la probabilidad de que el próximo cliente diga que sí sigue siendo 0,125: los fracasos previos no «acumulan» suerte. Es el antídoto formal contra la falacia del jugador («ya me toca») que desmontamos en el Módulo 3.
Distribución hipergeométrica: muestreo sin reemplazo
En la lección anterior anunciamos este modelo al listar cuándo la binomial falla. La hipergeométrica describe el número de éxitos al extraer una muestra sin reemplazo de una población pequeña: cada extracción cambia la composición del lote, así que la \( p \) no es constante ni los ensayos independientes.
Parámetros: \( N \) = tamaño de la población, \( K \) = número de «éxitos» que contiene, \( n \) = tamaño de la muestra extraída. La probabilidad de encontrar exactamente \( k \) éxitos es un recuento de combinaciones (enfoque clásico de 03-01: casos favorables entre casos posibles):
\[ P(X = k) = \frac{\dbinom{K}{k} \dbinom{N-K}{n-k}}{\dbinom{N}{n}} \]
y su media es la que dicta la intuición: \( E(X) = n \cdot \dfrac{K}{N} \).
Ejemplo trabajado: control de calidad de fruta. Llega a Madrid-Chamberí un palé con \( N = 50 \) cajas de fresas, de las cuales — sin que lo sepamos — \( K = 5 \) están en mal estado. El protocolo inspecciona \( n = 8 \) cajas al azar y rechaza el palé si aparece alguna defectuosa. ¿Qué probabilidad hay de que el palé pase el control pese a estar contaminado?
Pasar el control es \( X = 0 \). En lugar de pelear con los combinatorios grandes, encadenamos probabilidades condicionadas (regla del producto, Módulo 3), que es equivalente y más transparente:
\[ P(X=0) = \frac{45}{50} \times \frac{44}{49} \times \frac{43}{48} \times \frac{42}{47} \times \frac{41}{46} \times \frac{40}{45} \times \frac{39}{44} \times \frac{38}{43} \approx 0{,}4015 \]
(cada factor es «la siguiente caja inspeccionada también está bien», con una caja buena menos en cada paso). Así que \( P(\text{rechazar}) = 1 - 0{,}4015 = 0{,}5985 \): el control solo detecta este nivel de contaminación un 60 % de las veces — dato clave para decidir si inspeccionar más cajas. El número esperado de defectuosas en la muestra es \( E(X) = 8 \times \frac{5}{50} = 0{,}8 \).
¿Y la binomial? Con \( p = 5/50 = 0{,}10 \) daría \( P(X=0) = 0{,}9^8 \approx 0{,}4305 \) — parecido pero no igual, porque la muestra (8) es el 16 % del lote (50), por encima del umbral del 10 % que dimos como regla práctica. Con poblaciones grandes (8 tickets de entre miles) ambas coinciden y usamos la binomial por comodidad.
Distribución uniforme continua: la ignorancia repartida
La uniforme continua \( U(a, b) \) modela una variable continua de la que solo sabemos que cae en el intervalo \( [a, b] \), sin zonas más probables que otras: su densidad es una meseta plana de altura \( 1/(b-a) \). Es la más simple de las continuas y las probabilidades se calculan como proporciones de longitud:
\[ P(c \leq X \leq d) = \frac{d - c}{b - a} \qquad E(X) = \frac{a+b}{2} \qquad \sigma = \frac{b-a}{\sqrt{12}} \]
Ejemplo NovaMarket. El cliente elige para su pedido online una franja de entrega de 2 horas (por ejemplo, 17:00–19:00), y dentro de la franja el momento de llegada del repartidor es, a efectos prácticos, uniforme: \( T \sim U(0, 120) \) minutos.
- Probabilidad de que llegue en la primera media hora: \( \frac{30 - 0}{120} = 0{,}25 \).
- Espera esperada desde el inicio de la franja: \( E(T) = 60 \) minutos, con \( \sigma = 120/\sqrt{12} \approx 34{,}6 \) min.
- Probabilidad de que llegue entre las 18:30 y las 19:00: \( \frac{120 - 90}{120} = 0{,}25 \) — cualquier tramo de 30 minutos vale lo mismo: esa es la firma de la uniforme.
Su papel en la práctica es doble: modelo honesto cuando de verdad no hay información direccional, y punto de partida de simulaciones (los generadores de números aleatorios producen uniformes que luego se transforman en cualquier otra distribución).
Distribución exponencial: el tiempo entre sucesos
Si los sucesos llegan según un proceso de Poisson con ritmo \( \lambda \) (por unidad de tiempo), el tiempo de espera hasta el próximo suceso sigue una distribución exponencial. Son las dos caras de la misma moneda: Poisson cuenta cuántos en un intervalo; la exponencial mide cuánto tarda el siguiente.
Es continua, solo toma valores positivos y su F.d.a. (la probabilidad acumulada que aprendimos a leer en 03-03) tiene fórmula cerrada:
\[ F(t) = P(T \leq t) = 1 - e^{-\lambda t} \qquad E(T) = \frac{1}{\lambda} \qquad \sigma = \frac{1}{\lambda} \]
Ejemplo trabajado: pedidos online de madrugada. En la franja nocturna, la web de NovaMarket recibe pedidos a un ritmo medio de \( \lambda = 6 \) pedidos/hora (uno cada 10 minutos, en media: \( E(T) = 1/6 \) h = 10 min).
- Probabilidad de que el próximo pedido llegue en 5 minutos o menos: con \( t \) en horas, \( P(T \leq \tfrac{1}{12}) = 1 - e^{-6/12} = 1 - e^{-0{,}5} \approx 0{,}3935 \).
- Probabilidad de más de 20 minutos sin pedidos: \( P(T > \tfrac{1}{3}) = e^{-6/3} = e^{-2} \approx 0{,}1353 \).
La densidad exponencial es fuertemente asimétrica a la derecha: muchísimas esperas cortas y una cola de esperas largas — exactamente la silueta que, en la lección anterior, hacía fracasar a la normal con los tiempos de entrega. Además, hereda de la geométrica (su prima discreta) la falta de memoria: si llevas 10 minutos sin pedidos, la probabilidad de que el siguiente tarde más de otros 20 sigue siendo \( e^{-2} \); el sistema no «acumula» retraso. Esta pareja Poisson-exponencial es la base de la teoría de colas, con la que se dimensionan cajas, líneas telefónicas y repartidores: cuántas cajas abrir para que la espera media no supere un umbral es, en el fondo, un problema de \( \lambda \)s. Nos basta aquí con saber que esa puerta existe.
Tabla resumen: qué plantilla usar en cada situación
| Distribución | Tipo | Pregunta a la que responde | Parámetros | \( E(X) \) | Ejemplo NovaMarket |
|---|---|---|---|---|---|
| Bernoulli | Discreta | ¿Éxito o fracaso en 1 ensayo? | \( p \) | \( p \) | ¿Este ticket es con tarjeta? |
| Binomial | Discreta | ¿Cuántos éxitos en \( n \) ensayos independientes? | \( n, p \) | \( np \) | Tickets con tarjeta de los próximos 10 |
| Poisson | Discreta | ¿Cuántos sucesos en un intervalo fijo? | \( \lambda \) | \( \lambda \) | Incidencias de reparto al día |
| Geométrica | Discreta | ¿Cuántos intentos hasta el primer éxito? | \( p \) | \( 1/p \) | Clientes abordados hasta captar un socio |
| Hipergeométrica | Discreta | ¿Cuántos éxitos muestreando sin reemplazo? | \( N, K, n \) | \( nK/N \) | Cajas defectuosas en la inspección del palé |
| Uniforme | Continua | ¿Dónde cae un valor sin zonas preferidas? | \( a, b \) | \( (a+b)/2 \) | Minuto de llegada dentro de la franja de entrega |
| Exponencial | Continua | ¿Cuánto tarda el próximo suceso? | \( \lambda \) | \( 1/\lambda \) | Minutos hasta el próximo pedido online |
| Normal | Continua | ¿Cómo se reparte una suma de muchos efectos? | \( \mu, \sigma \) | \( \mu \) | Venta diaria de una tienda |
El método del analista, en tres preguntas: ¿cuento o mido? (discreta vs continua); ¿qué cuento/mido exactamente? (éxitos en \( n \) fijos → binomial; sucesos por intervalo → Poisson; intentos hasta éxito → geométrica; tiempo hasta suceso → exponencial); ¿se cumplen los supuestos? (independencia, ritmo o \( p \) constantes, con o sin reemplazo).
Errores Comunes y Consejos
- Confundir binomial y Poisson. La binomial tiene un \( n \) fijo y conocido («de los 20 pedidos de hoy…»); la Poisson no tiene techo («las incidencias que surjan mañana…»). Si no puedes decir cuántos ensayos hay, no es binomial.
- Olvidar reescalar \( \lambda \) al cambiar el intervalo. Con 6 pedidos/hora, la Poisson de un cuarto de hora usa \( \lambda = 1{,}5 \), no 6. Y en la exponencial, \( \lambda \) y \( t \) deben ir en la misma unidad de tiempo — mezclar «por hora» con minutos es el error de cálculo más repetido.
- Contar mal la geométrica. \( P(X = 3) \) es «éxito exactamente en el 3.º» = \( q^2 p \), con dos fracasos previos, no tres. Y \( E(X) = 1/p \) cuenta intentos totales, incluido el del éxito.
- Usar binomial donde hay muestreo sin reemplazo de un lote pequeño. Si la muestra supera ~10 % de la población, la hipergeométrica y la binomial divergen; usa la hipergeométrica (o el encadenado de condicionadas, que es más transparente).
- Suponer uniformidad por pereza. «No sé nada» no siempre justifica la uniforme: las llegadas de clientes a lo largo del día tienen horas punta clarísimas. La uniforme es un modelo, no una excusa.
- Consejo: memoriza la firma de cada plantilla — Poisson: media = varianza; geométrica y exponencial: sin memoria; uniforme: tramos iguales, probabilidades iguales. Reconocer la firma en los datos reales es la mitad del trabajo de modelado.
Ejercicios
Ejercicio 1. En hora punta, a la caja rápida de Madrid-Centro llegan de media 4 clientes cada 10 minutos, de forma independiente y a ritmo estable. (a) Justifica la elección del modelo y da su parámetro. (b) Calcula la probabilidad de que en los próximos 10 minutos no llegue nadie (\( e^{-4} \approx 0{,}0183 \)). (c) La cajera puede atender hasta 5 clientes en 10 minutos; calcula la probabilidad de que se forme cola por exceso de llegadas (6 o más).
Ejercicio 2. En el stand del Club Nova (\( p = 0{,}125 \) por cliente abordado): (a) ¿Cuál es la probabilidad de que el primer socio del día llegue exactamente con el cuarto cliente abordado? (b) ¿Cuántos clientes cabe esperar abordar para captar el primero? (c) El promotor lleva 15 noes seguidos y afirma: «el próximo casi seguro que cae, ya me toca». Valóralo.
Ejercicio 3. De madrugada, los pedidos web llegan a ritmo \( \lambda = 6 \)/hora. (a) ¿Qué distribución sigue el tiempo hasta el próximo pedido y cuál es su media en minutos? (b) Calcula \( P(T \leq 5 \text{ min}) \). (c) El técnico de guardia quiere aprovechar para una pausa de 20 minutos justo después de despachar un pedido. ¿Probabilidad de que no entre ningún pedido durante la pausa? Resuélvelo por dos caminos: con la exponencial y con la Poisson del intervalo.
Soluciones
Solución 1. (a) Recuento de sucesos en un intervalo fijo, ritmo medio estable, llegadas independientes y de una en una: Poisson con \( \lambda = 4 \) (por bloque de 10 min). (b) \( P(X=0) = e^{-4} \approx 0{,}0183 \). (c) \( P(X \geq 6) = 1 - P(X \leq 5) \). Términos: 0,0183; 0,0733; 0,1465; 0,1954; 0,1954; 0,1563 → \( P(X \leq 5) \approx 0{,}7852 \), luego \( P(X \geq 6) \approx 0{,}2148 \). Uno de cada cinco bloques de 10 minutos desborda a la cajera. Error frecuente: plantearlo como binomial — no existe un «número de clientes candidatos» fijo.
Solución 2. (a) Geométrica: \( P(X = 4) = 0{,}875^3 \times 0{,}125 = 0{,}6699 \times 0{,}125 \approx 0{,}0837 \). (b) \( E(X) = 1/0{,}125 = 8 \) clientes. (c) Falso: por la falta de memoria de la geométrica, tras 15 fracasos la probabilidad del siguiente sigue siendo 0,125. Los intentos pasados no cargan el futuro — es la falacia del jugador. (Otra cosa es que una racha larguísima invite a cuestionar si \( p = 0{,}125 \) es correcto hoy; contrastar eso formalmente es materia del Módulo 5.)
Solución 3. (a) Exponencial con \( \lambda = 6 \)/h; \( E(T) = 1/6 \) h = 10 minutos. (b) \( P(T \leq 5 \text{ min}) = 1 - e^{-6 \times 5/60} = 1 - e^{-0{,}5} \approx 0{,}3935 \). (c) Camino exponencial: \( P(T > 20 \text{ min}) = e^{-6 \times 20/60} = e^{-2} \approx 0{,}1353 \). Camino Poisson: en 20 min, \( \lambda = 6 \times \tfrac{20}{60} = 2 \), y \( P(X = 0) = e^{-2} \approx 0{,}1353 \). Ambos coinciden — son la misma moneda por sus dos caras. Error frecuente: usar \( \lambda = 6 \) con \( t = 20 \) sin pasar a la misma unidad, obteniendo el absurdo \( e^{-120} \).
Conclusión
Tu caja de herramientas está completa: Bernoulli y binomial para éxitos en ensayos contados, Poisson para sucesos por intervalo (y como atajo de la binomial rara), geométrica para el primer éxito, hipergeométrica para muestreo sin reemplazo, uniforme para la incertidumbre plana y exponencial para tiempos de espera — con la normal reinando sobre las sumas de muchos efectos. La tabla resumen es tu mapa; los supuestos de cada plantilla, tu brújula. Queda la pieza que lo une todo y que convierte este módulo en la antesala de la inferencia: ¿por qué la normal aparece incluso cuando los datos de partida no son normales — como los importes de ticket? ¿Y qué distribución sigue la media de una muestra, ese número que llevamos usando desde el Módulo 1? La respuesta es el resultado más importante de toda la estadística: el Teorema Central del Límite.
Curso de Estadística
Módulo 1: Introducción a la Estadística
Módulo 2: Descripción de Datos
- Medidas de Tendencia Central
- Medidas de Dispersión
- Medidas de Posición y Valores Atípicos
- Representación Gráfica de Datos
Módulo 3: Probabilidad
- Conceptos Básicos de Probabilidad
- Reglas de Probabilidad
- Variables Aleatorias y Distribuciones de Probabilidad
Módulo 4: Distribuciones de Probabilidad
- Distribución Binomial
- Distribución Normal
- Otras Distribuciones Importantes
- El Teorema Central del Límite
Módulo 5: Inferencia Estadística
- Estimación de Parámetros
- Intervalos de Confianza
- Pruebas de Hipótesis
- Errores, Potencia y Tamaño Muestral
Módulo 6: Análisis de Datos
- Análisis de Correlación
- Análisis de Regresión
- Análisis de Varianza (ANOVA)
- Análisis de Datos Categóricos: Chi-Cuadrado
