En la lección anterior asomó una campana: al crecer \( n \), la binomial de los cupones se suavizaba hasta adoptar una silueta simétrica y acampanada. Esa silueta es la distribución normal (o gaussiana), la plantilla más importante de toda la estadística — y una vieja conocida: es la forma «campaniforme» que ya describimos al estudiar histogramas en el Módulo 2, y la razón de ser de la regla empírica 68-95-99,7 que entonces aceptamos sin justificar. En esta lección la convertimos en herramienta de cálculo: aprenderás qué significan sus dos parámetros \( \mu \) y \( \sigma \), a estandarizar cualquier valor (reencontrándote con las puntuaciones z de 02-03), a leer la tabla Z para obtener probabilidades y percentiles, y a aplicarlo todo a decisiones reales de NovaMarket: ¿qué probabilidad hay de que una tienda supere los 50.000 € de venta en un día? ¿Cuánto efectivo hay que preparar para cubrir el 95 % de los días? Cerraremos con algo igual de valioso: cómo sospechar que una variable no es normal antes de usar la plantilla.
Contenido
- Por qué la normal aparece por todas partes
- La función de densidad y los parámetros \( \mu \) y \( \sigma \)
- Propiedades y la regla empírica 68-95-99,7
- Estandarización: la normal estándar y la puntuación z
- Cómo leer la tabla Z
- Cálculo de probabilidades: la venta diaria de las tiendas
- Percentiles: planificar la caja para el 95 % de los días
- Comprobación informal de normalidad (y un contraejemplo: los tiempos de entrega)
Por qué la normal aparece por todas partes
La venta diaria de una tienda NovaMarket es la suma de miles de tickets individuales. La estatura de una persona es la suma de miles de pequeños efectos genéticos y ambientales. El error de una báscula es la suma de muchas perturbaciones diminutas. El patrón se repite: cuando una magnitud resulta de sumar muchas contribuciones pequeñas e independientes, su distribución tiende a ser normal, casi con independencia de cómo sea cada contribución individual. Este hecho asombroso tiene nombre — Teorema Central del Límite — y le dedicamos entera la lección 04-04; por ahora nos basta la consecuencia práctica: muchísimas variables de negocio «de tipo suma o promedio» son aproximadamente normales, y por eso esta plantilla es la primera que un analista prueba.
En NovaMarket, la candidata perfecta es la venta diaria por tienda: en el Módulo 2 vimos que su histograma era simétrico y acampanado, con media 43.983 € y desviación típica 6.200 €. En esta lección la modelaremos como
\[ V \sim N(43.983;\ 6.200) \]
que se lee «\( V \) sigue una distribución normal de media 43.983 y desviación típica 6.200».
La función de densidad y los parámetros ( \mu ) y ( \sigma )
La normal es una distribución continua, así que — como vimos en 03-03 — se describe con una función de densidad, y las probabilidades son áreas bajo la curva. Su densidad tiene fórmula célebre:
\[ f(x) = \frac{1}{\sigma \sqrt{2\pi}} , e^{-\frac{(x-\mu)^2}{2\sigma^2}} \]
Tranquilidad: nunca calcularemos con esta fórmula directamente (las áreas bajo ella no tienen fórmula cerrada; para eso están las tablas). Lo importante es lo que dicen sus dos parámetros:
| Parámetro | Qué controla | Efecto visual |
|---|---|---|
| \( \mu \) (media) | El centro: dónde está el pico de la campana | Cambiar \( \mu \) desliza la campana a izquierda o derecha, sin deformarla |
| \( \sigma \) (desviación típica) | La anchura: cuánto se dispersan los valores | \( \sigma \) grande = campana baja y ancha; \( \sigma \) pequeña = alta y estrecha |
Cada pareja \( (\mu, \sigma) \) define una normal distinta: la venta diaria de la cadena es \( N(43.983;\ 6.200) \), pero la de una tienda pequeña como Cuenca podría ser \( N(21.000;\ 2.900) \) — misma forma, distinto centro y anchura. La familia normal es una plantilla con dos diales, igual que la binomial lo era con \( n \) y \( p \).
Propiedades y la regla empírica 68-95-99,7
Toda normal, sea cual sea su \( \mu \) y su \( \sigma \), cumple:
- Simetría perfecta alrededor de \( \mu \): por tanto media = mediana = moda (recuerda del Módulo 2 que en distribuciones simétricas las tres coinciden).
- Unimodal: un único pico, en \( \mu \), con colas que decaen suavemente hacia ambos lados sin tocar nunca el eje.
- El área total bajo la curva es 1 (es una distribución de probabilidad).
- \( P(V = x) = 0 \) para cualquier valor exacto: como toda continua, solo tienen probabilidad los intervalos. Consecuencia práctica: \( P(V > 50.000) \) y \( P(V \geq 50.000) \) son iguales.
Y la propiedad estrella, que en el Módulo 2 presentamos como «regla empírica» y ahora podemos enunciar como propiedad exacta de la normal:
| Intervalo | Probabilidad | Para \( V \sim N(43.983;\ 6.200) \) |
|---|---|---|
| \( \mu \pm 1\sigma \) | 68,3 % | entre 37.783 y 50.183 € |
| \( \mu \pm 2\sigma \) | 95,4 % | entre 31.583 y 56.383 € |
| \( \mu \pm 3\sigma \) | 99,7 % | entre 25.383 y 62.583 € |
Lectura de negocio inmediata: un día con ventas de 60.000 € en una tienda media está a casi \( 3\sigma \) — rarísimo si todo es normal, así que merece investigación (¿festivo?, ¿promoción?, ¿error de registro?). Es la misma lógica de los valores atípicos de 02-03, ahora con probabilidades exactas detrás.
Estandarización: la normal estándar y la puntuación z
Hay infinitas normales, pero solo necesitamos una tabla, gracias a un truco: cualquier normal se convierte en la normal estándar \( Z \sim N(0;\ 1) \) (media 0, desviación típica 1) mediante la transformación
\[ z = \frac{x - \mu}{\sigma} \]
Esta fórmula es exactamente la puntuación z del Módulo 2: «¿a cuántas desviaciones típicas de la media está este valor?». Entonces la usábamos para comparar valores de escalas distintas; ahora, además, nos da probabilidades: si \( V \) es normal, el valor estandarizado \( z \) es una observación de la normal estándar, y su probabilidad se busca en la tabla.
Ejemplo inmediato: un día de 50.000 € en ventas equivale a
\[ z = \frac{50.000 - 43.983}{6.200} = \frac{6.017}{6.200} \approx 0{,}97 \]
es decir, 0,97 desviaciones típicas por encima de la media. Toda pregunta sobre \( V \) se traduce así a una pregunta sobre \( Z \).
Cómo leer la tabla Z
La tabla Z (o tabla de la normal estándar) recoge la función de distribución acumulada de \( Z \): para cada valor \( z \), da \( \Phi(z) = P(Z \leq z) \), el área a la izquierda de \( z \). Se organiza así: las filas dan las unidades y décimas de \( z \), y las columnas, la centésima. Un extracto:
| \( z \) | ,00 | ,01 | ,02 | ,03 | ,04 | ,05 | ,06 | ,07 | ,08 | ,09 |
|---|---|---|---|---|---|---|---|---|---|---|
| 0,9 | 0,8159 | 0,8186 | 0,8212 | 0,8238 | 0,8264 | 0,8289 | 0,8315 | 0,8340 | 0,8365 | 0,8389 |
| 1,4 | 0,9192 | 0,9207 | 0,9222 | 0,9236 | 0,9251 | 0,9265 | 0,9279 | 0,9292 | 0,9306 | 0,9319 |
| 1,6 | 0,9452 | 0,9463 | 0,9474 | 0,9484 | 0,9495 | 0,9505 | 0,9515 | 0,9525 | 0,9535 | 0,9545 |
Para buscar \( \Phi(0{,}97) \): fila «0,9», columna «,07» → 0,8340. Es decir, \( P(Z \leq 0{,}97) = 0{,}8340 \).
Con el área a la izquierda y dos reglas se resuelve todo:
- Área a la derecha (complementario): \( P(Z > z) = 1 - \Phi(z) \).
- Valores negativos (simetría): \( \Phi(-z) = 1 - \Phi(z) \). Por ejemplo, \( \Phi(-0{,}97) = 1 - 0{,}8340 = 0{,}1660 \). (Muchas tablas impresas solo traen la mitad positiva por esta razón.)
- Entre dos valores: \( P(a < Z < b) = \Phi(b) - \Phi(a) \) — el área hasta \( b \) menos el área hasta \( a \).
Cálculo de probabilidades: la venta diaria de las tiendas
Caso 1 — «¿Qué probabilidad hay de que una tienda supere hoy los 50.000 €?» Marta lo necesita para dimensionar los refuerzos de personal. Método en tres pasos, que será siempre el mismo:
- Estandarizar: \( z = \dfrac{50.000 - 43.983}{6.200} \approx 0{,}97 \).
- Tabla: \( \Phi(0{,}97) = 0{,}8340 \).
- Traducir la pregunta: pedimos el área a la derecha: \( P(V > 50.000) = 1 - 0{,}8340 = 0{,}1660 \).
Aproximadamente el 16,6 % de los días una tienda media supera los 50.000 €. Sobre 42 tiendas, cabría esperar que unas \( 42 \times 0{,}166 \approx 7 \) tiendas superen esa cifra en un día cualquiera.
Caso 2 — «¿Y de que caiga por debajo de 35.000 €?» (umbral que dispara una revisión de tienda):
- \( z = \dfrac{35.000 - 43.983}{6.200} = \dfrac{-8.983}{6.200} \approx -1{,}45 \).
- Por simetría: \( \Phi(-1{,}45) = 1 - \Phi(1{,}45) = 1 - 0{,}9265 = 0{,}0735 \).
- La pregunta ya pedía área a la izquierda: \( P(V < 35.000) \approx 0{,}0735 \), un 7,4 % de los días.
Ojo con la interpretación: que el umbral salte un 7,4 % de los días con el negocio funcionando con normalidad significa que, en una cadena de 42 tiendas, cada día habrá unas 3 tiendas por debajo de 35.000 € sin que pase nada raro. Si el protocolo de revisión no lo tiene en cuenta, el equipo perseguirá fantasmas.
Caso 3 — «¿Probabilidad de un día "típico", entre 40.000 y 50.000 €?»
- \( z_1 = \dfrac{40.000 - 43.983}{6.200} \approx -0{,}64 \); \( z_2 \approx 0{,}97 \).
- \( \Phi(-0{,}64) = 1 - 0{,}7389 = 0{,}2611 \); \( \Phi(0{,}97) = 0{,}8340 \).
- \( P(40.000 < V < 50.000) = 0{,}8340 - 0{,}2611 = 0{,}5729 \approx 57{,}3,% \).
Percentiles: planificar la caja para el 95 % de los días
A veces la pregunta va al revés: no «¿qué probabilidad tiene este valor?» sino «¿qué valor deja debajo una probabilidad dada?». Es el problema de los percentiles del Módulo 2, ahora resuelto con el modelo.
Caso: efectivo y personal para el percentil 95. Operaciones quiere planificar tesorería y turnos para cubrir «todos los días salvo el 5 % más fuerte». Buscamos el valor \( v_{95} \) tal que \( P(V \leq v_{95}) = 0{,}95 \).
- Tabla al revés: buscamos dentro de la tabla el área 0,9500 y leemos qué \( z \) le corresponde. Está justo entre \( \Phi(1{,}64) = 0{,}9495 \) y \( \Phi(1{,}65) = 0{,}9505 \); se toma el valor intermedio \( z_{95} = 1{,}645 \) (un clásico que conviene memorizar).
- Des-estandarizar (despejar \( x \) en la fórmula de \( z \)):
\[ x = \mu + z \cdot \sigma = 43.983 + 1{,}645 \times 6.200 = 43.983 + 10.199 = 54.182 \text{ €} \]
Preparando la operativa para 54.182 € de venta diaria, una tienda media queda cubierta el 95 % de los días. El mismo método hacia abajo: el percentil 1 (para alertas de caída grave) usa \( z = -2{,}33 \) (porque \( \Phi(2{,}33) = 0{,}9901 \)) y da \( 43.983 - 2{,}33 \times 6.200 \approx 29.537 \) €.
Otros valores de \( z \) que usarás una y otra vez (guárdalos):
| Percentil | 90 % | 95 % | 97,5 % | 99 % | 99,5 % |
|---|---|---|---|---|---|
| \( z \) | 1,282 | 1,645 | 1,960 | 2,326 | 2,576 |
El 1,96 en particular será protagonista absoluto del Módulo 5.
Comprobación informal de normalidad (y un contraejemplo: los tiempos de entrega)
La normal es una plantilla, no una obligación: antes de usarla hay que comprobar que encaja. La comprobación informal, con herramientas que ya dominas del Módulo 2:
- Histograma: ¿es aproximadamente simétrico, unimodal y acampanado? Colas muy largas hacia un lado, dos picos o un borde cortante descartan la normal.
- Media vs mediana: en una normal coinciden. Si se separan claramente (recuerda: media arrastrada por la cola), hay asimetría.
- Regla empírica: ¿caen de verdad ~68 % de los datos en \( \bar{x} \pm s \) y ~95 % en \( \bar{x} \pm 2s \)? Si no, la plantilla no describe tus datos.
- Test del valor imposible: si \( \mu - 2\sigma \) o \( \mu - 3\sigma \) caen en valores absurdos (negativos para importes o tiempos), la normal no puede ser una buena descripción.
Dos contraejemplos de la propia NovaMarket:
- El importe del ticket (media 32,40 €, \( s = 21{,}50 \) €). El test del valor imposible falla estrepitosamente: \( 32{,}40 - 2 \times 21{,}50 = -10{,}60 \) €. Una normal con esos parámetros asignaría probabilidad apreciable a tickets negativos (estandarizando el 0: \( z = -1{,}51 \), un 6,5 % de tickets «imposibles»). El histograma real, como vimos en el Módulo 2, es asimétrico a la derecha: muchos tickets pequeños y una cola de carros grandes. No usar la normal aquí.
- Los tiempos de entrega e-commerce. Si fueran normales, media y mediana coincidirían en 25,5 h, y de \( F(48) = 0{,}899 \) se deduciría \( z = 1{,}27 \) y por tanto \( \sigma = (48 - 25{,}5)/1{,}27 \approx 17{,}7 \) h. Pero entonces \( P(T < 0) \) correspondería a \( z = -1{,}44 \): ¡un 7,5 % de entregas en tiempo negativo! Los tiempos de entrega son asimétricos a la derecha (la mayoría rápidos, una cola de retrasos); su plantilla natural la veremos en la próxima lección.
Existe un gráfico especializado para esta comprobación, el QQ-plot (compara los cuantiles de tus datos con los de una normal: si el resultado es una recta, hay normalidad). Nos basta con saber que existe; con histograma, media-mediana y regla empírica se llega muy lejos. Y un adelanto que resolverá una paradoja pendiente: aunque el ticket individual no sea normal, la media de muchos tickets sí lo será — esa es la magia del Teorema Central del Límite.
Errores Comunes y Consejos
- Olvidar qué da la tabla. La tabla Z estándar da el área a la izquierda. Para «mayor que», resta de 1; para «entre», resta dos lecturas. Dibuja siempre una campana y sombrea el área pedida antes de tocar la tabla: es el antídoto número uno contra errores de signo.
- Equivocar el sentido con z negativos. \( \Phi(-1{,}45) \) no es \( -0{,}9265 \) ni \( 0{,}9265 \): es \( 1 - 0{,}9265 = 0{,}0735 \). Las probabilidades nunca son negativas ni mayores que 1.
- Estandarizar al revés (\( \frac{\mu - x}{\sigma} \)) cambia el signo de z y convierte un 16 % en un 84 %. La resta es siempre «valor menos media».
- Aplicar la normal sin comprobar la forma. Con variables asimétricas (importes, tiempos, rentas) la normal da probabilidades muy equivocadas en las colas — justo donde se toman las decisiones. Pasa siempre el «test del valor imposible».
- Confundir probabilidad de un día con recuento de tiendas. «El 7,4 % de los días una tienda baja de 35.000 €» y «hoy unas 3 de las 42 tiendas estarán por debajo» son dos lecturas del mismo número; en informes, da los dos para que dirección calibre.
- Consejo: memoriza el trío 68-95-99,7 y los z de la tabla de percentiles. Permiten estimar de cabeza en una reunión, sin tabla, si una cifra es rutinaria o extraordinaria.
Ejercicios
Ejercicio 1. Con \( V \sim N(43.983;\ 6.200) \), calcula la probabilidad de que la venta de mañana en Zaragoza-Centro esté entre 38.000 y 45.000 €. (Redondea los z a dos decimales; \( \Phi(0{,}16) = 0{,}5636 \).)
Ejercicio 2. El comité quiere una «alerta roja» que solo salte, por puro azar, el 1 % de los días con ventas más bajas. ¿Por debajo de qué cifra de venta diaria debe fijarse el umbral? ¿Y si se quisiera una «alerta amarilla» para el 10 % más bajo? (\( z_{90} = 1{,}282 \).)
Ejercicio 3. Un compañero propone calcular «la probabilidad de que un ticket supere los 60 €» como \( P(Z > \frac{60 - 32{,}40}{21{,}50}) = P(Z > 1{,}28) \approx 0{,}10 \). Explica por qué el resultado no es fiable y qué comprobaciones lo habrían delatado. ¿Con qué herramienta del Módulo 2 estimarías esa probabilidad honestamente?
Soluciones
Solución 1. \( z_1 = \frac{38.000 - 43.983}{6.200} \approx -0{,}97 \) y \( z_2 = \frac{45.000 - 43.983}{6.200} \approx 0{,}16 \). \( \Phi(-0{,}97) = 1 - 0{,}8340 = 0{,}1660 \); \( \Phi(0{,}16) = 0{,}5636 \). \( P = 0{,}5636 - 0{,}1660 = 0{,}3976 \approx 39{,}8,% \). Error frecuente: restar los z (\( 0{,}16 - (-0{,}97) \)) en lugar de las áreas — los z no son probabilidades.
Solución 2. Percentil 1: \( z = -2{,}33 \), luego \( x = 43.983 - 2{,}33 \times 6.200 = 43.983 - 14.446 = 29.537 \) €. Alerta amarilla (percentil 10): \( z = -1{,}282 \), \( x = 43.983 - 1{,}282 \times 6.200 \approx 43.983 - 7.948 = 36.035 \) €. Error frecuente: usar \( z \) positivo y obtener umbrales por encima de la media; para percentiles bajos, el z es negativo y se resta.
Solución 3. El importe del ticket no es normal: su histograma es asimétrico a la derecha (Módulo 2) y falla el test del valor imposible (\( \mu - 2\sigma = -10{,}60 \) €, tickets negativos). La normal con \( \mu = 32{,}40 \) y \( \sigma = 21{,}50 \) infravalora la cola derecha real, así que ese 10 % es poco fiable justo donde importa. Honestamente: usar la frecuencia relativa empírica — contar en la tabla de frecuencias/histograma del Módulo 2 qué proporción de tickets reales supera 60 € (enfoque frecuentista de 03-01). Lección de fondo: la plantilla no sustituye a mirar los datos.
Conclusión
Ya dominas la reina de las distribuciones: la normal queda definida por su centro \( \mu \) y su anchura \( \sigma \); la regla 68-95-99,7 da su esqueleto; y el método estandarizar → tabla → traducir convierte cualquier pregunta de probabilidad o percentil en dos operaciones y una consulta. Igual de importante: sabes detectar cuándo la campana no encaja — importes de ticket y tiempos de entrega lo han demostrado. Precisamente para esos casos rebeldes (recuentos de sucesos raros, tiempos de espera, intentos hasta un éxito) la estadística tiene más plantillas en el cajón, cada una con su situación típica de uso. En la próxima lección, Otras Distribuciones Importantes, completamos la caja de herramientas con la Poisson, la geométrica, la hipergeométrica, la uniforme y la exponencial.
Curso de Estadística
Módulo 1: Introducción a la Estadística
Módulo 2: Descripción de Datos
- Medidas de Tendencia Central
- Medidas de Dispersión
- Medidas de Posición y Valores Atípicos
- Representación Gráfica de Datos
Módulo 3: Probabilidad
- Conceptos Básicos de Probabilidad
- Reglas de Probabilidad
- Variables Aleatorias y Distribuciones de Probabilidad
Módulo 4: Distribuciones de Probabilidad
- Distribución Binomial
- Distribución Normal
- Otras Distribuciones Importantes
- El Teorema Central del Límite
Módulo 5: Inferencia Estadística
- Estimación de Parámetros
- Intervalos de Confianza
- Pruebas de Hipótesis
- Errores, Potencia y Tamaño Muestral
Módulo 6: Análisis de Datos
- Análisis de Correlación
- Análisis de Regresión
- Análisis de Varianza (ANOVA)
- Análisis de Datos Categóricos: Chi-Cuadrado
