En la lección de Errores, Potencia y Tamaño Muestral dejamos una deuda pendiente: cuando quisimos comparar las 42 tiendas de NovaMarket a base de contrastes t de dos en dos, descubrimos que multiplicar comparaciones dispara la probabilidad de falsas alarmas, y prometimos una herramienta que compara muchos grupos a la vez con un único contraste. Esa herramienta es el Análisis de Varianza (ANOVA, por ANalysis Of VAriance), y su lógica es una elegante paradoja: para comparar medias, analiza varianzas — en concreto, compara cuánto varían los grupos entre sí con cuánto varía la gente dentro de cada grupo. En esta lección construiremos esa lógica desde cero, calcularemos a mano una tabla ANOVA completa con datos de satisfacción de tres formatos de tienda, aprenderemos a leer la tabla de la distribución F, repasaremos los supuestos del método y veremos qué hacer después de rechazar: las comparaciones post-hoc y el tamaño del efecto.
Contenido
- Por qué no hacer muchos contrastes t: la deuda del Módulo 5
- La lógica del ANOVA: variabilidad entre grupos vs dentro de grupos
- Hipótesis y datos del caso: satisfacción en tres formatos de tienda
- La tabla ANOVA paso a paso: SC, gl, CM y F
- La distribución F y cómo leer su tabla
- Supuestos del ANOVA (versión operativa)
- Después de rechazar: comparaciones post-hoc (Tukey y Bonferroni)
- ¿Cómo de grande es el efecto? Eta cuadrado
- Hasta dónde llega esta lección: dos factores y alternativas no paramétricas
Por qué no hacer muchos contrastes t: la deuda del Módulo 5
Marta quiere saber si la satisfacción del cliente depende del formato de tienda. NovaMarket opera tres formatos: Express (urbano, pequeño), Estándar (supermercado de barrio) y Gran Superficie. Comparar tres grupos con contrastes t exige tres comparaciones (Express–Estándar, Express–Gran Superficie, Estándar–Gran Superficie), y ya sabemos lo que eso significa: si cada contraste tiene un 5 % de riesgo de falsa alarma, la probabilidad de que al menos una de las tres dé un falso positivo es
\[ 1 - 0{,}95^3 = 1 - 0{,}857 = 0{,}143 \]
un 14,3 % — casi el triple del 5 % pactado. Con más grupos el problema explota (recordemos el experimento mental de las 42 tiendas del Módulo 5, con un 88 % de probabilidad de alguna falsa alarma). El ANOVA resuelve el problema de raíz: plantea una única hipótesis global con un único α:
- \( H_0: \mu_{\text{Express}} = \mu_{\text{Estándar}} = \mu_{\text{Gran Sup.}} \) — todas las medias son iguales; el formato no influye
- \( H_1: \) al menos una media es distinta
Ojo al matiz de \( H_1 \): rechazar \( H_0 \) dice que «no todas son iguales», no cuáles difieren. Ese segundo paso vendrá después, con las comparaciones post-hoc.
La lógica del ANOVA: variabilidad entre grupos vs dentro de grupos
¿Cómo se detecta con varianzas si unas medias difieren? Piensa en dos escenarios con las mismas tres medias muestrales (7, 8 y 9):
- Escenario A: dentro de cada formato, las tiendas puntúan casi idéntico (todas las Express entre 6,8 y 7,2…). Las diferencias entre los grupos (7 vs 8 vs 9) destacan nítidas sobre ese silencio interno: parecen reales.
- Escenario B: dentro de cada formato hay de todo (tiendas Express entre 4 y 10…). Unas medias de 7, 8 y 9 podrían ser perfectamente fruto del azar muestral: la señal se ahoga en el ruido.
El ANOVA formaliza esa intuición con un cociente señal/ruido:
\[ F = \frac{\text{variabilidad ENTRE grupos (señal: lo que separa las medias)}}{\text{variabilidad DENTRO de los grupos (ruido: lo que varía la gente por azar)}} \]
- Si \( H_0 \) es cierta, ambas variabilidades estiman lo mismo (la varianza natural de la población) y F rondará el valor 1.
- Si algún grupo tiene una media distinta, la variabilidad entre se infla y F crece muy por encima de 1.
La pregunta «¿cuánto tiene que valer F para rechazar?» la responderá la distribución F. Antes, los cálculos.
Hipótesis y datos del caso: satisfacción en tres formatos de tienda
El equipo de Marta toma una muestra de 5 tiendas de cada formato y calcula la satisfacción media de los clientes de cada tienda (escala 0–10, redondeada a enteros para el cálculo a mano):
| Formato | Puntuaciones | Suma | Media \( \bar{x}_j \) |
|---|---|---|---|
| Express | 7, 8, 6, 7, 7 | 35 | 7,0 |
| Estándar | 8, 9, 8, 7, 8 | 40 | 8,0 |
| Gran Superficie | 9, 8, 9, 10, 9 | 45 | 9,0 |
En total \( N = 15 \) observaciones, \( k = 3 \) grupos, y la media global es \( \bar{x} = (35+40+45)/15 = 120/15 = 8{,}0 \). Las medias muestrales difieren (7, 8, 9), pero ya sabemos que eso solo no basta: hay que pesar la señal contra el ruido.
La tabla ANOVA paso a paso: SC, gl, CM y F
El corazón del ANOVA es la misma descomposición de variabilidad que vimos en la regresión: la suma de cuadrados total se parte en dos trozos.
\[ \underbrace{\sum_{j}\sum_{i} (x_{ij} - \bar{x})^2}{\text{SC Total}} ;=; \underbrace{\sum{j} n_j (\bar{x}j - \bar{x})^2}{\text{SC Entre}} ;+; \underbrace{\sum_{j}\sum_{i} (x_{ij} - \bar{x}j)^2}{\text{SC Dentro}} \]
Paso 1 — SC Entre (cada media de grupo frente a la global, ponderada por su tamaño):
\[ \text{SC}_{\text{Entre}} = 5(7-8)^2 + 5(8-8)^2 + 5(9-8)^2 = 5 + 0 + 5 = 10 \]
Paso 2 — SC Dentro (cada observación frente a la media de su grupo):
| Formato | Desviaciones respecto a su media | Cuadrados | Suma |
|---|---|---|---|
| Express (media 7) | 0, +1, −1, 0, 0 | 0, 1, 1, 0, 0 | 2 |
| Estándar (media 8) | 0, +1, 0, −1, 0 | 0, 1, 0, 1, 0 | 2 |
| Gran Sup. (media 9) | 0, −1, 0, +1, 0 | 0, 1, 0, 1, 0 | 2 |
\[ \text{SC}{\text{Dentro}} = 2 + 2 + 2 = 6 \qquad\qquad \text{SC}{\text{Total}} = 10 + 6 = 16 ; \checkmark \]
Paso 3 — Grados de libertad. Entre: \( k - 1 = 2 \). Dentro: \( N - k = 12 \). (Total: \( N - 1 = 14 = 2 + 12 \), la comprobación de siempre.)
Paso 4 — Cuadrados medios: cada SC dividida por sus gl, que la convierte en una varianza comparable:
\[ \text{CM}{\text{Entre}} = \frac{10}{2} = 5{,}0 \qquad\qquad \text{CM}{\text{Dentro}} = \frac{6}{12} = 0{,}5 \]
Paso 5 — El estadístico F y la tabla completa, en el formato estándar con que la presenta cualquier informe o programa:
| Fuente de variación | SC | gl | CM | F |
|---|---|---|---|---|
| Entre grupos (formato) | 10 | 2 | 5,0 | 10,0 |
| Dentro de grupos (residual) | 6 | 12 | 0,5 | |
| Total | 16 | 14 |
La señal es diez veces el ruido. ¿Es suficiente para rechazar?
La distribución F y cómo leer su tabla
Bajo \( H_0 \), el cociente \( F = \text{CM}{\text{Entre}}/\text{CM}{\text{Dentro}} \) sigue la distribución F (de Fisher), que es nueva en el curso, así que presentémosla bien:
- Es la distribución de un cociente de dos varianzas: solo toma valores positivos y es asimétrica con cola a la derecha.
- Depende de dos grados de libertad: los del numerador (entre grupos, aquí 2) y los del denominador (dentro, aquí 12). Se escribe \( F_{2;,12} \).
- El contraste es siempre unilateral derecho: solo los F grandes (mucha señal frente al ruido) desmienten a \( H_0 \).
Cómo leer la tabla F: a diferencia de la tabla t (una fila por gl), la tabla F es una rejilla de doble entrada para un α fijo (hay una tabla para α = 0,05, otra para 0,01…). En la tabla de α = 0,05: busca la columna de los gl del numerador (2) y la fila de los gl del denominador (12); el cruce da el valor crítico. Un extracto:
| gl denominador \ gl numerador | 1 | 2 | 3 | 4 |
|---|---|---|---|---|
| 10 | 4,96 | 4,10 | 3,71 | 3,48 |
| 12 | 4,75 | 3,89 | 3,49 | 3,26 |
| 14 | 4,60 | 3,74 | 3,34 | 3,11 |
El crítico es \( F_{0{,}05;,2;,12} = 3{,}89 \). Como nuestro \( F = 10{,}0 > 3{,}89 \), rechazamos \( H_0 \) al 5 % (de hecho también al 1 %: \( F_{0{,}01;,2;,12} = 6{,}93 \); el valor p es < 0,01). Conclusión para Marta: la satisfacción no es la misma en los tres formatos — el formato de tienda importa. Cuidado con el orden de los gl: \( F_{2;12} \neq F_{12;2} \); numerador siempre primero.
Supuestos del ANOVA (versión operativa)
Como todo contraste, el ANOVA se apoya en supuestos. En versión práctica:
| Supuesto | Qué exige | Cómo comprobarlo en la práctica |
|---|---|---|
| Independencia | Las observaciones no se influyen entre sí | Se garantiza en el diseño: muestreo aleatorio, tiendas distintas, sin medir dos veces al mismo cliente. Es el supuesto más importante y el único irreparable |
| Normalidad | Los datos de cada grupo provienen de poblaciones ~normales | Histogramas/boxplots por grupo sin asimetrías salvajes. Con grupos grandes, el TCL del Módulo 4 relaja mucho esta exigencia |
| Homogeneidad de varianzas (homocedasticidad) | Las varianzas de los grupos son similares | Regla rápida: la mayor desviación típica no debería duplicar a la menor. Aquí las tres varianzas muestrales son idénticas (0,5): impecable |
Si la normalidad falla gravemente con muestras pequeñas, o los datos son ordinales, existe una alternativa por rangos (la prueba de Kruskal-Wallis), que veremos entre los Métodos No Paramétricos.
Después de rechazar: comparaciones post-hoc (Tukey y Bonferroni)
El F significativo dice «no todas las medias son iguales», pero Marta preguntará de inmediato: «¿cuáles difieren?». Responder exige volver a las comparaciones por pares — pero ahora con protección contra la inflación del error tipo I. Las dos estrategias más comunes:
- Corrección de Bonferroni (ya la conocemos del Módulo 5): repartir α entre las \( m \) comparaciones, exigiendo a cada una \( \alpha' = \alpha/m \). Con 3 comparaciones, \( \alpha' = 0{,}05/3 = 0{,}0167 \). Sencilla y válida siempre, aunque conservadora.
- Prueba HSD de Tukey: diseñada específicamente para «todas las parejas tras un ANOVA». Calcula una diferencia mínima honesta (HSD) a partir del CM Dentro y del número de grupos: cualquier par de medias que difiera más que la HSD se declara distinto, manteniendo el 5 % de error global para el conjunto de comparaciones. Es la opción estándar de los programas estadísticos y algo más potente que Bonferroni en este uso.
Apliquemos Bonferroni a nuestro caso. El error típico de una diferencia de medias, usando el CM Dentro como varianza común, es
\[ \text{ET} = \sqrt{\text{CM}_{\text{Dentro}}\left(\tfrac{1}{n_1}+\tfrac{1}{n_2}\right)} = \sqrt{0{,}5 \times \tfrac{2}{5}} = \sqrt{0{,}2} = 0{,}447 \]
| Comparación | Diferencia | t = dif/ET | Crítico Bonferroni \( t_{0{,}0167/2;,12} \approx 2{,}78 \) | Conclusión |
|---|---|---|---|---|
| Express vs Gran Superficie | 2,0 | 4,47 | 2,78 | Difieren |
| Express vs Estándar | 1,0 | 2,24 | 2,78 | No concluyente |
| Estándar vs Gran Superficie | 1,0 | 2,24 | 2,78 | No concluyente |
(Tukey llega aquí a la misma conclusión.) El resultado es muy instructivo: el ANOVA global es rotundo, y el post-hoc localiza con claridad la diferencia entre los formatos extremos (Express vs Gran Superficie), mientras que las diferencias de 1 punto entre formatos vecinos, con solo 5 tiendas por grupo, no alcanzan la significación corregida — son sugerentes, pero harían falta más tiendas para confirmarlas (potencia, como vimos en 05-04). Informe honesto para Marta: «el formato influye en la satisfacción; la brecha demostrada es entre Express (7,0) y Gran Superficie (9,0); las comparaciones intermedias apuntan en la misma dirección pero requieren más muestra».
¿Cómo de grande es el efecto? Eta cuadrado
Significativo, sí — pero ¿importante? Igual que en el Módulo 5 distinguimos significación de relevancia, el ANOVA tiene su medida de tamaño del efecto: eta cuadrado, la proporción de la variabilidad total atribuible al factor:
\[ \eta^2 = \frac{\text{SC}{\text{Entre}}}{\text{SC}{\text{Total}}} = \frac{10}{16} = 0{,}625 \]
El formato de tienda explica el 62,5 % de la variabilidad de la satisfacción en la muestra — un efecto grande (orientativamente: ~0,01 pequeño, ~0,06 mediano, ~0,14 grande). Fíjate en el paralelismo exacto con el R² de la regresión: mismo concepto, factor categórico en lugar de variable continua.
Hasta dónde llega esta lección: dos factores y alternativas no paramétricas
Lo construido aquí es el ANOVA de un factor (una sola variable de agrupación). Existe el ANOVA de dos factores, que analiza simultáneamente, por ejemplo, formato y región — incluida la posibilidad de interacción (que el efecto del formato sea distinto según la región) —; su mecánica extiende la misma descomposición de sumas de cuadrados y queda fuera de nuestro alcance introductorio. Y cuando los supuestos no se sostienen, la alternativa por rangos (Kruskal-Wallis) espera en los Métodos No Paramétricos.
Errores Comunes y Consejos
- Hacer contrastes t por pares sin corrección en lugar de (o después de) un ANOVA. Es la fábrica de falsas alarmas del Módulo 5; el ANOVA existe precisamente para evitarla.
- Interpretar el rechazo como «todas las medias difieren». \( H_1 \) solo afirma que al menos una difiere; sin post-hoc no sabes cuál. Y al revés: no rechazar no demuestra que sean iguales.
- Invertir los grados de libertad al leer la tabla F. \( F_{2;12} = 3{,}89 \) pero \( F_{12;2} = 19{,}4 \): numerador (entre) primero, siempre.
- Buscar la cola izquierda. El contraste F del ANOVA es unilateral derecho; un F cercano a 0 no «demuestra igualdad», solo indica grupos anormalmente parecidos (a veces, síntoma de datos manipulados o dependientes).
- Olvidar comprobar las varianzas. Si un grupo tiene una dispersión mucho mayor (regla rápida: s máxima > 2 × s mínima), el F pierde fiabilidad; considera transformar los datos o el método no paramétrico.
- Quedarse en el valor p sin tamaño del efecto. Con muestras enormes, diferencias triviales dan F significativos. Acompaña siempre el veredicto con \( \eta^2 \) y con las medias de los grupos en unidades reales.
Ejercicios
Ejercicio 1. Operaciones prueba tres configuraciones de personal de caja y mide el tiempo medio de espera (minutos) en 4 tiendas por configuración:
| Configuración | Tiempos | Media |
|---|---|---|
| A (actual) | 4, 5, 6, 5 | 5 |
| B (refuerzo hora punta) | 6, 7, 7, 8 | 7 |
| C (caja rápida) | 5, 6, 6, 7 | 6 |
Construye la tabla ANOVA completa y decide al 5 % si la configuración influye (\( F_{0{,}05;,2;,9} = 4{,}26 \)). Calcula también \( \eta^2 \).
Ejercicio 2. Un analista junior, en lugar del ANOVA del ejercicio 1, ejecuta los tres contrastes t posibles al 5 % y presenta como hallazgo el único que salió significativo. Explica los dos errores metodológicos y calcula la probabilidad de al menos una falsa alarma en su enfoque suponiendo que \( H_0 \) fuera cierta en las tres comparaciones.
Ejercicio 3. De un informe llega esta tabla ANOVA incompleta sobre el gasto medio de socios del Club Nova en 4 segmentos de antigüedad (6 socios por segmento, N = 24):
| Fuente | SC | gl | CM | F |
|---|---|---|---|---|
| Entre grupos | 90 | ? | ? | ? |
| Dentro de grupos | ? | ? | ? | |
| Total | 210 | ? |
Completa las casillas y decide al 5 % (\( F_{0{,}05;,3;,20} = 3{,}10 \)).
Soluciones
Ejercicio 1. Media global = (20+28+24)/12 = 6. \( \text{SC}{\text{Entre}} = 4(5-6)^2 + 4(7-6)^2 + 4(6-6)^2 = 8 \). Dentro: A: 1+0+1+0 = 2; B: 1+0+0+1 = 2; C: 1+0+0+1 = 2; \( \text{SC}{\text{Dentro}} = 6 \). Tabla: SC 8 y 6; gl 2 y 9; CM 4 y 0,667; \( F = 4/0{,}667 = 6{,}0 \). Como 6,0 > 4,26, se rechaza \( H_0 \): la configuración influye en la espera. \( \eta^2 = 8/14 = 0{,}57 \). (De cara a la acción, el post-hoc apuntaría a la diferencia A vs B — ¡y cuidado con la lectura de negocio: el «refuerzo» B es el que muestra MÁS espera!) Error frecuente: olvidar multiplicar por \( n_j = 4 \) en la SC Entre, o usar N − 1 = 11 como gl del denominador en lugar de N − k = 9.
Ejercicio 2. Errores: (1) inflación del error tipo I — tres contrastes al 5 % acumulan \( 1 - 0{,}95^3 = 14{,}3,% \) de probabilidad de alguna falsa alarma, casi el triple de lo pactado; (2) informe selectivo (p-hacking, visto en 05-04): presentar solo el contraste significativo oculta el proceso de búsqueda y convierte un posible azar en «hallazgo». Lo correcto: ANOVA global primero y, solo si rechaza, post-hoc con corrección (Bonferroni: cada comparación al 0,05/3 = 0,0167), informando de las tres. Error frecuente: creer que la corrección es opcional si «solo» son 3 comparaciones — el 14,3 % ya casi triplica el riesgo nominal.
Ejercicio 3. \( \text{SC}_{\text{Dentro}} = 210 - 90 = 120 \). gl: entre = 3, dentro = 20, total = 23. CM: entre = 90/3 = 30; dentro = 120/20 = 6. \( F = 30/6 = 5{,}0 \). Como 5,0 > 3,10, se rechaza \( H_0 \): el gasto medio no es igual en los cuatro segmentos de antigüedad (con \( \eta^2 = 90/210 = 0{,}43 \), efecto grande). Faltaría un post-hoc para saber qué segmentos difieren. Error frecuente: calcular los gl entre como k = 4 en lugar de k − 1 = 3, con lo que todos los CM y el F salen mal en cascada.
Conclusión
El ANOVA salda la deuda del Módulo 5: en lugar de una peligrosa batería de contrastes t, un único contraste global que compara la variabilidad entre grupos con la variabilidad dentro de ellos mediante el estadístico F — en nuestro caso, F = 10 frente a un crítico de 3,89: el formato de tienda influye en la satisfacción, el efecto es grande (η² = 0,625) y el post-hoc con Bonferroni localiza la diferencia demostrada entre Express y Gran Superficie. Hemos añadido la distribución F y su tabla de doble entrada a nuestro arsenal, junto a la disciplina de comprobar supuestos y de acompañar cada valor p con su tamaño del efecto. Pero el ANOVA exige una variable respuesta cuantitativa (satisfacción, tiempos, euros). ¿Y cuando lo que queremos cruzar son dos variables categóricas — canal de compra y método de pago, tramo de edad y baja del club —, donde no hay medias que comparar sino frecuencias que contar? Para eso necesitamos la prueba chi-cuadrado, protagonista del Análisis de Datos Categóricos con el que cerramos el módulo.
Curso de Estadística
Módulo 1: Introducción a la Estadística
Módulo 2: Descripción de Datos
- Medidas de Tendencia Central
- Medidas de Dispersión
- Medidas de Posición y Valores Atípicos
- Representación Gráfica de Datos
Módulo 3: Probabilidad
- Conceptos Básicos de Probabilidad
- Reglas de Probabilidad
- Variables Aleatorias y Distribuciones de Probabilidad
Módulo 4: Distribuciones de Probabilidad
- Distribución Binomial
- Distribución Normal
- Otras Distribuciones Importantes
- El Teorema Central del Límite
Módulo 5: Inferencia Estadística
- Estimación de Parámetros
- Intervalos de Confianza
- Pruebas de Hipótesis
- Errores, Potencia y Tamaño Muestral
Módulo 6: Análisis de Datos
- Análisis de Correlación
- Análisis de Regresión
- Análisis de Varianza (ANOVA)
- Análisis de Datos Categóricos: Chi-Cuadrado
