En el módulo anterior aprendimos a inferir sobre una variable cada vez: una media, una proporción, una diferencia. Pero, como anticipábamos al cerrarlo, las preguntas más jugosas de NovaMarket relacionan variables entre sí: ¿venden más las tiendas grandes? ¿baja la satisfacción cuando la entrega tarda? En esta lección aprenderemos a cuantificar la fuerza de una relación entre dos variables cuantitativas: partiremos de la nube de puntos que presentamos en el Módulo 2, definiremos la covarianza y el coeficiente de correlación de Pearson (calculado a mano, paso a paso), veremos sus condiciones y trampas — con el célebre cuarteto de Anscombe como advertencia —, presentaremos la alternativa de Spearman basada en rangos, contrastaremos si una correlación es estadísticamente significativa y, sobre todo, grabaremos a fuego la regla más importante del análisis de datos: correlación no implica causalidad.
Contenido
- De la nube de puntos a un número
- La covarianza: signo, interpretación y el problema de las unidades
- El coeficiente de correlación de Pearson: cálculo a mano
- Interpretar la magnitud de r
- Condiciones y trampas: linealidad y valores atípicos (el cuarteto de Anscombe)
- Correlación de Spearman: rangos para ordinales y relaciones no lineales
- ¿Es significativa la correlación? El contraste sobre r
- Correlación no implica causalidad
De la nube de puntos a un número
Recuperemos el gráfico de dispersión que dibujamos en la lección de Representación Gráfica de Datos: la superficie de sala y la venta media diaria de ocho tiendas de NovaMarket. Para trabajar con números manejables expresaremos las ventas en miles de euros:
| Tienda | Superficie \( x \) (m²) | Venta diaria \( y \) (miles €) |
|---|---|---|
| Cuenca | 850 | 19,2 |
| Bilbao-Casco | 1.100 | 44,0 |
| Zaragoza-Centro | 1.150 | 44,0 |
| Valencia-Ruzafa | 1.200 | 44,1 |
| Barcelona-Gràcia | 1.250 | 46,1 |
| Madrid-Chamberí | 1.300 | 47,5 |
| Sevilla-Nervión | 1.400 | 52,3 |
| Madrid-Centro | 2.000 | 68,4 |
Al dibujar la nube de puntos el patrón salta a la vista: a más superficie, más venta. Pero Marta, la directora de análisis, quiere más que una impresión visual: «¿Cómo de fuerte es la relación? Dame un número que pueda comparar con otras variables». Ese número existe, y llegar a él requiere dos pasos: primero la covarianza y después la correlación.
La covarianza: signo, interpretación y el problema de las unidades
La idea es sencilla. Calculamos las medias de ambas variables y nos preguntamos, tienda a tienda, si las dos variables se desvían de su media en el mismo sentido o en sentidos opuestos:
\[ s_{xy} = \frac{\sum_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y})}{n-1} \]
- Si una tienda está por encima de la media en superficie y por encima en ventas (o por debajo en ambas), el producto \( (x_i-\bar{x})(y_i-\bar{y}) \) es positivo.
- Si está por encima en una y por debajo en la otra, el producto es negativo.
- La covarianza es (casi) el promedio de esos productos: su signo nos dice el sentido de la relación.
Calculemos las medias: \( \bar{x} = 10.250/8 = 1.281{,}25 \) m² y \( \bar{y} = 365{,}6/8 = 45{,}7 \) miles €. Montamos la tabla de cálculo, que reutilizaremos durante toda la lección (y también en la siguiente, así que merece la pena hacerla con cuidado):
| Tienda | \( x_i \) | \( y_i \) | \( x_i-\bar{x} \) | \( y_i-\bar{y} \) | \( (x_i-\bar{x})(y_i-\bar{y}) \) | \( (x_i-\bar{x})^2 \) | \( (y_i-\bar{y})^2 \) |
|---|---|---|---|---|---|---|---|
| Cuenca | 850 | 19,2 | −431,25 | −26,5 | 11.428,13 | 185.976,56 | 702,25 |
| Bilbao-Casco | 1.100 | 44,0 | −181,25 | −1,7 | 308,13 | 32.851,56 | 2,89 |
| Zaragoza-Centro | 1.150 | 44,0 | −131,25 | −1,7 | 223,13 | 17.226,56 | 2,89 |
| Valencia-Ruzafa | 1.200 | 44,1 | −81,25 | −1,6 | 130,00 | 6.601,56 | 2,56 |
| Barcelona-Gràcia | 1.250 | 46,1 | −31,25 | 0,4 | −12,50 | 976,56 | 0,16 |
| Madrid-Chamberí | 1.300 | 47,5 | 18,75 | 1,8 | 33,75 | 351,56 | 3,24 |
| Sevilla-Nervión | 1.400 | 52,3 | 118,75 | 6,6 | 783,75 | 14.101,56 | 43,56 |
| Madrid-Centro | 2.000 | 68,4 | 718,75 | 22,7 | 16.315,63 | 516.601,56 | 515,29 |
| Suma | 0 | 0 | 29.210,0 | 774.687,5 | 1.272,84 |
Fíjate en dos comprobaciones: las columnas de desviaciones suman cero (siempre ocurre; si no, hay un error de cálculo), y siete de los ocho productos cruzados son positivos — solo Barcelona-Gràcia, ligeramente por debajo de la media en superficie pero un pelín por encima en ventas, aporta un producto negativo (y minúsculo).
\[ s_{xy} = \frac{29.210}{8-1} = 4.172{,}9 ; \text{m²·miles €} \]
Interpretación: la covarianza es positiva, luego superficie y ventas se mueven en el mismo sentido. Pero ¿es 4.172,9 una relación fuerte? Aquí aparece el problema de las unidades: la covarianza se mide en «m² por miles de euros», una unidad ininterpretable, y su valor cambia si cambiamos de escala. Si hubiéramos expresado las ventas en euros en vez de en miles, la covarianza sería 4.172.900 — mil veces mayor — ¡sin que la relación hubiera cambiado en absoluto! La covarianza sirve para el signo, pero no para medir la fuerza. Necesitamos estandarizarla.
El coeficiente de correlación de Pearson: cálculo a mano
La solución es la misma que usamos con las puntuaciones z en el Módulo 2: dividir por las desviaciones típicas para eliminar las unidades. El resultado es el coeficiente de correlación de Pearson:
\[ r = \frac{s_{xy}}{s_x , s_y} = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sqrt{\sum (x_i-\bar{x})^2 ; \sum (y_i-\bar{y})^2}} \]
La segunda forma es la más cómoda para calcular a mano, porque usa directamente las sumas de la tabla (los \( n-1 \) se cancelan entre numerador y denominador). Con nuestros datos:
\[ r = \frac{29.210}{\sqrt{774.687{,}5 \times 1.272{,}84}} = \frac{29.210}{\sqrt{986.053.238}} = \frac{29.210}{31.401{,}5} = 0{,}93 \]
Propiedades de \( r \) que conviene memorizar:
- Siempre está entre −1 y +1. Es adimensional: da igual medir en m² o en hectáreas, en euros o en miles de euros.
- \( r = +1 \): relación lineal positiva perfecta (todos los puntos sobre una recta creciente). \( r = -1 \): lineal negativa perfecta. \( r = 0 \): ausencia de relación lineal.
- Es simétrico: la correlación de superficie con ventas es la misma que la de ventas con superficie. No distingue causa de efecto (volveremos sobre esto).
Interpretar la magnitud de r
¿Es 0,93 mucho o poco? No hay fronteras universales — dependen del ámbito —, pero para datos de negocio esta guía orientativa funciona bien:
| \( \lvert r \rvert \) | Interpretación orientativa |
|---|---|
| 0,00 – 0,20 | Relación muy débil o inexistente |
| 0,20 – 0,40 | Débil |
| 0,40 – 0,60 | Moderada |
| 0,60 – 0,80 | Fuerte |
| 0,80 – 1,00 | Muy fuerte |
Nuestro \( r = 0{,}93 \) indica una relación lineal muy fuerte: las tiendas grandes venden sistemáticamente más. Ojo con dos matices:
- La tabla es orientativa, no un dogma. En encuestas de comportamiento un 0,4 puede ser un hallazgo notable; en un proceso físico controlado, un 0,9 puede ser decepcionante.
- \( r \) mide la fuerza de la relación, no su relevancia económica ni la magnitud del efecto («por cada m² adicional, ¿cuántos euros más?»). Esa pregunta la responderá la pendiente de la regresión en la próxima lección.
Condiciones y trampas: linealidad y valores atípicos (el cuarteto de Anscombe)
Pearson mide relaciones lineales, y es muy sensible a los valores atípicos. El estadístico Francis Anscombe construyó en 1973 cuatro conjuntos de once puntos — el famoso cuarteto de Anscombe — diseñados para que todos compartan prácticamente los mismos estadísticos: misma media de \( x \), misma media de \( y \), misma correlación (\( r \approx 0{,}82 \) en los cuatro)… y sin embargo sus gráficos no pueden ser más distintos:
| Conjunto | Qué se ve al dibujarlo | ¿Es \( r = 0{,}82 \) un buen resumen? |
|---|---|---|
| I | Nube lineal clásica con dispersión moderada | Sí: es el caso «de libro» |
| II | Una curva perfecta (parábola), sin ruido | No: la relación es fortísima pero no lineal; \( r \) la infravalora y la describe mal |
| III | Recta casi perfecta con un atípico que se sale | No: sin ese punto, \( r \) sería ≈ 1; el atípico lo arrastra hacia abajo |
| IV | Todos los puntos con el mismo \( x \), salvo uno alejado | No: la «correlación» la fabrica un único punto; sin él no hay relación alguna |
La moraleja es de aplicación diaria en NovaMarket: antes de calcular r, dibuja siempre la nube de puntos. Un mismo número puede esconder una relación limpia, una curva, o el efecto de una sola tienda. En nuestro ejemplo conviene fijarse en Madrid-Centro (2.000 m², 68,4 miles €): es la observación más extrema y aporta más de la mitad del producto cruzado total (16.315,6 de 29.210). No es un error — es una tienda real y coherente con el patrón —, pero si su cifra estuviera mal registrada, distorsionaría gravemente el resultado. Regla práctica: recalcula \( r \) sin la observación sospechosa; si el valor cambia drásticamente, tu conclusión pende de un solo punto.
Correlación de Spearman: rangos para ordinales y relaciones no lineales
¿Qué hacemos cuando la relación es claramente monótona pero no lineal (crece o decrece siempre, pero de forma curva), o cuando alguna variable es ordinal (como una satisfacción de 0 a 10, donde los números ordenan pero las distancias no son garantizadamente iguales), o cuando tememos a los atípicos? Usar la correlación de Spearman \( r_s \): se sustituye cada valor por su rango (posición ordenada: 1 el menor, 2 el siguiente…) y se calcula la correlación sobre los rangos. Con rangos sin empates hay una fórmula rápida:
\[ r_s = 1 - \frac{6 \sum d_i^2}{n(n^2-1)} \]
donde \( d_i \) es la diferencia entre los rangos de cada observación en las dos variables.
Caso NovaMarket: Marta sospecha que la satisfacción de los clientes online (recordemos: media 7,6 frente a 8,3 en tienda) depende del tiempo de entrega. Tomamos ocho pedidos online con su tiempo de entrega y la nota de satisfacción del cliente:
| Pedido | Entrega (h) | Satisfacción | Rango entrega | Rango satisf. | \( d_i \) | \( d_i^2 \) |
|---|---|---|---|---|---|---|
| A | 14 | 9 | 1 | 7 | −6 | 36 |
| B | 17 | 10 | 2 | 8 | −6 | 36 |
| C | 20 | 8 | 3 | 6 | −3 | 9 |
| D | 23 | 6 | 4 | 4 | 0 | 0 |
| E | 26 | 7 | 5 | 5 | 0 | 0 |
| F | 32 | 5 | 6 | 3 | 3 | 9 |
| G | 44 | 3 | 7 | 2 | 5 | 25 |
| H | 55 | 2 | 8 | 1 | 7 | 49 |
| Suma | 0 | 164 |
Comprobación: la columna \( d_i \) suma cero. Aplicamos la fórmula:
\[ r_s = 1 - \frac{6 \times 164}{8 \times (64-1)} = 1 - \frac{984}{504} = 1 - 1{,}952 = -0{,}95 \]
Interpretación: relación monótona negativa muy fuerte — cuanto más tarda la entrega, menor la satisfacción, de forma casi perfectamente consistente. Fíjate en que Spearman solo pregunta «¿el orden de una variable replica (o invierte) el orden de la otra?»: por eso es inmune a curvaturas monótonas y mucho más robusto ante atípicos (un pedido que tardara 200 h seguiría siendo simplemente «el rango 8»). Si hay empates, se asigna a los valores empatados el promedio de los rangos que ocuparían (dos pedidos empatados en los puestos 3.º y 4.º reciben rango 3,5 cada uno) y es preferible calcular \( r_s \) como el Pearson de los rangos.
¿Cuándo usar cada uno?
| Situación | Coeficiente recomendado |
|---|---|
| Dos variables cuantitativas, relación lineal, sin atípicos graves | Pearson \( r \) |
| Variable(s) ordinal(es) (notas, rankings, escalas de satisfacción) | Spearman \( r_s \) |
| Relación monótona pero curva | Spearman \( r_s \) |
| Atípicos que no se pueden justificar ni eliminar | Spearman \( r_s \) (como análisis de robustez) |
¿Es significativa la correlación? El contraste sobre r
Nuestro \( r = 0{,}93 \) se ha calculado con solo 8 tiendas. Con muestras pequeñas, ¿no podría salir una correlación aparente por puro azar, aunque en la población no exista relación? Es la misma pregunta que resolvimos en el Módulo 5, y se responde con un contraste:
- \( H_0: \rho = 0 \) (no hay correlación lineal en la población; \( \rho \), «rho», es la correlación poblacional)
- \( H_1: \rho \neq 0 \)
Bajo \( H_0 \), el estadístico
\[ t = \frac{r\sqrt{n-2}}{\sqrt{1-r^2}} \]
sigue una distribución t de Student con \( n-2 \) grados de libertad (perdemos dos: uno por cada media estimada). Con nuestros datos:
\[ t = \frac{0{,}93 \times \sqrt{6}}{\sqrt{1-0{,}865}} = \frac{0{,}93 \times 2{,}449}{\sqrt{0{,}135}} = \frac{2{,}278}{0{,}367} = 6{,}21 \]
En la tabla t (que aprendimos a leer en la estimación de parámetros), el valor crítico bilateral al 5 % con 6 gl es \( t_{0{,}025;,6} = 2{,}447 \). Como \( 6{,}21 > 2{,}447 \), rechazamos \( H_0 \): la correlación es estadísticamente significativa (p < 0,001). Incluso con solo 8 tiendas, una relación tan fuerte es muy improbable por azar.
Dos avisos heredados del Módulo 5: con muestras grandes, correlaciones minúsculas (r = 0,05) salen «significativas» sin ser relevantes — significación ≠ relevancia —; y si correlacionas muchas parejas de variables a la vez, recuerda el problema de las comparaciones múltiples: alguna saldrá significativa por azar.
Correlación no implica causalidad
Es la frase más repetida de la estadística, y aun así se incumple a diario en las empresas. Que dos variables se muevan juntas no demuestra que una cause la otra. Hay tres explicaciones posibles para una correlación observada:
- X causa Y (o Y causa X — recuerda que r es simétrico y no distingue el sentido).
- Una tercera variable oculta (variable de confusión) causa ambas.
- Casualidad (especialmente con muestras pequeñas o tras mirar muchas parejas de variables).
Dos ejemplos de negocio:
- Helados y protector solar. En los datos de NovaMarket, las ventas semanales de helados y de protector solar tienen una correlación altísima. ¿Vender helados hace que la gente compre protector? Obviamente no: la variable oculta es el calor del verano, que dispara ambas. Promocionar helados en enero no venderá ni una crema.
- El tamaño de tienda como variable oculta. Un analista junior descubre que las tiendas con más cajas de autocobro venden más, y propone instalar cajas de autocobro en Cuenca para subir sus ventas. El error: las tiendas grandes tienen a la vez más cajas de autocobro y más ventas — la superficie (y la ubicación que suele acompañarla) causa ambas cosas. Instalar cajas no convierte a Cuenca en Madrid-Centro.
Incluso nuestra correlación estrella (superficie–ventas, r = 0,93) merece cautela causal: las tiendas grandes de NovaMarket están además en ubicaciones más céntricas y con más tráfico de clientes. Parte del efecto atribuido a los metros cuadrados puede deberse a la ubicación. ¿Cómo se establece causalidad de verdad? Con experimentos controlados (pruebas A/B, asignación aleatoria — lo esbozamos al hablar de recolección de datos) o con diseños estadísticos que controlen las variables de confusión, como la regresión múltiple que anunciaremos en el Análisis Multivariante. La correlación, por sí sola, solo sugiere hipótesis; nunca las demuestra.
Errores Comunes y Consejos
- Calcular r sin dibujar la nube de puntos. Es el error número uno: el cuarteto de Anscombe existe precisamente para curarlo. Gráfico primero, número después.
- Interpretar r = 0 como «no hay relación». Solo significa «no hay relación lineal». Una U perfecta (p. ej., ventas frente a precio: caen si es muy caro y también si es tan barato que genera desconfianza) puede dar r ≈ 0.
- Confundir covarianza grande con relación fuerte. La covarianza depende de las unidades; para comparar fuerzas, usa siempre r.
- Saltar de correlación a causalidad. Antes de recomendar una acción («ampliemos la tienda para vender más»), pregúntate qué variable oculta podría explicar la relación.
- Ignorar los atípicos. Un solo punto puede fabricar o destruir una correlación. Recalcula sin él y compara; si la historia cambia, investiga ese punto antes de concluir.
- Aplicar Pearson a escalas ordinales sin pensarlo. Con rankings o escalas de opinión, Spearman es la opción defendible.
- Correlacionar todo con todo. Con 20 variables hay 190 parejas: al 5 % de significación, esperarás ~9 o 10 correlaciones «significativas» falsas. Formula las hipótesis antes de mirar.
Ejercicios
Ejercicio 1. Con la tabla de superficie–ventas de la lección, un becario propone repetir el análisis midiendo la superficie en hectáreas (1 ha = 10.000 m²) «para que los números sean más pequeños». (a) ¿Cambiará la covarianza? ¿Y r? Razónalo sin calcular. (b) Marta pregunta: «¿ese 0,93 significa que la superficie explica el 93 % de las ventas?» ¿Qué le responderías?
Ejercicio 2. El responsable del Club Nova ordena 8 campañas de email según su inversión y según los socios captados:
| Campaña | Rango inversión | Rango captación |
|---|---|---|
| C1 | 1 | 2 |
| C2 | 2 | 1 |
| C3 | 3 | 4 |
| C4 | 4 | 3 |
| C5 | 5 | 6 |
| C6 | 6 | 5 |
| C7 | 7 | 8 |
| C8 | 8 | 7 |
Calcula la correlación de Spearman e interprétala en una frase para el responsable.
Ejercicio 3. Analizando 6 tiendas, otra analista obtiene r = 0,75 entre tráfico de clientes y ventas. (a) Contrasta al 5 % si la correlación es significativa (valor crítico bilateral: \( t_{0{,}025;,4} = 2{,}776 \)). (b) La misma r = 0,75 con n = 30 da t = 6,00. ¿Qué lección práctica extraes de comparar ambos casos?
Soluciones
Ejercicio 1. (a) La covarianza sí cambia: quedará dividida por 10.000, porque depende de las unidades de ambas variables. La correlación no cambia en absoluto: r es adimensional e invariante ante cambios de escala; seguirá valiendo 0,93. Este es exactamente el motivo por el que preferimos r a la covarianza. (b) No: r no es un porcentaje explicado. La proporción de varianza de las ventas asociada a la superficie es \( r^2 = 0{,}93^2 \approx 0{,}865 \), es decir, un 86,5 % — un concepto (el R²) que desarrollaremos en la próxima lección. Error frecuente: leer r directamente como porcentaje; r = 0,5 no es «la mitad explicada» (sería r² = 0,25, un 25 %).
Ejercicio 2. Diferencias de rangos: −1, 1, −1, 1, −1, 1, −1, 1, de modo que \( \sum d_i^2 = 8 \). Entonces \( r_s = 1 - \frac{6 \times 8}{8 \times 63} = 1 - \frac{48}{504} = 1 - 0{,}095 = 0{,}90 \). Interpretación: «el orden de captación replica casi perfectamente el orden de inversión: las campañas con más presupuesto captan sistemáticamente más socios». Error frecuente: olvidar elevar al cuadrado las diferencias (con estas d, \( \sum d_i \) da 0 y parecería correlación perfecta) o usar n² − 1 = 63 mal (recuerda: es n·(n²−1) = 8 × 63 = 504).
Ejercicio 3. (a) \( t = \frac{0{,}75\sqrt{4}}{\sqrt{1-0{,}5625}} = \frac{1{,}5}{0{,}661} = 2{,}27 \). Como 2,27 < 2,776, no podemos rechazar \( H_0 \): con solo 6 tiendas, una correlación de 0,75 es compatible con el azar. (b) La misma correlación con n = 30 sí es significativa. Lección: la significación depende conjuntamente de la fuerza (r) y del tamaño muestral (n). Una r alta con n minúsculo no demuestra nada, y — a la inversa, como vimos en el Módulo 5 — una r irrelevante con n enorme puede salir «significativa». Error frecuente: usar n en lugar de n − 2 en la fórmula, o concluir del apartado (a) que «no hay relación»: solo hay evidencia insuficiente.
Conclusión
En esta lección hemos dado el salto de describir variables por separado a medir relaciones: la covarianza nos da el signo (pero es esclava de las unidades), el coeficiente de Pearson r la convierte en una medida universal entre −1 y +1, Spearman nos cubre cuando hay ordinales, curvas monótonas o atípicos, y el contraste t sobre r nos protege de las correlaciones fabricadas por el azar en muestras pequeñas. Nos llevamos dos disciplinas: dibujar siempre antes de calcular (Anscombe) y no confundir correlación con causalidad (helados y protector solar). Pero Marta ya está pidiendo lo siguiente: «Vale, superficie y ventas van de la mano con r = 0,93. Si abrimos una tienda de 1.500 m², ¿cuánto venderá?». Responder «cuánto» exige convertir la relación en una ecuación de predicción — una recta con pendiente e intercepto —, y eso es exactamente el Análisis de Regresión que abordamos a continuación, reutilizando la tabla de cálculo que hemos construido aquí.
Curso de Estadística
Módulo 1: Introducción a la Estadística
Módulo 2: Descripción de Datos
- Medidas de Tendencia Central
- Medidas de Dispersión
- Medidas de Posición y Valores Atípicos
- Representación Gráfica de Datos
Módulo 3: Probabilidad
- Conceptos Básicos de Probabilidad
- Reglas de Probabilidad
- Variables Aleatorias y Distribuciones de Probabilidad
Módulo 4: Distribuciones de Probabilidad
- Distribución Binomial
- Distribución Normal
- Otras Distribuciones Importantes
- El Teorema Central del Límite
Módulo 5: Inferencia Estadística
- Estimación de Parámetros
- Intervalos de Confianza
- Pruebas de Hipótesis
- Errores, Potencia y Tamaño Muestral
Módulo 6: Análisis de Datos
- Análisis de Correlación
- Análisis de Regresión
- Análisis de Varianza (ANOVA)
- Análisis de Datos Categóricos: Chi-Cuadrado
