En la regresión del Módulo 6 predijimos las ventas de una tienda a partir de una sola variable: su superficie. Funcionó bien (R² = 0,865), pero dejó preguntas abiertas — Cuenca vende unos 10.200 €/día menos de lo que su superficie predice, y sospechamos que la culpa no es de los metros cuadrados sino de la calle en la que está. En el mundo real casi ningún fenómeno de negocio depende de una única variable: las ventas dependen de la superficie y del tráfico peatonal y de la renta de la zona; la baja de un socio depende de su edad y de su gasto y de su actividad. El análisis multivariante es la caja de herramientas para trabajar con varias variables a la vez. En esta lección aprenderás regresión múltiple (la extensión natural de lo que ya sabes), regresión logística (cuando lo que predices es un sí/no) y, de forma conceptual, dos técnicas de exploración: componentes principales y clustering. El énfasis es interpretativo: estos modelos los calculará siempre el software; tu trabajo como analista es saber leerlos y explicárselos a Marta.
Contenido
- De una a varias variables: el modelo de regresión múltiple
- Leer los coeficientes: la cláusula «a igualdad del resto»
- Interpretar la salida del software columna a columna
- R² ajustado: por qué el R² siempre sube
- Multicolinealidad: cuando los predictores se pisan
- Variables dummy e interacciones
- Regresión logística: predecir un sí/no (la baja del Club Nova)
- Análisis de componentes principales: resumir muchas variables en pocas
- Clustering (k-means): segmentar a los socios
De una a varias variables: el modelo de regresión múltiple
La regresión lineal múltiple generaliza la recta de mínimos cuadrados a \(k\) predictores:
\[ \hat{y} = b_0 + b_1 x_1 + b_2 x_2 + \dots + b_k x_k \]
Ya no es una recta sino un "plano" (o hiperplano) ajustado a los datos, pero el criterio de ajuste es el mismo — minimizar la suma de residuos al cuadrado — y toda la maquinaria de inferencia (errores típicos, contrastes t, valores p, R²) funciona igual que en 06-02, solo que ahora hay un coeficiente por variable.
El caso NovaMarket. El equipo de expansión amplía el modelo de ventas con dos variables nuevas medidas en las 42 tiendas:
- \(x_1\): superficie de sala de ventas (m²)
- \(x_2\): tráfico peatonal de la calle (miles de peatones/día)
- \(x_3\): renta media de la zona (miles de €/año per cápita)
La variable respuesta sigue siendo la venta diaria en miles de € (recuerda: media 43.983 € ≈ 44,0 miles).
Leer los coeficientes: la cláusula «a igualdad del resto»
El modelo ajustado resulta:
\[ \hat{y} = -4{,}10 + 0{,}0312,x_1 + 0{,}85,x_2 + 0{,}42,x_3 \]
Cada coeficiente se lee con una cláusula obligatoria: «a igualdad del resto de variables» (los economistas dicen ceteris paribus):
- \(b_1 = 0{,}0312\): entre dos tiendas con el mismo tráfico y la misma renta, cada m² adicional se asocia con 31,2 € más de venta diaria.
- \(b_2 = 0{,}85\): a igual superficie y renta, cada mil peatones diarios adicionales se asocian con 850 € más de venta diaria.
- \(b_3 = 0{,}42\): a igual superficie y tráfico, cada mil euros más de renta per cápita en la zona se asocian con 420 € más de venta diaria.
Fíjate en un detalle importante: en la regresión simple la pendiente de la superficie era 0,0377 (37,7 €/m²); ahora es 0,0312. ¿Se ha "encogido" el efecto? No exactamente: en el modelo simple, la superficie se llevaba el mérito de todo lo que viaja con ella — las tiendas grandes de NovaMarket suelen estar además en calles concurridas. Al incluir el tráfico como variable propia, cada coeficiente refleja solo su contribución neta. Esta es la gran virtud de la regresión múltiple: separa efectos que en el análisis de dos variables venían mezclados (el fenómeno de confusión que ya asomó al advertir que correlación no es causalidad).
Y resuelve el misterio pendiente: metiendo los datos de Cuenca (tráfico peatonal muy bajo para su superficie), su residuo pasa de −10,2 miles de € en el modelo simple a −1,8 en el múltiple. Cuenca no era una tienda mal gestionada: era una tienda grande en una calle vacía.
Interpretar la salida del software columna a columna
Así presenta un software estadístico típico el ajuste (n = 42 tiendas):
| Variable | Coeficiente | Error típico | t | valor p |
|---|---|---|---|---|
| Constante | −4,10 | 2,05 | −2,00 | 0,053 |
| Superficie (m²) | 0,0312 | 0,0031 | 10,06 | < 0,001 |
| Tráfico (miles peatones/día) | 0,85 | 0,24 | 3,54 | 0,001 |
| Renta zona (miles €/año) | 0,42 | 0,35 | 1,20 | 0,238 |
R² = 0,912 · R² ajustado = 0,905 · n = 42
Columna a columna, con lo que ya sabes de los Módulos 5 y 6:
- Coeficiente: la estimación puntual del efecto neto, en unidades de la respuesta por unidad del predictor.
- Error típico (ET): la incertidumbre de esa estimación; con él se construye el IC al 95 % (≈ coeficiente ± 2·ET). Para la superficie: \(0{,}0312 \pm 2 \times 0{,}0031 \Rightarrow (0{,}025;, 0{,}037)\).
- t: el estadístico de contraste \(t = \text{coeficiente} / ET\) para la hipótesis nula "este coeficiente es 0 (la variable no aporta, dado que las demás están en el modelo)". Para el tráfico: \(0{,}85/0{,}24 = 3{,}54\).
- valor p: la probabilidad de un t así de extremo si la variable no aportara nada. Superficie y tráfico son claramente significativos; la renta no (p = 0,238): una vez conocidos superficie y tráfico, saber la renta del barrio apenas mejora la predicción. Un modelo final razonable la excluiría.
La coletilla en cursiva del contraste t importa: el valor p de cada variable es condicional al resto del modelo. Quitar o añadir una variable puede cambiar los valores p de las demás.
R² ajustado: por qué el R² siempre sube
El R² del modelo múltiple es 0,912, frente al 0,865 del modelo solo con superficie. ¿Prueba eso que el modelo es mejor? Cuidado: el R² nunca baja al añadir variables, aunque sean ruido puro. Si añadieras "número de letras del nombre de la tienda", el R² subiría alguna décima de punto porcentual, porque mínimos cuadrados siempre encuentra algo de covariación casual que exprimir.
El R² ajustado corrige esto penalizando cada variable adicional:
\[ R^2_{aj} = 1 - (1 - R^2),\frac{n-1}{n-k-1} \]
donde \(n\) es el número de observaciones y \(k\) el de predictores. Solo sube si la variable nueva aporta más de lo que "cuesta". Reglas prácticas:
- Para comparar modelos con distinto número de variables, usa siempre el R² ajustado (aquí: 0,905 con tres variables frente a 0,862 del modelo simple — la mejora es real).
- Si al añadir una variable el R² sube pero el R² ajustado baja, la variable probablemente sobra. Es lo que ocurre con la renta: sin ella, el R² ajustado apenas cambia.
- Un modelo con muchas variables y pocos datos puede "memorizar" la muestra (sobreajuste) y predecir mal tiendas nuevas — la versión multivariante de un peligro que ya conoces de la extrapolación.
Multicolinealidad: cuando los predictores se pisan
La regresión múltiple reparte el mérito entre predictores. ¿Y si dos predictores son casi la misma información? Por ejemplo, si añadiéramos al modelo "superficie total del local" además de "superficie de sala de ventas" (correlación entre ambas: 0,98). Eso es la multicolinealidad, y sus síntomas son reconocibles:
- El R² del modelo es alto, pero ningún coeficiente individual sale significativo: el mérito conjunto es claro, pero el reparto entre variables gemelas es imposible de precisar.
- Los errores típicos se inflan y los coeficientes se vuelven inestables: cambian mucho (incluso de signo) al añadir o quitar unas pocas observaciones.
- Coeficientes con signos absurdos ("más superficie, menos ventas") compensados por la variable gemela.
La intuición: preguntar a los datos "¿cuánto vende de más una tienda con más sala de ventas a igualdad de superficie total?" es una pregunta que la muestra apenas puede responder, porque casi no hay tiendas donde ambas difieran. El diagnóstico estándar es el VIF (factor de inflación de la varianza): mide cuántas veces se infla la varianza de cada coeficiente por culpa de su correlación con los demás predictores; como orientación, VIF > 5 pide revisión y VIF > 10 indica problema serio. En nuestro modelo: superficie 1,9, tráfico 2,1, renta 1,3 — correlaciones moderadas, ningún problema. La solución habitual cuando lo hay: quedarse con una de las variables gemelas (la más interpretable o barata de medir), o combinarlas — algo que el análisis de componentes principales del apartado 8 hace de forma sistemática.
Variables dummy e interacciones
Incluir una variable categórica: el formato de tienda
¿Cómo mete uno en la ecuación una variable como el formato (Express / Estándar / Gran Superficie), que no es un número? Con variables dummy (indicadoras): variables 0/1 que marcan la pertenencia a cada categoría, dejando una como categoría de referencia. Con Express de referencia:
| Formato | \(D_{Est}\) | \(D_{GS}\) |
|---|---|---|
| Express | 0 | 0 |
| Estándar | 1 | 0 |
| Gran Superficie | 0 | 1 |
Un modelo de satisfacción de tienda con estas dummies:
\[ \widehat{satisf} = 7{,}0 + 1{,}0,D_{Est} + 2{,}0,D_{GS} \]
se lee así: la constante (7,0) es la media de la categoría de referencia (Express); cada coeficiente dummy es la diferencia respecto a la referencia (Estándar: 7,0 + 1,0 = 8,0; Gran Superficie: 7,0 + 2,0 = 9,0 — exactamente las medias del ANOVA de 06-03, que aquí reaparecen como caso particular de regresión). Regla mecánica: una categórica de \(c\) niveles entra con \(c-1\) dummies; incluir las \(c\) sería redundante (multicolinealidad perfecta).
Interacciones (mención conceptual)
A veces el efecto de una variable depende del valor de otra: quizá cada mil peatones extra valen más en una tienda Express (compra de paso) que en una Gran Superficie (destino planificado). Eso se modela añadiendo el producto de ambas variables (\(x_2 \times D_{GS}\)) como predictor adicional; si su coeficiente es significativo, la pendiente del tráfico es distinta por formato. Quédate con la idea y con la advertencia: con interacciones, los coeficientes individuales ya no se leen aislados, y conviene apoyarse en gráficos de predicciones.
Regresión logística: predecir un sí/no (la baja del Club Nova)
Marta plantea el problema estrella del año: predecir qué socios del Club Nova se darán de baja (la tasa anual muestral es del 14 %, concentrada en menores de 35). La respuesta es binaria (baja: sí/no), y la regresión lineal no sirve: prediciría "probabilidades" menores que 0 o mayores que 1.
La regresión logística modela la probabilidad a través de los odds (la razón probabilidad a favor / en contra, \(p/(1-p)\), que ya usamos en probabilidad: p = 0,14 son unos odds de 0,163, "1 baja por cada 6,1 que se quedan"). El modelo es lineal en el logaritmo de los odds:
\[ \ln!\left(\frac{p}{1-p}\right) = b_0 + b_1 x_1 + \dots + b_k x_k \]
Ajustado sobre una muestra de socios (variables: edad en años, gasto mensual en €, actividad — la dummy "socio activo", recuerda que son el 64 %):
| Variable | Coeficiente | valor p | \(e^{coef}\) (odds ratio) |
|---|---|---|---|
| Constante | 0,90 | 0,004 | — |
| Edad (años) | −0,045 | < 0,001 | 0,956 |
| Gasto mensual (€) | −0,006 | 0,010 | 0,994 |
| Socio activo (1 = sí) | −1,20 | < 0,001 | 0,301 |
Cómo se lee, sin necesidad de saber cómo se estima (el software lo hace por un método llamado máxima verosimilitud, que no necesitas dominar):
- El signo es lo primero: coeficiente negativo = esa variable reduce la probabilidad de baja. Más edad, más gasto y estar activo protegen — coherente con que la baja se concentre en jóvenes.
- La magnitud se interpreta vía \(e^{coef}\), el odds ratio: por cada año más de edad, los odds de baja se multiplican por 0,956 (bajan un 4,4 %); por 10 años, \(e^{-0{,}45} \approx 0{,}64\), un 36 % menos de odds. Ser socio activo multiplica los odds de baja por 0,30: los divide por más de 3.
- Los valores p funcionan como siempre: aquí las tres variables son significativas.
El modelo también da probabilidades individuales. Dos socios de perfil opuesto:
- Socio de 28 años, inactivo, gasto 60 €/mes: \(\ln(odds) = 0{,}90 - 0{,}045(28) - 0{,}006(60) = -0{,}72\), luego \(p = \frac{1}{1+e^{0{,}72}} \approx 0{,}33\). Un 33 % de probabilidad de baja: candidato claro a una campaña de retención.
- Socia de 52 años, activa, gasto 150 €/mes: \(\ln(odds) = 0{,}90 - 2{,}34 - 0{,}90 - 1{,}20 = -3{,}54\), luego \(p \approx 0{,}03\). Un 3 %: no gastes presupuesto de retención en ella.
Esa es exactamente la aplicación de negocio: ordenar los 380.000 socios por probabilidad de baja y concentrar la campaña en el tramo alto de la lista.
Análisis de componentes principales: resumir muchas variables en pocas
Las dos técnicas restantes no predicen nada: exploran. El análisis de componentes principales (ACP o PCA) responde a esta pregunta: tengo muchas variables correlacionadas entre sí; ¿puedo resumirlas en unas pocas variables nuevas perdiendo la mínima información posible?
Conceptualmente: el ACP construye componentes — combinaciones de las variables originales — de modo que la primera capture la mayor varianza posible de los datos, la segunda la mayor parte de lo que queda (siendo independiente de la primera), y así sucesivamente. Si las variables originales están muy correlacionadas, dos o tres componentes bastan para retener el 70-90 % de la información de diez o quince variables.
Mini-caso: sobre 12 variables de comportamiento de los socios del Club Nova (gasto por categoría, número de visitas, tamaño de cesta, uso del canal online, uso de cupones…), el ACP devuelve que dos componentes retienen el 78 % de la varianza, y mirando qué variables pesan en cada una se les puede poner nombre:
- Componente 1, "volumen de compra" (52 %): pesan el gasto total, el tamaño de cesta y el gasto en fresca y despensa.
- Componente 2, "digitalidad" (26 %): pesan el uso del canal online, los cupones en la app y la frecuencia de visitas cortas.
Usos típicos: visualizar a los socios en un plano (componente 1 vs componente 2) en lugar de en 12 dimensiones imposibles de dibujar, y sustituir grupos de variables gemelas por una componente — el remedio sistemático a la multicolinealidad. El precio: las componentes son constructos, y su interpretación ("digitalidad") la pone el analista, no las matemáticas.
Clustering (k-means): segmentar a los socios
La última pregunta es distinta: ¿existen grupos naturales de socios que se parezcan entre sí y se diferencien de los demás? Nadie ha etiquetado nada de antemano — no es predecir una respuesta conocida, es descubrir estructura. Eso es el clustering o análisis de conglomerados, y su algoritmo más popular es k-means: el analista fija el número de grupos \(k\), y el algoritmo asigna cada socio al grupo de centro más cercano y recalcula los centros, iterando hasta estabilizarse. Cada grupo queda descrito por su centroide (el socio "promedio" del grupo).
El equipo de NovaMarket segmentó los 380.000 socios del Club Nova con k-means y \(k = 3\). Tu trabajo es interpretar el resultado:
| Cluster 1: «Familias de carga completa» | Cluster 2: «Compra de conveniencia» | Cluster 3: «Ocasionales en riesgo» | |
|---|---|---|---|
| % de socios | 38 % | 41 % | 21 % |
| Gasto mensual medio | 182 € | 96 € | 58 € |
| Visitas/mes | 6,1 | 8,3 (cortas) | 1,8 |
| Perfil dominante | Compra semanal grande, fuerte en fresca | Tiendas Express y online, cestas pequeñas | Menores de 35, mayoría inactivos |
| Tasa de baja anual | 6 % | 12 % | 27 % |
Lectura de negocio: el gasto medio global (126,40 €) esconde tres realidades muy distintas; la baja del 14 % global está impulsada casi por completo por el cluster 3 — que conecta con lo que la regresión logística ya señalaba (jóvenes, inactivos, gasto bajo). Cada cluster pide una acción distinta: fidelizar la fresca en el 1, empujar la app en el 2, campaña de retención urgente en el 3.
Dos advertencias conceptuales: la elección de \(k\) no la dan los datos solos (hay criterios orientativos, pero pesa el juicio de negocio: ¿tres segmentos accionables o siete inmanejables?); y k-means trabaja con distancias, así que las variables deben estandarizarse antes (recuerda las puntuaciones z del Módulo 2) — si no, la variable de mayor escala (el gasto en euros) dominaría la segmentación ella sola.
Errores Comunes y Consejos
- Leer coeficientes de regresión múltiple sin la cláusula «a igualdad del resto». Decir "cada m² aporta 31,2 €" a secas invita a compararlo mal con el 37,7 del modelo simple; son respuestas a preguntas distintas.
- Presumir de R² a base de apilar variables. Compara modelos con el R² ajustado, y desconfía de modelos con muchos predictores y pocos datos.
- Interpretar coeficientes individuales con multicolinealidad severa. Si dos predictores son casi gemelos, sus coeficientes separados no son fiables aunque el modelo prediga bien.
- Olvidar la categoría de referencia con dummies. Cada coeficiente dummy es una diferencia respecto a la referencia, no una media del grupo.
- Leer los coeficientes logísticos como probabilidades. Un coeficiente de −1,20 no significa "−120 % de probabilidad": actúa sobre el logaritmo de los odds; conviértelo a odds ratio (\(e^{-1{,}20} = 0{,}30\)) o calcula probabilidades para perfiles concretos.
- Creer que los clusters "existen". k-means siempre devuelve \(k\) grupos, haya o no estructura real; valida que los segmentos sean estables y accionables antes de montarles campañas.
- Confundir predicción con causalidad. Todo lo anterior es asociación observacional; para afirmar que cambiar el tráfico peatonal (o activar a un socio) causa más ventas o menos bajas, haría falta un experimento — de eso hablaremos en las aplicaciones del Módulo 8.
Ejercicios
Ejercicio 1
El equipo de expansión evalúa un local en Sevilla de 1.100 m², en una calle con 14.000 peatones/día y renta de zona de 24.000 €/año. Con el modelo \(\hat{y} = -4{,}10 + 0{,}0312,x_1 + 0{,}85,x_2 + 0{,}42,x_3\) (x₂ y x₃ en miles), calcula la venta diaria prevista. ¿Es esta predicción más o menos fiable que la que hicimos para Alicante con el modelo simple? ¿Por qué?
Ejercicio 2
En el modelo logístico de baja del Club Nova, un compañero afirma: "el gasto mensual casi no importa: su coeficiente es −0,006, ridículo al lado del −1,20 de la actividad". Evalúa la afirmación calculando el odds ratio asociado a una diferencia de 100 € de gasto mensual, y explica por qué comparar coeficientes en bruto es engañoso.
Ejercicio 3
Marta te reenvía la tabla de los 3 clusters y pregunta: "¿en qué segmento invierto primero el presupuesto de retención y qué le ofrezco?" Responde usando la tabla, y añade una comprobación estadística de módulos anteriores con la que verificarías que la diferencia de tasas de baja entre clusters no es fruto del azar.
Soluciones
Ejercicio 1.
\(\hat{y} = -4{,}10 + 0{,}0312 \times 1100 + 0{,}85 \times 14 + 0{,}42 \times 24 = -4{,}10 + 34{,}32 + 11{,}90 + 10{,}08 = 52{,}2\) miles de € ≈ 52.200 €/día. Es en principio más fiable que la predicción de Alicante del modelo simple: el R² ajustado es mayor (0,905 vs 0,862) y el modelo separa el efecto del tráfico, que en Alicante quedaba embebido en la superficie. Pero con dos matices: los valores de Sevilla deben estar dentro del rango observado en las 42 tiendas (nada de extrapolar), y la variable renta aporta poco (p = 0,238) — con el modelo sin renta la predicción apenas cambiaría. Error frecuente: olvidar que x₂ y x₃ entran en miles y multiplicar por 14.000 y 24.000, lo que da cifras disparatadas; comprueba siempre las unidades de cada variable antes de sustituir.
Ejercicio 2.
La afirmación confunde magnitud del coeficiente con importancia: los coeficientes dependen de las unidades. El −0,006 es por euro; una diferencia realista entre socios es de decenas o cientos de euros. Para 100 €: \(e^{-0{,}006 \times 100} = e^{-0{,}6} \approx 0{,}55\) — un socio que gasta 100 € más al mes tiene casi la mitad de odds de baja, un efecto comparable al de la actividad (\(0{,}30\)). Error frecuente: comparar coeficientes de variables medidas en escalas distintas (años, euros, dummy 0/1) como si fueran conmensurables; compara siempre odds ratios asociados a diferencias realistas de cada variable.
Ejercicio 3.
Primero el cluster 3 («Ocasionales en riesgo»): concentra la tasa de baja más alta (27 %, casi el doble de la media del 14 %) y es donde una mejora tiene más recorrido; son jóvenes, inactivos y de gasto bajo, así que la oferta natural ataca la activación (ventajas en la app, cupones de recompra, envío online bonificado) más que el descuento indiscriminado. Comprobación estadística: una chi-cuadrado de independencia (06-04) sobre la tabla cluster × baja/no baja — con estos tamaños muestrales la significación está garantizada, así que acompáñala de una medida de tamaño del efecto (V de Cramér) y de los residuos tipificados para localizar dónde está el exceso de bajas. Error frecuente: elegir el cluster 2 "porque tiene más socios"; el volumen importa, pero la decisión de retención se toma por riesgo y por margen de mejora, no por tamaño del segmento.
Conclusión
Has dado el salto de una a varias variables: la regresión múltiple separa efectos que viajaban mezclados (y rehabilitó a Cuenca: su déficit era de tráfico peatonal, no de gestión), la salida del software se lee columna a columna con las herramientas de inferencia que ya dominabas, el R² ajustado protege contra la tentación de apilar variables, las dummies incorporan categóricas (y revelaron el ANOVA como caso particular de regresión), la logística traslada todo el esquema a respuestas sí/no vía odds, y ACP y k-means exploran estructura sin variable respuesta — con los tres segmentos del Club Nova como resultado accionable.
Pero todo este edificio — como la t, el ANOVA o los intervalos de la regresión — sigue apoyado en supuestos distribucionales: normalidad de los residuos, muestras razonablemente grandes, ausencia de atípicos salvajes. ¿Y cuando los datos se niegan a cooperar — ocho observaciones, escalas ordinales de satisfacción, un atípico que lo distorsiona todo? Para eso existe una familia de pruebas que renuncian a los supuestos a cambio de trabajar con rangos: los Métodos No Paramétricos, con los que cerraremos el módulo.
Curso de Estadística
Módulo 1: Introducción a la Estadística
Módulo 2: Descripción de Datos
- Medidas de Tendencia Central
- Medidas de Dispersión
- Medidas de Posición y Valores Atípicos
- Representación Gráfica de Datos
Módulo 3: Probabilidad
- Conceptos Básicos de Probabilidad
- Reglas de Probabilidad
- Variables Aleatorias y Distribuciones de Probabilidad
Módulo 4: Distribuciones de Probabilidad
- Distribución Binomial
- Distribución Normal
- Otras Distribuciones Importantes
- El Teorema Central del Límite
Módulo 5: Inferencia Estadística
- Estimación de Parámetros
- Intervalos de Confianza
- Pruebas de Hipótesis
- Errores, Potencia y Tamaño Muestral
Módulo 6: Análisis de Datos
- Análisis de Correlación
- Análisis de Regresión
- Análisis de Varianza (ANOVA)
- Análisis de Datos Categóricos: Chi-Cuadrado
