La correlación de la lección anterior nos dijo que superficie y ventas van fuertemente de la mano (r = 0,93), pero Marta quiere más: «Estamos valorando abrir una tienda de 1.500 m² en Alicante. ¿Cuánto venderá?». Para pasar del «están relacionadas» al «si x vale tanto, y valdrá cuanto» necesitamos la regresión lineal simple: la técnica que ajusta la mejor recta posible a la nube de puntos y la convierte en una máquina de predicción. En esta lección plantearemos el modelo, calcularemos a mano sus coeficientes por mínimos cuadrados (reutilizando la tabla de la lección anterior), interpretaremos pendiente e intercepto en euros, mediremos la calidad del ajuste con el R², examinaremos los residuos, haremos la predicción para Alicante — y aprenderemos por qué predecir fuera del rango de los datos es jugar con fuego. Cerraremos con la inferencia sobre la pendiente y un anticipo de la regresión múltiple.

Contenido

  1. El modelo de regresión lineal simple
  2. Mínimos cuadrados: la mejor recta posible
  3. Cálculo a mano de la recta de NovaMarket
  4. Interpretar pendiente e intercepto en unidades de negocio
  5. ¿Qué tal ajusta? El coeficiente de determinación R²
  6. Los residuos: diagnóstico visual del modelo
  7. Predicción: interpolación sí, extrapolación con mucho cuidado
  8. Inferencia sobre la pendiente: IC y contraste
  9. Anuncio: cuando una variable no basta (regresión múltiple)

El modelo de regresión lineal simple

La regresión da un paso que la correlación no daba: designa una variable como explicativa (o independiente, \( x \): la superficie) y otra como respuesta (o dependiente, \( y \): las ventas), y propone un modelo para la población:

\[ y = \beta_0 + \beta_1 x + \varepsilon \]

  • \( \beta_0 \) (intercepto): el valor medio de \( y \) cuando \( x = 0 \).
  • \( \beta_1 \) (pendiente): cuánto cambia \( y \), en media, por cada unidad adicional de \( x \). Es el parámetro estrella.
  • \( \varepsilon \) (término de error): todo lo que afecta a las ventas y no es la superficie — ubicación, competencia, gestión del gerente, azar. El modelo no pretende que los puntos caigan exactamente sobre la recta; pretende que la recta capture la tendencia media y que \( \varepsilon \) recoja las desviaciones.

Como siempre en inferencia, \( \beta_0 \) y \( \beta_1 \) son parámetros poblacionales desconocidos; con la muestra calcularemos sus estimaciones \( b_0 \) y \( b_1 \), y la recta ajustada será \( \hat{y} = b_0 + b_1 x \) (el «sombrero» de \( \hat{y} \) indica valor predicho, no observado).

Mínimos cuadrados: la mejor recta posible

Por la nube de ocho tiendas pueden pasar infinitas rectas. ¿Cuál es «la mejor»? El criterio universal es el de mínimos cuadrados: para cada tienda, el error de la recta es el residuo \( e_i = y_i - \hat{y}_i \) (lo observado menos lo predicho, la distancia vertical del punto a la recta). Elegimos la recta que minimiza la suma de los residuos al cuadrado:

\[ \min \sum_{i=1}^{n} e_i^2 = \min \sum_{i=1}^{n} \left( y_i - b_0 - b_1 x_i \right)^2 \]

(Se elevan al cuadrado por el mismo motivo que en la varianza: para que errores positivos y negativos no se cancelen, y para penalizar más los errores grandes.) Resolviendo ese problema de minimización se obtienen dos fórmulas cerradas:

\[ b_1 = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sum (x_i-\bar{x})^2} \qquad\qquad b_0 = \bar{y} - b_1 \bar{x} \]

Fíjate en la primera: el numerador es el mismo que el de la covarianza y la correlación. De hecho, pendiente y correlación están emparentadas (\( b_1 = r \cdot s_y/s_x \)): la pendiente es «la correlación puesta en las unidades del problema». Y la segunda fórmula dice algo elegante: la recta de mínimos cuadrados pasa siempre por el punto de medias \( (\bar{x}, \bar{y}) \).

Cálculo a mano de la recta de NovaMarket

Aquí cosechamos el trabajo de la lección anterior. De aquella tabla ya tenemos todo lo necesario (ventas en miles de €):

\[ \bar{x} = 1.281{,}25 \text{ m²} \quad \bar{y} = 45{,}7 \quad \sum (x_i-\bar{x})(y_i-\bar{y}) = 29.210 \quad \sum (x_i-\bar{x})^2 = 774.687{,}5 \]

Pendiente:

\[ b_1 = \frac{29.210}{774.687{,}5} = 0{,}0377 ; \text{miles € por m²} \]

Intercepto:

\[ b_0 = 45{,}7 - 0{,}0377 \times 1.281{,}25 = 45{,}7 - 48{,}30 = -2{,}60 ; \text{miles €} \]

Recta ajustada (con ventas en miles de euros y superficie en m²):

\[ \hat{y} = -2{,}60 + 0{,}0377,x \]

Interpretar pendiente e intercepto en unidades de negocio

Esta es la parte que Marta quiere oír, y hay que decirla con precisión:

  • Pendiente \( b_1 = 0{,}0377 \) miles €/m² = 37,7 € por m²: por cada metro cuadrado adicional de sala, la venta diaria media aumenta unos 37,7 €. En términos de decisión: ampliar una tienda en 100 m² se asocia, en media, con unos 3.770 € más de venta diaria. Dos cautelas obligadas: es un efecto medio (ninguna tienda concreta obedecerá la cifra exacta) y es una asociación, no una causalidad demostrada — recuerda la variable oculta «ubicación» de la lección anterior.
  • Intercepto \( b_0 = -2{,}60 \) miles €: literalmente, «una tienda de 0 m² vendería −2.600 € al día». Es un absurdo evidente, y no pasa nada: el intercepto es aquí un simple ancla matemática de la recta. Solo tiene interpretación de negocio cuando \( x = 0 \) es un valor posible y observado (no existen tiendas de 0 m², y la más pequeña de la muestra tiene 850 m²). Es nuestro primer aviso sobre la extrapolación.

¿Qué tal ajusta? El coeficiente de determinación R²

La recta es la mejor posible, pero ¿es buena? La medida estándar es el coeficiente de determinación \( R^2 \), que nace de descomponer la variabilidad de las ventas:

\[ \underbrace{\sum (y_i-\bar{y})^2}_{\text{SC Total}} = \underbrace{\sum (\hat{y}i-\bar{y})^2}{\text{SC explicada por la recta}} + \underbrace{\sum (y_i-\hat{y}i)^2}{\text{SC residual}} \qquad R^2 = \frac{\text{SC explicada}}{\text{SC Total}} \]

\( R^2 \) es la proporción de la varianza de y que la recta explica, entre 0 (la recta no aporta nada) y 1 (ajuste perfecto). En regresión lineal simple hay un atajo precioso: \( R^2 = r^2 \), el cuadrado de la correlación de Pearson. Con nuestros datos:

\[ R^2 = 0{,}93^2 = 0{,}865 \]

La superficie explica el 86,5 % de la variabilidad de las ventas entre tiendas; el 13,5 % restante se debe a todo lo demás (ubicación, gestión, competencia…). Con las sumas de cuadrados se ve igual: SC Total = 1.272,84 (la suma de \( (y_i-\bar{y})^2 \) de la tabla), SC explicada = \( b_1 \times 29.210 = 1.101{,}2 \) y SC residual = 171,6, y en efecto \( 1.101{,}2/1.272{,}84 = 0{,}865 \). No hay un umbral universal de «buen R²»: en procesos industriales se exigen valores altísimos; en comportamiento de clientes, un 0,3 puede ser oro. Esta descomposición de la variabilidad en «explicada + residual», guárdala en la memoria: es exactamente la maquinaria que reutilizará el ANOVA.

Los residuos: diagnóstico visual del modelo

Los residuos son la lupa del modelo: si la recta es adecuada, deben parecer ruido sin estructura. Calculémoslos:

Tienda \( x_i \) \( y_i \) \( \hat{y}_i = -2{,}60 + 0{,}0377x_i \) Residuo \( e_i = y_i - \hat{y}_i \)
Cuenca 850 19,2 29,4 −10,2
Bilbao-Casco 1.100 44,0 38,9 +5,1
Zaragoza-Centro 1.150 44,0 40,8 +3,2
Valencia-Ruzafa 1.200 44,1 42,6 +1,5
Barcelona-Gràcia 1.250 46,1 44,5 +1,6
Madrid-Chamberí 1.300 47,5 46,4 +1,1
Sevilla-Nervión 1.400 52,3 50,2 +2,1
Madrid-Centro 2.000 68,4 72,8 −4,4
Suma 0,0

(Los residuos de mínimos cuadrados siempre suman cero — otra comprobación de cálculo.) Dos lecturas:

  • Lectura de negocio: Cuenca vende 10.200 € diarios menos de lo que su superficie predice — con diferencia el mayor residuo. No es solo «la tienda pequeña»: es una tienda que rinde por debajo incluso para su tamaño. Marta tiene ahí una investigación pendiente (¿ubicación?, ¿surtido?, ¿competencia local?). Los residuos convierten la regresión en una herramienta de benchmarking: comparan cada tienda contra lo esperable para sus características, no contra la media bruta.
  • Lectura estadística (diagnóstico visual). Dibujando los residuos frente a \( \hat{y} \) (o frente a x) deberíamos ver una banda horizontal aleatoria en torno a cero. Señales de alarma:
Patrón en el gráfico de residuos Qué indica Consecuencia
Curva (∩ o ∪) La relación real no es lineal La recta infra/sobrepredice sistemáticamente por tramos
Embudo (dispersión que crece con \( \hat{y} \)) Heterocedasticidad: varianza no constante Las predicciones son menos fiables donde el embudo se abre
Uno o dos residuos enormes Atípicos o datos mal registrados Pueden arrastrar toda la recta: investigar antes de nada
Banda horizontal sin forma Todo en orden (homocedasticidad y linealidad) Adelante

En nuestro caso, siete residuos moderados y el de Cuenca destacando: con n = 8 no da para un veredicto rotundo, pero merece vigilancia.

Predicción: interpolación sí, extrapolación con mucho cuidado

Vamos por fin a la pregunta de Marta: la tienda candidata de Alicante tendría 1.500 m².

\[ \hat{y} = -2{,}60 + 0{,}0377 \times 1.500 = -2{,}60 + 56{,}55 = 53{,}95 ; \text{miles €} \approx 53.900 ; \text{€ de venta diaria} \]

Esta predicción es una interpolación: 1.500 m² está dentro del rango observado (850–2.000 m²), donde la recta ha sido «entrenada» y el ajuste es bueno. Aun así, comunícala con humildad: es la venta media esperada para una tienda de ese tamaño; la real vendrá acompañada del error del modelo (el error típico residual es \( s_e = \sqrt{171{,}6/6} = 5{,}35 \) miles €, así que desviaciones de ±5.000–10.000 € diarios respecto a lo predicho son perfectamente normales, como muestra el propio residuo de Cuenca).

La extrapolación es otra historia. Dirección quiere valorar también un hipermercado de 5.000 m²: la recta diría \( \hat{y} = -2{,}60 + 0{,}0377 \times 5.000 = 185{,}9 \) miles € (~185.900 €/día). Esa cifra no es fiable: 5.000 m² está 2,5 veces más allá de la tienda más grande observada, y nada garantiza que la relación siga siendo lineal ahí fuera (los hipermercados tienen otro modelo comercial, otra rotación por m², pasillos más anchos que no venden…). La recta solo describe el mundo del que proviene. Regla práctica: predice dentro del rango de los datos; fuera de él, tu recta es una hipótesis sin contrastar, no una predicción. El intercepto negativo (\( x = 0 \Rightarrow \hat{y} = -2{,}6 \)) era ya la caricatura perfecta de este peligro.

Inferencia sobre la pendiente: IC y contraste

Como todo lo calculado con una muestra, \( b_1 = 0{,}0377 \) tiene error muestral: otras 8 tiendas darían otra pendiente. ¿Podría la pendiente poblacional \( \beta_1 \) ser 0 (la superficie no aporta nada)? El contraste es el habitual del Módulo 5:

  • \( H_0: \beta_1 = 0 \) — la superficie no ayuda a predecir las ventas
  • \( H_1: \beta_1 \neq 0 \)

El estadístico usa el error típico de la pendiente, \( \text{ET}(b_1) = s_e / \sqrt{\sum (x_i-\bar{x})^2} \), donde \( s_e = \sqrt{\text{SC residual}/(n-2)} \):

\[ \text{ET}(b_1) = \frac{5{,}35}{\sqrt{774.687{,}5}} = \frac{5{,}35}{880{,}2} = 0{,}00608 \qquad t = \frac{b_1 - 0}{\text{ET}(b_1)} = \frac{0{,}0377}{0{,}00608} = 6{,}20 \]

Con \( n-2 = 6 \) grados de libertad, el crítico bilateral al 5 % es 2,447: rechazamos \( H_0 \) con holgura. (No es casualidad que salga el mismo t ≈ 6,2 que en el contraste sobre r de la lección anterior: en regresión simple son el mismo contraste.) El intervalo de confianza al 95 % para la pendiente:

\[ b_1 \pm t_{0{,}025;,6} \cdot \text{ET}(b_1) = 0{,}0377 \pm 2{,}447 \times 0{,}00608 = 0{,}0377 \pm 0{,}0149 ;\Rightarrow; [0{,}0228 ;; 0{,}0526] \]

En unidades de negocio: cada m² adicional se asocia con entre 22,8 y 52,6 € más de venta diaria, con un 95 % de confianza. El intervalo es ancho — solo tenemos 8 tiendas —, pero no contiene el 0: el efecto existe. Para valorar la inversión de Alicante, Marta debería trabajar con todo ese abanico, no solo con los 37,7 € centrales.

Anuncio: cuando una variable no basta (regresión múltiple)

Nuestro modelo deja un 13,5 % de la variabilidad sin explicar, y sabemos que ahí viven la ubicación, el tráfico de clientes o la renta de la zona. La extensión natural es la regresión múltiple: un modelo con varias explicativas a la vez, \( y = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \dots + \varepsilon \), donde cada pendiente mide el efecto de su variable manteniendo constantes las demás — justo la herramienta que permite separar el efecto de la superficie del de la ubicación, atacando el problema de las variables ocultas. La desarrollaremos en el Análisis Multivariante; por ahora basta con saber que existe y qué promete.

Errores Comunes y Consejos

  • Intercambiar x e y. A diferencia de la correlación, la regresión no es simétrica: la recta que predice ventas a partir de superficie no es la misma que la que predeciría superficie a partir de ventas. Decide qué quieres predecir antes de calcular.
  • Interpretar el intercepto a la fuerza. Si \( x = 0 \) no es un valor posible o queda fuera del rango de los datos, \( b_0 \) es solo un ancla matemática. No presentes «−2.600 €» como una cifra de negocio.
  • Extrapolar sin avisar. Predicciones fuera del rango observado (el hipermercado de 5.000 m²) heredan la forma de la recta, no la realidad. Señala siempre el rango de validez del modelo.
  • Leer la pendiente como causalidad. «+37,7 € por m²» es una asociación media en datos observacionales; solo un experimento o un modelo que controle las confusoras justifica el lenguaje causal.
  • Quedarse en el R² sin mirar residuos. Un R² alto puede convivir con una curvatura clara o con un atípico que sostiene todo el ajuste (recuerda Anscombe: los cuatro conjuntos comparten también la misma recta y el mismo R²). El gráfico de residuos es el control de calidad.
  • Olvidar la incertidumbre de la predicción. \( \hat{y} \) es una media esperada: acompáñala del error típico residual o de un intervalo, sobre todo si respalda una inversión.

Ejercicios

Ejercicio 1. Con la recta de la lección (\( \hat{y} = -2{,}60 + 0{,}0377x \), en miles de €): (a) predice la venta diaria de una tienda de 1.000 m² y de otra de 1.900 m², e indica si son interpolaciones o extrapolaciones; (b) el equipo de expansión pide la predicción para un local de 400 m² en formato «ultraproximidad»: da la cifra que arroja la recta y explica por qué no deberías entregarla sin reservas.

Ejercicio 2. Ajustando la relación entre gasto en publicidad local (x, miles de €/mes) y ventas online en la zona (y, miles de €/mes) con 10 zonas, una analista obtiene \( b_0 = 12{,}4 \), \( b_1 = 3{,}2 \), \( \text{ET}(b_1) = 1{,}25 \) y \( R^2 = 0{,}45 \). (a) Interpreta \( b_1 \) y \( R^2 \) en lenguaje de negocio. (b) Contrasta al 5 % si la publicidad aporta capacidad predictiva (\( t_{0{,}025;,8} = 2{,}306 \)) y construye el IC del 95 % para \( \beta_1 \).

Ejercicio 3. Un compañero presenta una regresión con R² = 0,91 donde el gráfico de residuos muestra un embudo claro: residuos pequeños en tiendas de baja predicción y enormes en las de predicción alta. Afirma: «con este R², el modelo es excelente y las predicciones son igual de fiables para cualquier tienda». Señala qué parte de la afirmación es defendible y cuál no.

Soluciones

Ejercicio 1. (a) Para 1.000 m²: \( \hat{y} = -2{,}60 + 37{,}7 = 35{,}1 \) miles € ≈ 35.100 €/día. Para 1.900 m²: \( \hat{y} = -2{,}60 + 71{,}63 = 69{,}0 \) miles € ≈ 69.000 €/día. Ambas son interpolaciones: 1.000 y 1.900 m² caen dentro del rango observado (850–2.000). (b) Para 400 m² la recta da \( \hat{y} = -2{,}60 + 15{,}08 = 12{,}5 \) miles € ≈ 12.500 €/día, pero es una extrapolación: queda muy por debajo de la tienda más pequeña de la muestra (850 m²), y un formato de ultraproximidad opera con lógica comercial distinta (rotación, surtido, ticket). La cifra debe presentarse como orientación no validada, idealmente acompañada de datos de tiendas comparables. Error frecuente: mirar solo si la predicción «suena razonable» en vez de comprobar si x está dentro del rango de los datos.

Ejercicio 2. (a) \( b_1 = 3{,}2 \): cada 1.000 € adicionales de publicidad mensual se asocian, en media, con 3.200 € más de ventas online en la zona. \( R^2 = 0{,}45 \): la publicidad explica el 45 % de la variabilidad de las ventas entre zonas; más de la mitad depende de otros factores. (b) \( t = 3{,}2/1{,}25 = 2{,}56 > 2{,}306 \): se rechaza \( H_0: \beta_1 = 0 \) al 5 % — la relación es significativa. IC del 95 %: \( 3{,}2 \pm 2{,}306 \times 1{,}25 = 3{,}2 \pm 2{,}88 \Rightarrow [0{,}32 ;; 6{,}08] \). Nota cómo el intervalo, aun sin contener el 0, es amplísimo: significativo no significa preciso. Error frecuente: usar el crítico z = 1,96 en lugar del t con n − 2 = 8 gl, y afirmar causalidad («la publicidad genera 3.200 €») cuando los datos son observacionales.

Ejercicio 3. Es defendible que el modelo captura una parte muy grande de la variabilidad global (R² = 0,91) y que la relación es aproximadamente lineal en promedio. No es defendible que las predicciones sean igual de fiables en todas partes: el embudo indica heterocedasticidad — la varianza de los errores crece con el nivel predicho —, así que las predicciones para tiendas grandes llevan mucha más incertidumbre que para las pequeñas, aunque el R² global sea alto. Habría que comunicar márgenes de error distintos por tramo (o transformar la variable). Error frecuente: tratar el R² como certificado universal de calidad; el R² es una media global que no ve dónde se concentran los errores.

Conclusión

Hemos convertido una correlación en una herramienta de decisión: el modelo \( y = \beta_0 + \beta_1 x + \varepsilon \), ajustado por mínimos cuadrados, nos dio la recta \( \hat{y} = -2{,}60 + 0{,}0377x \), una pendiente con significado económico directo (entre 22,8 y 52,6 € de venta diaria por m², con 95 % de confianza), un R² del 86,5 %, unos residuos que señalan a Cuenca como tienda a investigar y una predicción concreta para Alicante: unos 53.900 € diarios para 1.500 m² — dentro del rango de los datos, que es donde la recta tiene jurisdicción. También hemos visto la maquinaria que hay debajo: descomponer la variabilidad total en «explicada + residual». Pues bien: esa misma descomposición, aplicada no a una recta sino a la comparación de varios grupos a la vez, es exactamente el Análisis de Varianza (ANOVA) — la respuesta que dejamos pendiente en el Módulo 5 cuando descubrimos que comparar 42 tiendas con t de dos en dos era una fábrica de falsas alarmas.

© Copyright 2026. Todos los derechos reservados