Regresión lineal, en términos sencillos
La regresión lineal es un método para modelar una relación entre dos cantidades:
- x: la entrada (variable independiente)
- y: la salida (variable dependiente)
El modelo supone que, en promedio, y cambia aproximadamente siguiendo un patrón de línea recta a medida que x cambia. “Aproximadamente” es importante: los datos casi nunca siguen una línea exacta, por lo que el modelo incluye un término de error.
La versión más común es la de mínimos cuadrados ordinarios (OLS), que elige la línea recta que hace que los errores generales de predicción sean lo más pequeños posible.
El cálculo: modelo y fórmula
El modelo de regresión lineal se escribe como:
[ \hat{y} = a + b x ]
Donde:
- (\hat{y}) es el valor predicho de y
- (a) es la intersección (el y predicho cuando x = 0)
- (b) es la pendiente (cuánto cambia (\hat{y}) cuando x aumenta en 1)
Para calcular a y b, OLS utiliza la idea de minimizar la suma de los residuos al cuadrado.
Residuos y el objetivo de mínimos cuadrados
Para los puntos de datos ((x_i, y_i)) con (i=1,2,\dots,n):
- Residuo: (e_i = y_i - \hat{y}_i)
- Suma de residuos al cuadrado: (\sum_{i=1}^{n} e_i^2)
OLS elige (a) y (b) para minimizar esa suma.
Pendiente (b)
Una forma computacional ampliamente utilizada para la pendiente es:
[ b = \frac{\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})}{\sum_{i=1}^{n}(x_i-\bar{x})^2} ]
Aquí:
- (\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i)
- (\bar{y} = \frac{1}{n}\sum_{i=1}^{n} y_i)
Intuición: el numerador es el movimiento conjunto de x e y (cómo las desviaciones de x se alinean con las desviaciones de y). El denominador es la dispersión de x alrededor de su media.
Intersección (a)
Una vez que se conoce (b), la intersección se deduce del requisito de que la línea ajustada pase por el punto ((\bar{x},\bar{y})):
[ a = \bar{y} - b\bar{x} ]
Qué datos necesitas (y qué debe cumplirse)
Para calcular una regresión lineal simple necesitas:
- Un conjunto de observaciones pareadas ((x_i, y_i)) para (i=1\ldots n).
- Suficiente variación en x, es decir, (\sum (x_i-\bar{x})^2 \neq 0). Si todos los valores de x son iguales, la pendiente no está definida.
- Un significado claro de x e y para tu caso de uso. El modelo siempre produce predicciones; no te dice automáticamente que la relación sea causal.
Supuestos detrás del ajuste de “línea recta”
Los cálculos de OLS conllevan supuestos que afectan la interpretación:
- La forma lineal (a + bx) es una aproximación adecuada para el patrón de los datos.
- Los errores se tratan típicamente como no relacionados con x (más precisamente, se suele suponer que el residuo esperado dado x es 0).
- Los residuos no deben mostrar una estructura sistemática; si la muestran, una línea recta puede ser una mala elección.
Estos son supuestos sobre cómo se comportan los datos, no sobre el futuro.
Una comprobación práctica con un pequeño ejemplo (sin software especial)
Supongamos que tienes 3 puntos:
((x_1,y_1),(x_2,y_2),(x_3,y_3)). Para calcular la línea de regresión:
- Calcula (\bar{x}) y (\bar{y}).
- Calcula el numerador:
(\sum (x_i-\bar{x})(y_i-\bar{y})). - Calcula el denominador:
(\sum (x_i-\bar{x})^2). - Calcula (b) como numerador ÷ denominador.
- Calcula (a = \bar{y} - b\bar{x}).
Para verificar, calcula cada valor ajustado (\hat{y}_i = a + b x_i), y luego calcula los residuos (e_i = y_i-\hat{y}_i). Si los residuos son grandes o muestran un patrón curvo en lugar de ser aleatorios, eso indica que la forma lineal simple puede no ajustarse bien a los datos.
Limitaciones y modos de fallo
Aunque la aritmética es sencilla, la regresión lineal puede ser engañosa cuando los datos violan la idea detrás del modelo.
1) Relaciones no lineales
Si la relación real es curva (por ejemplo, sube y luego baja), una línea recta promediará ese comportamiento. El resultado puede seguir minimizando los errores al cuadrado, pero puede ocultar una estructura importante.
2) Los valores atípicos pueden dominar
Debido a que los errores se elevan al cuadrado en el objetivo, los puntos extremos pueden influir fuertemente en (a) y (b). Una única observación inusual puede desplazar considerablemente la línea ajustada.
3) x debe variar
Si x no tiene dispersión (todos los valores de x son idénticos), el denominador en la fórmula de la pendiente se vuelve cero. En ese caso, no se puede calcular una pendiente significativa.
4) Un “buen ajuste” no implica utilidad futura
Los patrones históricos pueden cambiar. Una regresión ajustada con datos pasados describe cómo se comportaron los datos en ese conjunto; no demuestra que el mismo patrón persistirá.
Verificación: cómo comprobar tu resultado de forma independiente
Para verificar de forma independiente una regresión lineal calculada, puedes:
- Recalcular (\bar{x}) y (\bar{y}).
- Recalcular la pendiente (b) usando la forma de desviaciones.
- Recalcular la intersección (a = \bar{y}-b\bar{x}).
- Generar los valores ajustados (\hat{y}_i) y los residuos (e_i).
- Inspeccionar los residuos:
- ¿Son en su mayoría pequeños?
- ¿Parecen estar dispersos aleatoriamente, o muestran patrones sistemáticos?
Si algún valor calculado no coincide con tu recálculo, el problema probablemente sea una discrepancia en los datos de entrada (emparejamiento diferente de x/y, mezcla de unidades u orden incorrecto), no las fórmulas de regresión.
Siguiente pregunta para aclarar
Antes de aplicar o interpretar una regresión lineal, conviene aclarar qué representa x y si una aproximación de línea recta es razonable para esos datos. Si quieres ir más allá, comparar la regresión lineal con ideas relacionadas como la correlación o diferentes tipos de regresión (por ejemplo, modelos con más predictores) puede aclarar qué cambia en el cálculo y qué permanece igual.