Definición: qué es la regresión lineal
La regresión lineal es un método estadístico que modela la relación entre una variable dependiente (y) y una variable independiente (x) mediante una ecuación de línea recta:
[ \hat{y} = a + b x ]
- (\hat{y}) es el valor predicho de (y).
- (a) es la intersección.
- (b) es la pendiente.
La idea clave es que la línea ajustada se elige de modo que los errores de predicción sean lo más pequeños posible de una manera específica: minimiza la suma de los residuos al cuadrado (\sum (y-\hat{y})^2) sobre los datos de entrenamiento. Los residuos son las diferencias entre los valores observados (y) y los valores predichos (\hat{y}).
Mecánica: qué calcula realmente un ejemplo resuelto
Un “ejemplo resuelto” significa que eliges un conjunto de datos pequeño, declaras cada supuesto (incluyendo cómo se definen (x) e (y)), calculas (a) y (b), y luego usas la línea ajustada para producir valores ajustados y al menos una nueva predicción.
Supuestos para los cálculos numéricos resueltos a continuación:
- Tienes observaciones pareadas ((x_i, y_i)).
- La forma del modelo es correcta para la ventana de datos: una relación lineal entre (x) e (y).
- Los coeficientes se calculan con mínimos cuadrados ordinarios (OLS): minimizando los residuos al cuadrado.
- Tratamos los valores de entrada (x) como dados (sin modelo de incertidumbre adicional para (x)).
- El ejemplo es puramente ilustrativo; no utiliza datos de mercado en tiempo real.
Evidencia: un ejemplo resuelto completamente numérico
Supongamos que observas 4 puntos:
- (x: 1, 2, 3, 4)
- (y: 2, 3, 5, 4)
Paso 1: Calcula las medias. [ \bar{x} = (1+2+3+4)/4 = 2.5 ] [ \bar{y} = (2+3+5+4)/4 = 3.5 ]
Paso 2: Calcula la pendiente (b). [ b = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sum (x_i-\bar{x})^2} ] Calcula los valores de la tabla:
- Para (x=1): (x-\bar{x}=-1.5), (y-\bar{y}=-1.5), producto = 2.25
- Para (x=2): (x-\bar{x}=-0.5), (y-\bar{y}=-0.5), producto = 0.25
- Para (x=3): (x-\bar{x}=0.5), (y-\bar{y}=1.5), producto = 0.75
- Para (x=4): (x-\bar{x}=1.5), (y-\bar{y}=0.5), producto = 0.75
Suma de productos = (2.25+0.25+0.75+0.75 = 4.0).
Denominador (\sum (x_i-\bar{x})^2):
- ((-1.5)^2=2.25), ((-0.5)^2=0.25), ((0.5)^2=0.25), ((1.5)^2=2.25)
Suma = (2.25+0.25+0.25+2.25 = 5.0).
Entonces: [ b = 4.0/5.0 = 0.8 ]
Paso 3: Calcula la intersección (a). [ a = \bar{y} - b\bar{x} = 3.5 - 0.8\cdot 2.5 = 3.5 - 2.0 = 1.5 ]
Paso 4: Escribe la línea ajustada. [ \hat{y} = 1.5 + 0.8x ]
Paso 5: Calcula los valores ajustados para los (x) observados.
- Si (x=1), (\hat{y}=2.3)
- Si (x=2), (\hat{y}=3.1)
- Si (x=3), (\hat{y}=3.9)
- Si (x=4), (\hat{y}=4.7)
Paso 6 (una predicción simple): Para un nuevo (x=5), [ \hat{y}=1.5+0.8\cdot 5=5.5 ]
Cada número anterior puede verificarse de forma independiente recalculando las sumas y las fórmulas OLS.
Limitaciones y riesgos: qué puede hacer fallar la regresión lineal
La regresión lineal no es una garantía de predicciones precisas. Las limitaciones importantes incluyen:
- El supuesto de linealidad puede ser incorrecto. Si la relación verdadera entre (x) e (y) se curva, una línea recta puede fallar sistemáticamente en captar el patrón.
- Sensibilidad a valores atípicos. Un solo (y) extremo (o un (x) influyente lejos de la media) puede arrastrar la pendiente y la intersección.
- Las relaciones históricas pueden no mantenerse. Incluso si la línea ajustada coincide con los datos de entrenamiento, el futuro podría comportarse de manera diferente porque el proceso generador de datos puede cambiar.
- Variables omitidas. Si (y) depende de otros factores no representados por (x), los errores pueden ser estructurados en lugar de aleatorios.
- Datos ruidosos y error del modelo. Minimizar los residuos al cuadrado mejora una noción de ajuste, pero no garantiza un buen rendimiento bajo condiciones diferentes.
Estos problemas son generales al modelado estadístico: los resultados varían según las propiedades de los datos y cómo se recopilaron y procesaron los datos.