La regresión lineal en un minuto
La regresión lineal modela un resultado como una combinación lineal de variables de entrada. En su forma más simple, estima una ecuación como: y = a + b·x, donde a es la intersección y b es la pendiente. “Ajuste” normalmente significa que el método elige parámetros (a y b) para reducir un objetivo como la diferencia cuadrática media entre los valores predichos y los valores observados.
Cuando aplicas la idea en cualquier contexto (incluida la ingeniería de características relacionada con las finanzas), la limitación clave no es la aritmética del ajuste; es si los supuestos detrás del ajuste se asemejan al proceso real de generación de datos.
Mecanismo y dónde entran los supuestos
Una limitación básica es que la regresión lineal se construye en torno a opciones de modelado y supuestos:
- Linealidad: asume que el cambio esperado en y por unidad de cambio en x es constante (después de tener en cuenta otras variables incluidas). Si la relación verdadera es no lineal, la línea ajustada puede perder sistemáticamente el patrón.
- Independencia y comportamiento estable del error: muchas interpretaciones estándar asumen que los errores no están fuertemente correlacionados y tienen una varianza aproximadamente constante. Si los errores se agrupan a lo largo del tiempo o la varianza cambia, las estimaciones de incertidumbre pueden ser incorrectas.
- Exogeneidad de las entradas (en términos causales): si x está influenciada por factores no observados que también afectan a y, la relación ajustada puede reflejar esos factores ocultos en lugar de un vínculo estable.
Separar la “mecánica” de las “condiciones de mercado/proveedor” es importante porque el procedimiento de ajuste de regresión es determinista dados los datos, pero el entorno del mundo real que genera nuevos datos puede diferir.
Evidencia y modos de fallo concretos (con supuestos declarados)
Considera un ejemplo sencillo en el que ajustas y = a + b·x usando pares históricos (x, y) y evalúas el ajuste usando los mismos datos históricos. Un buen ajuste histórico puede ocurrir incluso si la relación no es fiable.
Los modos de fallo comunes incluyen:
- Sobreajuste al ruido: con demasiadas variables, o con patrones que solo existen en una ventana de tiempo limitada, el modelo puede igualar aleatoriedad pasada.
- Cambios de régimen: si la relación entre x e y cambia después del período de entrenamiento, los coeficientes anteriores ya no describen el nuevo régimen.
- Valores atípicos y colas pesadas: los objetivos de error cuadrático pueden estar dominados por observaciones extremas, lo que lleva a estimaciones de parámetros que reflejan valores atípicos más que los datos típicos.
- No estacionariedad: en muchos conjuntos de datos ordenados en el tiempo, las distribuciones pueden desplazarse. Una regresión entrenada en un período puede no representar períodos posteriores.
En contextos relacionados con las finanzas, también es común que la “misma” variable se comporte de manera diferente según las condiciones (por ejemplo, durante cambios de volatilidad). La regresión lineal no detecta automáticamente esos cambios; simplemente extrapola una relación aprendida hasta que los datos dejan de coincidir con sus supuestos.
Limitaciones y riesgos
Las principales limitaciones se refieren a la incertidumbre y a la facilidad con la que la interpretación se rompe:
- Las relaciones históricas no establecen resultados futuros. Incluso si el modelo minimiza el error cuadrático en el pasado, no hay garantía de que el proceso futuro de generación de datos coincida con las condiciones de entrenamiento.
- Las estimaciones y los intervalos dependen de los supuestos. Si la varianza del error cambia o las observaciones están correlacionadas, las declaraciones estándar de incertidumbre pueden ser demasiado optimistas o estar mal calibradas.
- Sensibilidad a la calidad de los datos: valores faltantes, preprocesamiento inconsistente o medición cambiante pueden alterar los resultados.
- “Especificación errónea del modelo”: incluso cuando el método se ejecuta, la forma lineal puede ser la forma funcional incorrecta.
Por separado, los resultados en entornos reales de toma de decisiones pueden variar debido a costos, diferencias de ejecución y restricciones específicas de la jurisdicción. Esos factores no son capturados por el ajuste de regresión solo, por lo que una relación aparentemente fuerte puede no traducirse en un rendimiento utilizable en el mundo real.
Cómo verificar de forma independiente qué está (y qué no está) respaldado
Para verificar las limitaciones de una manera que no asuma el éxito futuro, puedes comprobar si los supuestos subyacentes parecen plausibles:
- Utiliza una evaluación que respete el tiempo: prueba con datos posteriores que no se usaron para ajustar los parámetros.
- Comprueba el comportamiento de los residuos: busca patrones sistemáticos en los errores y signos de varianza cambiante.
- Prueba la estabilidad: ajusta modelos en múltiples ventanas y observa si los coeficientes varían drásticamente.
- Compara formas funcionales: si una forma lineal simple falla repetidamente mientras que las alternativas no lineales reducen el error sistemático, la limitación es probablemente una especificación errónea.
Si necesitas explicar las limitaciones con claridad, concéntrate en lo que tendría que ser cierto para que la regresión sea significativa en tu contexto y luego evalúa dónde podría fallar.