Defina el R Cuadrado antes de recopilar datos
El R Cuadrado (a menudo escrito R²) es un número resumen que compara qué tan bien las predicciones de un modelo coinciden con los resultados observados. La idea habitual es: cuánta de la variación en la variable dependiente observada es explicada por el modelo, en relación con una línea base que predice algo como la media.
Para evaluar el R Cuadrado, primero necesita conocer la definición exacta que se utiliza (por ejemplo, si se calcula a partir de la suma total de cuadrados y la suma residual de cuadrados de la manera estándar, y si se utiliza alguna variante “ajustada”). Diferentes implementaciones pueden reportar números diferentes incluso cuando los datos subyacentes son similares.
Entradas de datos que necesita
Como mínimo, necesita toda la información necesaria para reproducir el lado dependiente del cálculo.
- Serie de la variable dependiente observada
- Las observaciones indexadas en el tiempo que forman los valores de y.
- La frecuencia de muestreo (por ejemplo, cada tick, cada minuto, diario), incluidas las unidades.
- Las reglas de alineación temporal (cuándo se considera que cada valor de y “corresponde” a los predictores).
- Valores predichos o el modelo ajustado Tiene dos opciones:
- Valores predichos: los valores de y-hat predichos por el modelo para los mismos puntos temporales, con el mismo orden.
- O bien, las entradas del modelo necesarias para generar y-hat: la serie de predictores (valores de x), el método de estimación y los parámetros producidos por el ajuste.
- La línea base utilizada en el denominador La mayoría de las fórmulas de R² utilizan una línea base que refleja la variación alrededor de la media de la variable dependiente observada. Para evaluar el R² correctamente, debe saber qué línea base se utiliza y si la media se calcula en la misma partición del conjunto de datos que los residuos.
Comprobaciones de procedencia y preprocesamiento
El R² no es solo una fórmula; depende de lo que se incluyó en la serie.
Verifique y registre:
- Procedencia de los datos: de dónde provienen los datos (fuente o suministro) y cómo se obtuvieron.
- Reglas de filtrado de datos: si se eliminaron observaciones debido a errores, días festivos, valores atípicos o baja liquidez.
- Manejo de valores faltantes: si los vacíos se eliminaron, se rellenaron hacia adelante, se interpolaron o se trataron de otra manera.
- Transformaciones: si se aplicó algún escalado, transformación logarítmica, diferenciación o normalización, y si fue consistente entre los períodos de entrenamiento y evaluación.
Riesgo material: si x e y se preprocesan de manera diferente, o si las marcas de tiempo están desalineadas, el R² puede parecer más alto o más bajo por razones no relacionadas con el poder explicativo genuino.
Actualidad y supuestos de partición
Para evaluar si un valor de R² es significativo, necesita saber cómo se utilizó el tiempo.
Debe documentar:
- Si el R² se calculó con los mismos datos utilizados para ajustar el modelo o con datos reservados (held-out).
- La ventana temporal específica utilizada para el ajuste frente a la evaluación.
- Si se utilizó un enfoque de ventana móvil o expansiva (el enfoque cambia el significado del resultado reportado).
Un modo de falla común es tratar el R² dentro de la muestra como si describiera relaciones futuras. Las relaciones históricas pueden cambiar cuando el comportamiento del mercado cambia, por lo que el mismo método puede producir un R² diferente con datos posteriores.
Evidencia o ejemplo: qué puede verificar de forma independiente
Una lista de verificación de verificación independiente debe incluir:
- Confirmar la serie de y exacta utilizada (marcas de tiempo, unidades y filtrado).
- Confirmar si el valor reportado utilizó predicciones de y-hat o predicciones recalculadas a partir de los parámetros del modelo almacenados.
- Confirmar la definición exacta de R² (y si se utilizó el R² ajustado).
- Recalcular el R² a partir de los números proporcionados (y, y-hat, residuos) utilizando la fórmula indicada y la misma partición del conjunto de datos.
Si falta alguno de estos elementos, el R² reportado no puede auditarse por completo, porque muchos detalles de implementación cambian el resultado.
Limitaciones y riesgos (modos de falla materiales)
Al menos una limitación a tener en cuenta:
- Dependencia del modelo: el R² refleja el ajuste bajo una forma de modelo particular. Si la relación es no lineal o cambia con el tiempo, el mismo R² puede ser engañoso.
Otras limitaciones importantes:
- No estacionariedad: si el proceso generador de datos evoluciona, un R² alto en un período puede no mantenerse más adelante.
- Sobreajuste: si el modelo es demasiado flexible, puede ajustarse al ruido, inflando el R² dentro de la muestra.
- Sensibilidad al ruido y a eventos raros: las mediciones ruidosas pueden causar un R² inestable entre ventanas temporales.
- Comparaciones engañosas: los valores de R² pueden ser difíciles de comparar entre modelos si el preprocesamiento, los conjuntos de características o las particiones de evaluación difieren.