R Cuadrado: defina el concepto antes de hacer backtesting
R Cuadrado (a menudo escrito R²) es una estadística que describe cuánta de la variación en un resultado medido puede ser explicada por un modelo o relación. En el backtesting, la responsabilidad clave no es tratar R² como una señal de trading por sí mismo, sino definir exactamente qué está regresando sobre qué, y qué significa el “resultado explicado” en su caso de uso.
Un flujo de trabajo responsable comienza por escribir:
- la variable dependiente (el resultado que mide)
- la(s) variable(s) independiente(s) (la(s) característica(s) o valores de indicador que utiliza)
- el método utilizado para calcular la relación (por ejemplo, una regresión o un enfoque tipo correlación)
- la regla de alineación temporal (qué timestamp/precio alimenta el resultado de qué período)
Si no puede establecer estos elementos con precisión, los resultados del backtest no son verificables de forma independiente.
Mecánica: decida datos, supuestos y costos
Los backtests solo son significativos cuando las reglas de preparación de datos son explícitas. Las responsabilidades comunes incluyen:
Definición de datos y muestreo
Elija una cuadrícula de tiempo consistente (por ejemplo, el cierre de cada barra) y especifique cómo maneja las observaciones faltantes. Defina la ventana de retroceso utilizada para calcular R². Si utiliza una ventana móvil, especifique su longitud y si se actualiza en cada barra o solo en ciertos momentos.
Alineación temporal y controles de fuga
Un modo de fallo común es el sesgo de mirar hacia adelante: usar información que no habría sido conocida en el momento de la decisión. Establezca una regla de alineación como “el valor del indicador calculado usando datos hasta el tiempo t se evalúa contra el resultado de t a t+1”. Luego aplíquela en el código y mediante comprobaciones puntuales de fechas.
Costos y modelo de ejecución
Incluso si solo prueba una estadística de relación, muchos flujos de trabajo eventualmente la traducen en decisiones. Si lo hace, debe modelar las fricciones materiales:
- supuestos de spread bid/ask
- comisiones o tarifas
- deslizamiento por impacto de mercado o llenado de órdenes
Un backtest responsable trata los costos como parte del pipeline de datos a resultado, no como una ocurrencia tardía. De lo contrario, R² puede parecer fuerte mientras que cualquier resultado práctico y consciente de costos sería más débil o inconsistente.
Evidencia: use controles de sesgo y comprobaciones fuera de muestra
Para verificar que su “efecto R²” no es un artefacto, use separación de datos y evaluación estricta.
Controles de sesgo
Como mínimo, controle las principales fuentes de sesgo:
- sesgo de mirar hacia adelante (alineación temporal)
- sesgo de selección (elegir períodos después de ver los resultados)
- sesgo de sobreajuste (ajustar parámetros para maximizar el rendimiento dentro de la muestra)
Un enfoque práctico es tratar cualquier elección de parámetros (longitud de ventana, reglas de preprocesamiento, umbrales) como fija antes del paso de evaluación final.
Pruebas fuera de muestra
R² calculado sobre los mismos datos utilizados para definir la relación puede sobreestimar la fiabilidad. Utilice:
- un período de entrenamiento (dentro de la muestra) para establecer cualquier elección
- un período de validación para confirmar que no solo está ajustando ruido
- un período final fuera de muestra para la evaluación más conservadora
Si la relación cambia materialmente entre períodos, ese es un hallazgo importante.
Una limitación material y por qué importa
Un modo de fallo importante es que las relaciones explicativas históricas no garantizan estabilidad futura. Los regímenes de mercado pueden cambiar, y el ajuste estadístico puede deteriorarse cuando las condiciones cambian, especialmente cuando los costos, la liquidez o la calidad de ejecución difieren de los supuestos.
Limitaciones y riesgos que debería poder explicar
Un backtest responsable debería incluir una sección clara de limitaciones que aborde:
- No estacionariedad: las relaciones pueden variar con el tiempo.
- Sensibilidad a la especificación del modelo: pequeños cambios en las entradas o la alineación pueden cambiar R².
- Riesgo de sobreajuste: un alto ajuste dentro de la muestra aún puede producir resultados débiles en el mundo real.
- Sensibilidad a los costos: ignorar el spread y el deslizamiento puede convertir una relación aparente en una ilusión.
También recuerde: R² es una medida de ajuste a una definición de resultado. Si su variable de resultado está mal elegida o es inconsistente con las oportunidades de decisión reales, la estadística puede engañar.
Verificación: lo que puede comprobar de forma independiente a continuación
Para verificar de forma independiente un backtest responsable de R², debería poder mostrar a otros:
- la definición exacta de las variables dependientes e independientes
- la regla de alineación temporal y el método de ventanas
- los supuestos de costos y ejecución utilizados en el pipeline
- la estrategia de división de datos (entrenamiento/validación/fuera de muestra) y qué parámetros se ajustaron
- al menos un modo de fallo que haya probado (por ejemplo, sesgo de mirar hacia adelante mediante una comprobación conocida de cambio de fecha)