Qué significa “backtesting responsable” para el Vortex
El backtesting responsable es una forma estructurada de probar si un método basado en el Vortex se desempeña de manera consistente utilizando datos históricos de mercado, sin tratar los resultados pasados como prueba de resultados futuros. El objetivo no es predecir, sino producir una prueba transparente y repetible que otros puedan examinar.
Una definición práctica: construyes un backtest que (1) define el cálculo del Vortex y sus entradas, (2) aplica supuestos claramente establecidos, (3) incluye costos y restricciones de ejecución, (4) reduce formas comunes de sesgo y (5) verifica el rendimiento utilizando períodos fuera de muestra.
Cómo funciona el Vortex en una prueba (mecánica y supuestos)
Antes de las implicaciones, define la mecánica que probarás. Para un enfoque basado en el Vortex, eso generalmente significa decidir qué series de precios alimentan el cálculo (por ejemplo, campos específicos de OHLC) y qué marco temporal y reglas de barra utilizas. También necesitas una regla para cómo la salida del indicador se convierte en una decisión en tu prueba.
Para mantener la prueba auditable, documenta los supuestos explícitamente:
- Datos: qué universo de instrumentos, marco temporal y rango de fechas se incluyen.
- Momento del cálculo: si los valores se calculan al cierre de la barra, intrabarra o con un desfase específico.
- Mapeo de decisiones: si el método utiliza umbrales, clasificación u otra regla para convertir los valores del indicador en una acción.
- Modelo de ejecución: cómo entras y sales en relación con la marca de tiempo de la señal calculada.
Ejemplo de supuesto material: si asumes “ejecución en la apertura de la siguiente barra” pero tu cálculo utiliza el “cierre de la barra actual”, debes reflejar esa diferencia de momento de manera consistente. Si no puedes justificar el momento, debes esperar resultados engañosos.
Costos, características y supuestos de ejecución (evita resultados inflados)
Los backtests a menudo parecen mejores que la realidad porque ignoran los costos y simplifican la ejecución. Incluso cuando el método es puramente basado en indicadores, tu prueba aún necesita un modelo de costos y ejecución.
Componentes de costos comunes a incluir como supuestos (incluso si se estiman):
- Spread o costo de transacción por operación.
- Deslizamiento: movimiento de precio adicional entre el llenado teórico y el llenado supuesto.
- Comisión o estructura de tarifas, si corresponde.
Restricciones de ejecución a modelar conceptualmente:
- Liquidez limitada: tamaños de posición más grandes pueden empeorar los llenados.
- Incertidumbre en el llenado de órdenes: si se asume que los llenados siempre son posibles al precio elegido.
- Efectos de la frecuencia de negociación: los cambios frecuentes magnifican los costos.
Si varías solo la lógica del indicador mientras mantienes los costos en cero, es probable que sobrestimes el rendimiento.
Controles de sesgo (cómo prevenir el sobreajuste)
Muchas pruebas de indicadores “exitosas” fallan porque el diseño de la prueba accidentalmente se ajusta al pasado. Usa controles de sesgo para mantener la prueba honesta.
Verificaciones clave:
- Sesgo de mirar hacia adelante: asegúrate de que tu prueba nunca use información futura para calcular decisiones actuales.
- Sesgo de supervivencia: asegúrate de que los instrumentos en la muestra histórica reflejen lo que era negociable en ese momento.
- Espionaje de datos: evita probar muchas variantes y seleccionar la que tenga los mejores resultados sin un paso de validación disciplinado.
- Sobreajuste de parámetros: si ajustas parámetros (por ejemplo, umbrales o longitudes de ventana), debes validar en datos separados.
Una práctica responsable es predefinir qué medirás (por ejemplo, rendimientos, reducciones, número de operaciones) y cómo compararás las variantes, en lugar de ajustar las reglas después de ver los resultados.
Validación fuera de muestra y verificaciones de estabilidad
Para probar si los resultados se generalizan, divide la línea de tiempo. Una estructura común es:
- Ventana de entrenamiento o desarrollo: se utiliza para finalizar supuestos y elecciones de parámetros.
- Ventana de validación: se utiliza para evaluar diseños candidatos.
- Ventana de prueba: se utiliza una vez, al final, para una verificación final.
También debes evaluar la estabilidad en diferentes condiciones de mercado. En lugar de centrarte en un solo período con resultados sólidos, examina si el rendimiento se degrada de manera similar en múltiples regímenes.
Evita tratar pequeñas diferencias como significativas. Si la prueba es sensible a cambios menores en los supuestos, el método puede ser demasiado frágil para ser confiable.
Limitaciones materiales y modos de falla
Los backtests históricos no pueden garantizar resultados futuros. Los modos de falla específicos a tener en cuenta incluyen:
- Cambio de régimen: cambios en la volatilidad, el comportamiento del spread o la estructura del mercado pueden romper relaciones.
- Desajuste de ejecución: los llenados reales pueden diferir del modelo de llenado del backtest.
- Fragilidad del modelo: pequeños cambios en el momento, los costos o los parámetros producen grandes oscilaciones en los resultados.
- Sobreajuste disfrazado de rendimiento: resultados de validación y prueba que no fueron verdaderamente independientes.
Un resumen responsable reconoce la incertidumbre. Si tu prueba mejora solo cuando asumes costos irrealmente bajos o llenados perfectos, eso es un indicador de debilidad.