Defina el Índice de Úlcera antes de probarlo
El Índice de Úlcera es una estadística basada en el drawdown. Conceptualmente, resume cuánto y durante cuánto tiempo una serie de precios permanece por debajo de su pico reciente. Para el backtesting, el punto clave no es la etiqueta sino la definición exacta que usted implementa: a qué “pico” hace referencia, con qué frecuencia muestrea los datos, la ventana o el período utilizado, y cómo se convierte la serie de drawdown en el número final.
Un enfoque responsable comienza por escribir el cálculo que va a reproducir. Si no puede establecer el procedimiento completo con precisión, no puede probarlo de manera confiable. Trate el indicador como una herramienta de medición que produce un valor a partir de entradas, no como una señal de trading independiente.
Separe la mecánica estable de las condiciones variables
La precisión del backtesting a menudo falla cuando las personas mezclan la mecánica del indicador con las condiciones cambiantes del mercado y de ejecución.
Mantenga estas preocupaciones distintas:
- Entradas del indicador: la serie de precios utilizada para calcular los drawdowns, la frecuencia de remuestreo y la ventana del Índice de Úlcera.
- Entorno de backtesting: supuestos sobre cuándo los valores son “conocidos” (sincronización), cómo se ejecutan las órdenes y qué fricciones se aplican.
- Regla de decisión (si existe): cómo transformaría las salidas del indicador en una métrica de evaluación.
Incluso si no está construyendo una regla de trading, aún necesita definir un objetivo. Por ejemplo, podría evaluar si los períodos con un Índice de Úlcera más alto coinciden con drawdowns más grandes en la serie subyacente. Eso es una verificación de relación, no un pronóstico.
Establezca supuestos para datos y costos
El backtesting responsable documenta los supuestos. Las categorías comunes de supuestos incluyen:
1) Alcance y continuidad de los datos
- Utilice una serie histórica única y consistente.
- Decida qué sucede con los datos faltantes y los cambios corporativos o estructurales (en FX, esto se trata principalmente de la continuidad de los datos y de cómo se construye la serie).
2) Muestreo y sincronización
- Defina si calcula el Índice de Úlcera al cierre de la vela, intrabar, o utilizando alguna otra convención.
- Asegúrese de que su “momento de decisión” no pueda utilizar información posterior al momento en que se tomaría.
3) Costos y fricciones Si su evaluación incluye cualquier acción derivada del indicador, incluya fricciones realistas en la métrica de evaluación. Las fricciones materiales típicas son los spreads, las comisiones y el deslizamiento. Incluso si su objetivo es educativo en lugar de centrado en el rendimiento, incluir costos ayuda a prevenir resultados que parecen sólidos solo porque se ignoraron los costos.
Controle el sesgo con verificaciones de fallo explícitas
El sesgo es un modo de fallo importante en los backtests de indicadores. Incluya verificaciones que intenten específicamente romper la prueba.
Sesgo de look-ahead Asegúrese de que el valor del Índice de Úlcera utilizado en el momento t se calcule solo a partir de los datos disponibles hasta el momento t. Un error frecuente es calcular utilizando la trayectoria de precios de toda la vela cuando la decisión solo sería posible al cierre de la vela.
Sesgo de sobreajuste (pruebas múltiples) Si prueba muchos ajustes de parámetros (longitudes de ventana, umbrales, reglas), puede terminar seleccionando una configuración que coincida con el ruido. Limite el espacio de búsqueda o separe la selección de parámetros de la evaluación final.
Sesgo de selección Evite evaluar solo los períodos que “funcionaron” bien. Utilice períodos de evaluación predefinidos o un procedimiento de walk-forward.
Una forma práctica de hacer esto de manera responsable es crear una lista de verificación de lo que podría salir mal (errores de sincronización, fuga de parámetros y omisión de costos) y verificar cada uno antes de interpretar cualquier resultado.
Utilice verificaciones fuera de muestra para probar la robustez
Las relaciones históricas no establecen resultados futuros. Para reducir la posibilidad de que sus hallazgos sean un artefacto de un solo período, evalúe con datos no utilizados para la selección de parámetros.
Las estructuras comunes y perdurables incluyen:
- Divisiones de entrenamiento/validación/prueba: elija los parámetros utilizando el entrenamiento y confirme solo en la validación, luego finalice en la prueba.
- Evaluación walk-forward (rodante): reestime repetidamente los parámetros utilizando solo datos anteriores y evalúe en períodos posteriores.
Defina una métrica de rendimiento única para la evaluación. Por ejemplo, si solo está estudiando drawdowns, podría comparar la profundidad del drawdown realizado en relación con los niveles del Índice de Úlcera. Mantenga la métrica estable en todos los experimentos.
Conozca al menos una limitación material
Una limitación clara es que el Índice de Úlcera comprime la información del drawdown en un solo número. Eso puede ocultar detalles de la distribución. Dos períodos pueden compartir valores similares del Índice de Úlcera mientras difieren en la velocidad de recuperación, la volatilidad alrededor de los picos o la agrupación de movimientos extremos.
Además, el comportamiento del indicador puede variar según el régimen del mercado. Si su backtest incluye solo un régimen (por ejemplo, condiciones mayormente tranquilas), la relación podría no mantenerse cuando las condiciones cambien.