Respuesta directa
Las pruebas fuera de muestra están diseñadas para estimar qué tan bien puede funcionar un modelo o regla con datos que no ha visto durante el ajuste. Su principal limitación es que los datos históricos “no vistos” siguen sin ser lo mismo que las condiciones futuras y reales. Incluso cuando los resultados fuera de muestra parecen sólidos, pueden persistir errores debido a cambios en el comportamiento del mercado, supuestos imperfectos (especialmente en torno a costos y ejecución) y decisiones sobre cómo se realizan la división de datos y la evaluación.
Mecanismo y definición
Un flujo de trabajo típico es: (1) ajustar un modelo o regla de decisión utilizando un período de entrenamiento, (2) probarlo en un período fuera de muestra que el modelo no utilizó para la selección de parámetros, y (3) comparar métricas como el rendimiento promedio, las reducciones (drawdowns) o medidas similares a la precisión (para clasificación). El objetivo es detectar el sobreajuste: la tendencia de una regla a ajustarse al ruido del conjunto de entrenamiento.
Las pruebas fuera de muestra reducen un riesgo específico: reutilizar los mismos datos para ajustar y evaluar. Pero no eliminan otras fuentes de incertidumbre. La prueba sigue dependiendo de supuestos sobre lo que estaba disponible en ese momento, cómo se habrían ejecutado las operaciones y si las relaciones estadísticas del pasado persistirán.
Para que cualquier cálculo sea interpretable, debes declarar los supuestos. Por ejemplo: qué ventanas de tiempo exactas definen el entrenamiento frente a la prueba, si existen ventanas superpuestas, cómo se manejan los datos faltantes y qué costos y deslizamiento de ejecución se modelan (o se ignoran). Sin esos detalles, dos personas pueden describir experimentos diferentes usando la misma frase.
Evidencia o ejemplo (modos de fallo)
Considera una regla que parece estable cuando se prueba en un único intervalo fuera de muestra. Aún pueden ocurrir varios modos de fallo importantes:
-
Cambio de datos (cambio de régimen): Si la volatilidad, la liquidez, los spreads o la dinámica típica de precios cambian después del período fuera de muestra, el modelo puede extrapolar incorrectamente. Los datos históricos “no vistos” no garantizan la cobertura de regímenes futuros.
-
Efectos de selección ocultos: Incluso con una división limpia de entrenamiento/prueba, puedes seleccionar accidentalmente la configuración de “mejor apariencia” probando muchas variantes y luego centrándote en la que tuvo mejor rendimiento fuera de muestra. El resultado puede ser optimista porque la evaluación se convierte en parte del proceso de selección.
-
Desajuste de la métrica de evaluación: Un modelo puede obtener una buena puntuación en una métrica que no refleja las restricciones reales. Por ejemplo, una estrategia podría mostrar un rendimiento promedio aceptable pero aún así depender de eventos raros que son difíciles de ejecutar de manera confiable.
-
Incertidumbre en costos y ejecución: El backtesting a menudo utiliza supuestos simplificados. Los resultados reales pueden diferir cuando se incluyen spreads realistas, comisiones, efectos de financiación/nocturnos, latencia, comportamiento de llenado de órdenes o una gestión de riesgos conservadora. Las pruebas fuera de muestra pueden ser internamente consistentes con sus propios supuestos y aun así tergiversar las condiciones reales.
-
Límites del tamaño de la muestra: Si la ventana fuera de muestra es corta, las estimaciones de rendimiento tienen una alta varianza. Un resultado aparentemente confiable puede ser un resultado casual.
Limitaciones y riesgos
Las limitaciones se resumen mejor como un conjunto de problemas de “lo que no controlaste”:
- Las relaciones históricas pueden no persistir. Las pruebas fuera de muestra miden la dependencia de patrones pasados, no la inevitabilidad futura.
- Los supuestos son variables. Los costos, la ejecución y los detalles operativos suelen ser las mayores diferencias entre los backtests y la realidad.
- La incertidumbre permanece incluso sin sobreajuste. Eliminar el sobreajuste del conjunto de entrenamiento no garantiza la generalización bajo cambios de distribución.
- Los resultados pueden ser frágiles. El rendimiento puede depender de la división exacta, de los pasos exactos de preprocesamiento y de la forma exacta en que se simulan las operaciones.
Debido a estos problemas, las pruebas fuera de muestra son más confiables como verificación de robustez que como prueba. Proporcionan evidencia bajo condiciones específicas, no certeza.
Verificación o siguiente pregunta
Para verificar de forma independiente las afirmaciones sobre una prueba fuera de muestra, concéntrate en la reproducibilidad en lugar de la persuasión. Solicita: (1) la definición exacta de los períodos de entrenamiento y fuera de muestra, (2) los pasos de preprocesamiento y las reglas de limpieza de datos, (3) los supuestos de costos/ejecución utilizados en la prueba, (4) cuántas configuraciones o hiperparámetros se probaron antes de seleccionar el reportado, y (5) si los resultados son consistentes en múltiples divisiones no superpuestas.
Una buena pregunta a continuación es: ¿Qué tan sensibles son los resultados a la división, la duración de la ventana de tiempo y el modelo de ejecución/costos? Si pequeños cambios alteran materialmente las conclusiones, entonces la prueba fuera de muestra está indicando fragilidad en lugar de robustez.