Ejemplo práctico de pruebas fuera de muestra

Ejemplo práctico de pruebas fuera de muestra, supuestos y limitaciones.

Respuesta directa

Las pruebas fuera de muestra son una forma de comprobar cómo se desempeña una regla de decisión (por ejemplo, un modelo de pronóstico o una regla de estrategia) con datos que no vio durante el ajuste o la optimización. Un ejemplo práctico aclara la lógica: creas un modelo utilizando una primera porción de datos históricos y luego lo evalúas en una porción separada de “exclusión” (holdout). El objetivo es estimar el rendimiento sin el sesgo optimista que surge de adaptarse a los mismos datos.

Un ejemplo práctico debe establecer explícitamente supuestos como cómo se realiza la división, qué cálculos se repiten y cómo se calcula el rendimiento. También debe señalar limitaciones: los resultados fuera de muestra pueden fallar cuando el mercado cambia, cuando los costos y la ejecución no son realistas, o cuando se filtra información del período de evaluación a los pasos de ajuste.

Mecanismo y definición

Este es el flujo de trabajo central, expresado de forma general:

  1. Elige una familia de modelos y un procedimiento de ajuste. Esta es la parte que puede “aprender” de los datos.
  2. Divide el conjunto de datos disponible en dos conjuntos disjuntos: un período dentro de la muestra (entrenamiento) y un período fuera de la muestra (prueba).
  3. Ajusta u optimiza solo con el conjunto dentro de la muestra (incluyendo la selección de hiperparámetros o umbrales).
  4. Congela el modelo y evalúalo una vez en el conjunto fuera de la muestra.

Términos importantes en este contexto:

  • “Dentro de la muestra” significa los datos utilizados para el ajuste/optimización.
  • “Fuera de la muestra” significa los datos reservados para la evaluación.
  • “Exclusión” (holdout) significa que el período de prueba no se utiliza para tomar decisiones adicionales de optimización.

Por qué ayuda esto: cuando optimizas con los mismos datos que evalúas, puedes capturar ruido accidentalmente. Las pruebas fuera de muestra reducen ese sesgo particular al forzar la evaluación con datos no vistos.

Evidencia o ejemplo numérico práctico (con supuestos explícitos)

Supón que quieres predecir la dirección del día siguiente (Alza o Baja) basándote en una característica, X, calculada a partir de la información de cada día disponible antes de que comience el día siguiente.

Supuestos para el ejemplo:

  • Tienes 20 días secuenciales de datos.
  • Los días 1–12 están dentro de la muestra; los días 13–20 están fuera de la muestra.
  • El modelo es una regla simple: predecir “Alza” si X > T, de lo contrario predecir “Baja”.
  • Los valores de X y los resultados realizados del día siguiente son fijos (no llegan nuevos datos).
  • Durante la optimización, puedes elegir T usando solo los días 1–12.
  • Calculas la precisión como la fracción de llamadas correctas de dirección del día siguiente.

Paso A: Optimiza T dentro de la muestra (días 1–12) Supón que cuando pruebas umbrales candidatos, el mejor umbral en los días 1–12 es T = 0.50.

  • Precisión dentro de la muestra usando T=0.50: 9 correctos de 12 = 75%.

Paso B: Congela y evalúa fuera de la muestra (días 13–20) Ahora aplicas la regla congelada (Alza si X>0.50, si no Baja) a los días 13–20. Supón que la regla produce:

  • 3 correctos de 8 días.
  • Precisión fuera de la muestra = 3/8 = 37.5%.

Cómo interpretar este resultado numérico

  • La puntuación dentro de la muestra (75%) sugiere que la regla se ajusta a algo en el período de entrenamiento.
  • La caída fuera de la muestra al 37.5% indica que la relación aparente dentro de la muestra no se generalizó bien al período posterior.
  • Esto no demuestra que la regla sea inútil para siempre; muestra que, bajo la división y los supuestos establecidos, la evidencia del período de evaluación es más débil que la del entrenamiento.

Limitaciones y modos de fallo materiales

Las pruebas fuera de muestra reducen una forma de sesgo, pero no garantizan un rendimiento futuro fiable. Las limitaciones materiales incluyen:

  1. Comparaciones múltiples y uso excesivo del conjunto de prueba Si ajustas repetidamente T (u otras opciones) basándote en los resultados del período de prueba, la prueba se vuelve parcialmente dentro de la muestra. Esto reintroduce el sesgo optimista.

  2. Fuga de datos Si cualquier parte del proceso de ajuste utiliza accidentalmente información no disponible en el momento de la predicción (por ejemplo, usar entradas derivadas del futuro), la estimación fuera de la muestra puede ser inválida incluso con una división limpia.

  3. No estacionariedad (cambio de régimen) Las series temporales financieras pueden cambiar su comportamiento con el tiempo. Un modelo que funciona en un período puede fallar en otro porque la relación subyacente entre X y el resultado ha cambiado.

  4. Falta de realismo: costos y ejecución Incluso si las predicciones de dirección son “correctas”, los resultados reales dependen de los costos de transacción, los spreads y el momento de ejecución. Las métricas de evaluación simplificadas pueden sobreestimar los resultados prácticos.

  5. Efectos de muestra pequeña Con datos limitados fuera de la muestra, la estimación puede tener una alta variabilidad. Un número bajo o alto puede reflejar aleatoriedad en lugar de una verdadera generalización.

Operar con divisas y CFD implica un riesgo considerable. La información de FoxiForex es educativa y no constituye asesoramiento financiero personal. El contenido patrocinado se identifica claramente.