样本外测试的实例解析

样本外测试实例解析的假设与局限。

样本外测试的实例解析

直接回答

样本外测试是一种评估决策规则(例如预测模型或策略规则)在未参与拟合或调优的数据上表现的方法。一个实际示例可以清晰地说明其逻辑:你使用历史数据的前一部分构建模型,然后在独立的“保留”部分进行评估。目标是估计模型性能,避免因在相同数据上进行调整而产生的乐观偏差。

一个实际示例应明确说明假设,例如如何划分数据、哪些计算会被重复、以及如何计算性能。还应指出其局限性:即使进行了样本外测试,当市场发生变化、成本和执行不现实,或评估期间的信息泄露到拟合步骤中时,结果仍可能失败。

机制与定义

以下是通用的核心流程:

  1. 选择一个模型类别和拟合方法。这是可以从数据中“学习”的部分。
  2. 将可用数据集划分为两个互不重叠的集合:样本内(训练)期和样本外(测试)期。
  3. 仅在样本内集上进行拟合或调优(包括选择超参数或阈值)。
  4. 冻结模型,并在样本外集上进行一次评估。

此上下文中的重要术语:

  • “样本内”指用于拟合/调优的数据。
  • “样本外”指保留用于评估的数据。
  • “保留”指测试期不用于进一步的调优决策。

为何这有帮助:当你在用于评估的同一数据上进行调优时,可能会无意中捕捉到噪声。样本外测试通过强制在未见过的数据上进行评估,减少了这种特定偏差。

实证或数值示例(含明确假设)

假设你想基于一个特征 X 预测下一日的走势方向(上涨或下跌),X 是从每日在下一日开始前可获得的信息中计算得出的。

示例假设:

  • 你有连续20天的数据。
  • 第1–12天为样本内;第13–20天为样本外。
  • 模型是一个简单规则:若 X > T,则预测“上涨”,否则预测“下跌”。
  • X 值和实际的下一日结果是固定的(无新数据进入)。
  • 在调优期间,你只能使用第1–12天的数据选择 T。
  • 准确率定义为正确预测未来一日方向的天数比例。

步骤 A:在样本内(第1–12天)调优 T
假设当你尝试不同候选阈值时,在第1–12天表现最佳的阈值是 T = 0.50。

  • 使用 T=0.50 在样本内的准确率:12天中正确9天 = 75%。

步骤 B:冻结并在样本外(第13–20天)评估
现在你将冻结的规则(X>0.50 则上涨,否则下跌)应用于第13–20天。
假设该规则产生以下结果:

  • 8天中正确3天。
  • 样本外准确率 = 3/8 = 37.5%。

如何解释此数值结果

  • 样本内得分(75%)表明该规则在训练期内拟合了某种模式。
  • 样本外得分下降至37.5%表明,训练期内看似成立的关系在后续时期未能很好泛化。
  • 这并不证明该规则永远无用;它表明,在给定的划分和假设下,评估期的证据弱于训练期的证据。

局限性与重大失败模式

样本外测试减少了某种偏差,但不能保证未来表现可靠。主要局限包括:

  1. 多重比较与测试集过度使用
    如果你反复根据测试期结果调整 T(或其他选择),测试集就部分变成了样本内数据。这会重新引入乐观偏差。

  2. 数据泄露
    如果拟合过程的任何部分意外使用了预测时不可用的信息(例如使用未来数据推导的输入),即使划分干净,样本外估计也可能无效。

  3. 非平稳性(机制变化)
    金融时间序列可能随时间改变行为。一个时期有效的模型可能在另一时期失效,因为 X 与结果之间的基础关系发生了变化。

  4. 缺乏现实性:成本与执行
    即使方向预测“正确”,实际结果仍取决于交易成本、点差和执行时机。简化的评估指标可能高估实际表现。

  5. 小样本效应
    当样本外数据有限时,估计值可能具有高变异性。低或高数值可能反映随机性,而非真实泛化能力。

外汇和差价合约交易具有重大风险。FoxiForex的信息仅用于教育,不构成个人财务建议。赞助内容会被清楚标注。