样本外测试的局限性
直接回答
样本外测试旨在评估模型或规则在拟合过程中未见过的数据上的表现。其主要局限在于,“未见过”的历史数据仍然不同于未来的实盘环境。即使样本外测试结果看起来很强劲,由于市场行为变化、假设不完善(尤其是关于成本和执行的假设),以及数据划分和评估方式的选择,仍可能出现错误。
机制与定义
典型的流程是:(1)使用训练期拟合模型或决策规则;(2)在模型未用于参数选择的样本外时间段上进行测试;(3)比较平均收益、回撤或类似准确率的指标(用于分类)。目标是检测过拟合:即规则倾向于匹配训练集中的噪声。
样本外测试减少了某一特定风险——即重复使用相同数据进行调参和评估。但它无法消除其他不确定性来源。该测试仍依赖于对当时可用信息、交易如何执行,以及过去统计关系是否将持续存在的假设。
为了使任何计算具有可解释性,必须明确说明假设。例如:明确定义训练与测试的具体时间窗口、是否存在重叠窗口、如何处理缺失数据,以及建模了哪些成本和执行滑点(或忽略哪些)。没有这些细节,两个人可能使用相同的术语描述不同的实验。
证据或示例(失败模式)
考虑一个在单一样本外区间测试时看似稳定的规则。仍可能发生以下几种实质性失败模式:
-
数据偏移(制度变化): 如果在样本外测试期后波动率、流动性、点差或典型价格动态发生变化,模型可能错误外推。历史“未见”数据并不能保证覆盖未来市场状态。
-
隐藏的选择效应: 即使有清晰的训练/测试划分,若尝试多种变体后仅保留样本外表现最佳的配置,仍可能无意中选择“看起来最好”的结果。由于评估已成为选择过程的一部分,结果可能过于乐观。
-
评估指标不匹配: 模型可能在某个指标上得分良好,但该指标未反映真实约束。例如,某策略可能显示可接受的平均表现,但仍依赖难以可靠执行的罕见事件。
-
成本与执行不确定性: 回测常使用简化假设。当引入真实点差、佣金、资金/隔夜费用、延迟、订单成交行为或保守风险管理时,实际结果可能不同。样本外测试可能在其自身假设下内部一致,但仍无法准确反映实盘条件。
-
样本量限制: 若样本外时间段较短,性能估计的方差会很高。看似可靠的结果可能是偶然事件。
局限性与风险
这些局限性可总结为一系列“未控制因素”问题:
- 历史关系可能不会持续。 样本外测试衡量的是对过去模式的依赖,而非未来必然性。
- 假设本身可变。 成本、执行和操作细节通常是回测与现实之间最大的差异来源。
- 即使没有过拟合,不确定性仍存在。 消除训练集过拟合并不能保证在分布偏移下仍能泛化。
- 结果可能脆弱。 表现可能取决于确切的数据划分方式、预处理步骤和交易模拟方法。
由于这些问题,样本外测试更适合作为稳健性检查,而非证明。它在特定条件下提供证据,而非确定性结论。
验证或下一步问题
要独立验证关于样本外测试的主张,应关注可复现性而非说服力。应要求提供:(1)训练期和样本外时间段的精确定义;(2)预处理步骤和数据清洗规则;(3)测试中使用的成本/执行假设;(4)在选定报告配置前尝试了多少种配置或超参数;(5)结果在多个非重叠划分中是否一致。
一个有用的后续问题是:结果对划分方式、时间窗口长度以及执行/成本模型的敏感度如何? 如果微小变化显著改变结论,则表明该样本外测试反映的是脆弱性而非稳健性。