评估R平方需要哪些数据?
在收集数据前先定义R平方
R平方(常写作R²)是一个汇总数值,用于比较模型的预测值与实际观测结果的匹配程度。其基本含义是:相对于一个以均值作为预测的基准模型,该模型能解释多少比例的因变量变化。
要评估R平方,首先需要明确所使用的具体定义(例如,是否采用标准方法从总平方和与残差平方和计算得出,是否使用了任何“调整后”的变体)。即使底层数据相似,不同的实现方式也可能报告不同的数值。
所需的数据输入
最低限度,你需要所有能够重现计算中因变量侧的信息。
- 观测到的因变量序列
- 构成y值的时间索引观测值。
- 采样频率(例如,每笔交易、每分钟、每日),包括单位。
- 时间对齐规则(每个y值何时被视为与预测变量“对应”)。
- 预测值或拟合模型
你有两种选择:
- 预测值:模型在同一时间点上生成的预测y-hat值,顺序相同。
- 或者,生成y-hat所需模型输入:预测变量序列(x值)、估计方法以及拟合过程产生的参数。
- 分母中使用的基准
大多数R²公式使用一个反映观测因变量均值周围变异的基准。为了正确评估R²,你必须知道所使用的基准是什么,以及该均值是否在与残差相同的样本划分上计算得出。
来源与预处理检查
R²不仅仅是公式;它还取决于输入序列的内容。
请检查并记录:
- 数据来源:数据来自何处(数据源或来源),以及如何获取。
- 数据过滤规则:是否因错误、节假日、异常值或低流动性而删除了某些观测值。
- 缺失值处理:空缺是被删除、前向填充、插值,还是其他方式处理。
- 变换:是否应用了缩放、对数变换、差分或归一化,以及这些变换在训练和评估期间是否一致。
重大风险:如果x和y的预处理方式不同,或时间戳未对齐,R²可能因与真实解释能力无关的原因而显得偏高或偏低。
时效性与样本划分假设
要评估R²值是否有意义,你需要了解时间是如何使用的。
你应该记录:
- R²是在用于拟合模型的相同数据上计算的,还是在保留数据上计算的。
- 用于拟合与评估的具体时间窗口。
- 是否使用了滚动窗口或扩展窗口方法(方法会影响报告结果的含义)。
一种常见的失败模式是将样本内R²当作描述未来关系的指标。当市场行为发生变化时,历史关系可能不再成立,因此相同方法在后续数据上的R²可能不同。
证据或示例:可独立验证的内容
独立验证清单应包括:
- 确认所使用的y序列(时间戳、单位和过滤)。
- 确认报告值是否使用了y-hat预测值,或是否从存储的模型参数重新计算了预测值。
- 确认确切的R²定义(以及是否使用了调整后R²)。
- 使用提供的数值(y、y-hat、残差)和声明的公式,以及相同的样本划分,重新计算R²。
如果其中任何一项缺失,则无法完全审计报告的R²,因为许多实现细节都会影响结果。
局限性与风险(重大失效模式)
至少需要注意一个局限性:
- 模型依赖性:R²反映的是特定模型形式下的拟合情况。如果关系是非线性的或随时间变化,相同的R²可能具有误导性。
其他重要局限性:
- 非平稳性:如果数据生成过程发生变化,某一时期的高R²可能在后期不再成立。
- 过拟合:如果模型过于灵活,可能会拟合噪声,从而夸大样本内R²。
- 对噪声和罕见事件的敏感性:噪声测量可能导致R²在不同时间窗口间不稳定。
- 误导性比较:如果预处理、特征集或评估划分不同,R²值在不同模型之间可能难以比较。