R Squaredは何と組み合わせられる?
直接の答え
R Squaredは、他の診断ツール(適合の質、残差の挙動、頑健性)と組み合わせることができます。これは、R Squaredをより大きな評価の一部として扱う限り有効です。通常、単独のシグナルとして使うよりも、「その関係が安定しているか」「予測誤差が妥当な挙動をしているか」を確認する指標と組み合わせると、最も有益になります。
同じ基となるデータや関連する変換が複数の統計量を生み出し得るため、相関のある入力とともにR Squaredを組み合わせると、「一致しているように見える錯覚(illusion of agreement)」が生じることがあります。つまり、複数の数値が支持的に見えるのは、同じ共有構造、または同じ市場レジームを反映しているだけかもしれません。
仕組みまたは定義
R Squared(R²)は、回帰でよく使われる適合度(goodness-of-fit)の統計量です。平たく言えば、従属変数のばらつきのうち、当てはめたモデルが説明できている割合を表します。これは、従属変数の平均を使うベースラインと比べた相対的な値です。一般に値が高いほど、当てはめた関係が(そのモデルを当てはめるのに使った)特定のデータセットにより密接に追随していることを意味します。
「R Squaredは何と組み合わせられる?」と聞かれるとき、人々は通常、次のように組み合わせます:
- モデル診断:残差の確認(観測値と当てはめた値の間に残る差分)。
- バリデーション指標:当てはめの際に使わなかったデータから計算される指標(たとえば、アウト・オブ・サンプルの誤差)。
- 安定性テスト:時間窓や異なるサンプル期間をまたいで、その関係が成り立つかどうかを見る方法。
- 特徴量/指標の選択基準:どの入力をモデルに含めるかを決める手順。
これらの組み合わせが役立つのは、R²が主に説明された分散(explained variance)を語る一方で、他のツールはどのように適合が失敗するのか、そしていつ信頼できなくなるのかに対処できるからです。
証拠または例
明確な前提がある、簡略化した例を考えてみましょう。ターゲット系列(Y)と1つの予測変数系列(X)の間に、過去データを使って線形関係を当てはめ、その同じ履歴データ上でR²を計算します。
さらに、アウト・オブ・サンプル誤差(たとえば、当てはめに使わなかった後の期間に対する平均二乗誤差)も計算するなら、実質的に2つの異なる問いを組み合わせていることになります:
- R²はこう問いかけます:「当てはめた関係は、当てはめに使ったデータにどれだけ合っていたか?」
- アウト・オブ・サンプル誤差はこう問いかけます:「新しいデータに対して、どれほど間違っていたか?」
よくある失敗パターンは、R²がインサンプルでは高いのに、アウト・オブ・サンプル誤差が悪いケースです。これは、関係がノイズを捉えてしまっている、レジームが変わる、あるいはパラメータ選択に敏感であるといった理由で起こり得ます。その場合、R²と残差チェック、そしてバリデーションを組み合わせることで、より包括的な全体像が得られます。
制限とリスク
主な制限とリスクには次が含まれます:
- 入力間の相関:R²を、強く関連した入力から導かれる指標(たとえば、一緒に動くインジケータ)と組み合わせる場合、複数の指標が同じ共有された挙動を確認してしまうことがあります。これにより、特定の弱点を見つける能力が下がります。
- インサンプルの楽観性:当てはめに使った同じデータで計算したR²は、過大評価され得ます。過去の関係は将来の結果を保証しません。
- レジーム依存:市場環境、ボラティリティのパターン、ミクロ構造の影響が変わると、関係は変化し得ます。ある期間にはうまく当てはまっても、別の期間ではうまくいかないことがあります。
- コストと実行の不確実性:統計的な適合が許容できるとしても、実世界の摩擦(スプレッド、コミッション、約定タイミング)が結果を変える可能性があります。これは、モデルの目的が説明ではなく意思決定である場合に重要になります。
実務上の管理ポイントは、前提条件を明確に述べること(どのデータ範囲を使うか、データをどれか保持しているか、どの変換ステップを適用するか)そして、一定の評価ルールのもとで結果を検証することです。
検証または次の質問
有用性に関する主張を独立に検証するには、次のように結論が成り立つか確認できます:
- 別の時間窓で統計量を再計算する、
- 当てはめに使わなかったバリデーション期間を使う、
- 説明された分散だけに頼らず、残差の挙動を確認する。
よければ、あなたの文脈でいう「組み合わせ」が何を意味するのか(特徴量選択、モデル検証、インジケータの積み上げ)を教えてください。そうすれば、相関のある入力による重複した情報を避けつつ、R²を補完する診断の種類を整理するのに役立てます。