R²(決定係数)に関する高度な考慮点

高度な内容:仕組み、違い、制限、実務的な確認方法を探る。

R²(決定係数)に関する高度な考慮点

高度なレベルでのR²の意味

R Squared(しばしばR²と表記)は、選択したモデルが観測された値の集合に含まれる変動をどれだけうまく再現できているかを、基準(モデルの説明入力を使わない)に対して比較する要約統計量です。最も単純で(そして最も一般的な)解釈では、R²は次の問いに答えます。
「観測された変動のうち、モデルの説明入力を使わない基準に対して、どれだけがモデルによって説明されているのか?」

この意味自体は安定していますが、多くの実務的な細部はそうではありません。したがって「高度な考慮点」は、公式を暗記することよりも、実際に何を測っているのかを確認することに重点を置きます。つまり、使用している定義、比較に用いる基準、ターゲット変数の作り方、そしてモデルが使ったのと同じデータで評価しているのか(イン・サンプル)、それとも新しいデータで評価しているのか(アウト・オブ・サンプル)です。

簡単に検証できるモデルでのR²の仕組み

標準的な出発点は、切片を含む線形回帰によって、入力XからターゲットYを予測するモデルです。このおなじみの設定では、R²は、残差誤差の分散(または平方和)を、平均まわりの全変動と比較する形で表せます。

検証可能なモデルの見方は次の通りです:

  1. ターゲット系列Y(説明したいもの)を選ぶ。
  2. フィット値Ŷを生成するモデルを選ぶ。
  3. 残差 e = Y − Ŷ を計算する。
  4. 残差の変動性を、Yの平均まわりの基準となる変動性と比較する。

切片を含む回帰のケースでは、R²はしばしば0から1の範囲に制約されます。しかし高度な作業では、この制約が、仮定が変わったとき(たとえば、基準の定義を変えたとき)や、モデルの通常の文脈から外れてR²を計算するときに破綻し得ることを認識する必要があります。

R²を解釈する前に明示すべき依存関係

R²を独立に解釈するには、少なくとも次の依存関係について明確にする必要があります:

  • ターゲット定義: Yとは具体的に何か? 時系列では、Yは水準、差分、リターンのような量、または別の変換である可能性があります。Yを変えると、「説明された変動」の意味が変わります。
  • モデルの形: R²は、入力からŶへの写像に依存します。同じデータを再利用しても、別のモデルは異なるフィット曲線を生み得ます。
  • 基準と中心化: 多くのR²の解釈は、Yの平均を予測する基準と比較することに依存しています。基準が異なれば、意味も変わります。
  • フィッティング手順: R²を報告するのと同じデータを使って、モデルの複雑さを選択しましたか?
  • 評価スキーム: イン・サンプルのR²は学習データへの適合を反映し、アウト・オブ・サンプルのR²は汎化を反映します。

エビデンスと例:なぜ高いR²が誤解を招くのか

ここでは、(いかなる実在の市場についての主張ではなく)よくある高度な落とし穴を示す例のような推論を示します。

短期の変動を追跡できるほど柔軟なモデルをフィットしたとします。もし同じデータでR²を評価するなら、モデルはその期間に特有のパターンを学習することで、変動の大部分を「説明」してしまうかもしれません。

次に、データ生成プロセスが変わった後の期間で同じモデルを評価すると想像してください。残差は増える可能性があるため、R²は低下します。これにより、高度な解釈では次を分ける必要があることが分かります:

  • 過去データへの適合の良さ(イン・サンプルで計算したときにR²が示し得るもの) から
  • 予測的または説明的な安定性(R²が保証しないもの)

別のエッジケース:ターゲットが性格を変える場合

異なる振る舞いのエピソードを持つターゲットYを考えてください(たとえば、ボラティリティのクラスタリング、構造変化、レジーム転換など)。たとえR²が「正しく」計算されていても、この統計量はそれらの期間にまたがる性能を平均化してしまいます。

もし変動の大部分が少数のセグメントから来ているなら、モデルはそれらのセグメントに合わせるだけで「ほとんど」の変動を説明できているように見えるかもしれません。高度な実務では、R²が一貫した説明力を反映しているのではなく、特定の時間窓の一部に引っ張られているのかを確認すべきです。

材料となる制限と失敗モード

高度な考慮点は、明示的な失敗モードなしには不完全です。つまり、R²が計算できるものの、解釈が難しくなる状況です。

1) 非定常またはレジームが変わるデータ

XとYの統計的な関係が時間とともに変化するなら、過去のウィンドウで計算したR²は現在の振る舞いを反映しないかもしれません。これは算術の欠陥ではありません。非定常なプロセスに対して要約統計量をまたいで使うことの限界です。

2) データリークまたは不適切な評価

未来の情報(または予測時点では知っていてはいけないターゲット)からの情報が、特徴量の構築に影響しているなら、結果としてR²は水増しされ得ます。制限は、R²がモデルの本当の説明関係ではなく、データがどのように準備されたかのアーティファクトを測ってしまう点にあります。

実務的な検証ステップは概念的に単純です。すなわち、時刻tでXを計算するのに使ったあらゆる量が、時刻tの時点で利用可能だったはずであることを確認し、評価がフィッティングや選択に使われなかったデータで行われていることを確認します。

3) 過学習と同じデータでのモデル選択

モデルが柔軟で、複数の仕様を試すとき、同じデータから得たR²を報告すると性能を過大評価しがちです。したがって高度な考慮点には、学習とテストのウィンドウを分離するなどの評価規律が含まれます。また、ハイパーパラメータを最適化している可能性があることも考慮に入れます。

4) ターゲットとモデル目的の不一致

R²は、特定のモデル出力の定義のもとでの分散の説明に関するものです。もしモデルが別の目的(たとえば、二乗誤差型の適合ではなく分類の損失)を最適化するように学習されているなら、R²はあなたが重視しているものを反映しないかもしれません。

5) 不適切なスケーリングまたは変換

Yの変換は、「変動」が何を意味するかを変えます。同じ入力とモデルを使っていても、ターゲットの異なる変換に基づいて計算された2つのR²は直接比較できません。

検証:計算したR²を独立に確認する方法

自分のセットアップに対してR²の事実を独立に検証するには、少数のチェックを使えます。

  1. 使用している定義を確認する。 一部のソフトウェアでは、切片を含めるかどうか、または比較の基準がどのように定義されているかによって、R²のバリエーションが公開されています。 2) 保存された中間値から再計算する(フィット値Ŷと残差e)ことで、報告されたR²との整合性を確認する。 3) イン・サンプルとアウト・オブ・サンプルを分離する。 テスト期間がフィッティングや特徴量選択に使われない厳密な評価スキームでR²を計算する。 4) 複数のウィンドウサイズでストレステストする。 結果がウィンドウ長によって大きく変わるなら、その不安定性は重要な制限です。 5) 残差の挙動を概念的に点検する。
外国為替およびCFD取引には大きなリスクがあります。FoxiForexの情報は教育目的であり、個別の金融助言ではありません。スポンサー掲載は明確に表示されます。