R Squaredはどのような市場環境で挙動が異なるのか?
定義と「異なる挙動」とは何を意味するのか
R Squared(R²)は、従属変数の変動のうち、モデルにおける独立変数(群)によってどれだけ説明できるかを示す統計的指標です。平たく言うと、モデルを当てはめるのに使ったのと同じデータを用いて、モデルの過去の予測が歴史的な結果にどれだけ密接に一致しているかを表します。これは本質的に、将来のトレーディング成績や、特定の値動きが起こる可能性を示すものではありません。
そのため、人々が「R Squaredは特定の市場環境下で“異なる挙動をする”」と言うとき、通常は次のことを意味します。入力と結果の間の関係が変わるため、また、モデルの背後にあるデータの質や前提が変わるために、計算されたR²の値が変化する、ということです。
メカニズム:なぜ市場環境がR²を変え得るのか
R²は大きく3つの要素に依存します。(1)変数間の関係の強さ、(2)ノイズの水準、(3)その関係がサンプル内でどれだけ安定しているかです。
-
関係の強さ(シグナル対ランダム性) あなたがモデル化する変数間で、より強く、より再現性のある関係が市場環境によって生み出されるなら、当てはめた曲線は歴史的な結果により密接に追随しやすくなり、R²は上がる傾向があります。関係が弱まったり、一貫性を欠いたりすると、R²は下がり得ます。
-
ノイズと構造的ブレイク 高いボラティリティ、突然のレジーム転換、そしてミクロ構造の変化は、ノイズを増やし得ます。ノイズがデータを支配する場合、たとえ妥当なモデルであっても、当てはまりが弱くなり、R²が低下します。
-
サンプル構成とスケーリング R²は、特定のサンプルウィンドウと変数の選択から計算されます。時間軸を変えること、使う過去データ量を変えること、あるいは変換(たとえば、リターンを使うのか生の価格を使うのか)を変えることで、どれだけの分散が捉えられるかが変わり得ます。
例によるエビデンス(明示的な前提つき)
単純なモデリング設定を考えます。つまり、固定のローリングウィンドウ長を使って、選んだ入力系列と出力系列の間で回帰を当てはめるとします。そして、比較可能なサンプルサイズで2つのレジームを評価すると仮定します。
- レジームA:より滑らかな動きで、入力と出力の関係がより一貫している。モデル誤差が多くの観測で小さいなら、説明できる分散が増え、R²は高くなりやすい。
- レジームB:振る舞いの切り替えが頻繁(たとえば、トレンド局面と平均回帰局面を交互にとる)。入力と出力の関係が時間とともに変わるなら、同じモデル形式でもウィンドウの一部には合うが他の部分には合わず、残差が増え、結果としてR²が低下しやすくなる。
これは、どのレジームでも「常に」R²が高くなる/低くなるという証明ではありません。示しているのはメカニズムだけです。R²は安定性とノイズに敏感だ、ということです。
制限と失敗パターン
重要な制限は「市場環境」と切り分けて考える価値があります。
- サンプルへの過剰適合:関係が一時的であっても、モデルは過去データにうまく当てはまることがあります。高いインサンプルR²は、アウト・オブ・サンプルの挙動について誤解を招き得ます。
- レジーム依存:R²を計算した後に、市場レジームが変わることがあります。過去の関係は将来の結果を保証しません。
- 変数の不一致:独立変数と従属変数が時間的に整合していない場合(たとえば、出力ウィンドウに対応しない入力を使うなど)、計算されたR²は大きく変わり得ます。
- コストと執行の影響:価格系列で計算されたR²は、取引コスト、スリッページ、執行制約を無視します。統計的に当てはまりが強く見えても、現実の結果は乖離し得ます。
- 非線形性とモデル形式:R²は選んだモデル構造に結びついています。真の関係が非線形であったり、形式が変わったりするなら、R²は有用性を過小評価したり、変動したりする可能性があります。
検証:前提を独立に確認する方法
「R²がいつ変わるのか」を確かめるには、次のように変化を見てください。(1)異なるサンプルウィンドウ、(2)異なる時間軸、(3)異なるモデル仕様です。R²が主に、データがよりノイジーになるからなのか、関係がより不安定になるからなのか、あるいは変換の選択によって分散が変わるからなのかを記録します。
次に考えるべき質問はこうです。同じ種類の系列(たとえば、リターンと価格のどちらか)に対して、整合(アラインメント)とサンプル長を一貫させてR²を計算していますか?そうでない場合、「異なる挙動」は市場そのものからではなく、計算セットアップから生じている可能性があります。
DOCUMENT END