線形回帰
線形回帰とは
線形回帰は、1つ以上の入力(多くの場合「特徴量」と呼ばれます)と出力(目的変数)の関係をモデル化するための統計手法です。決定的な考え方は、モデルが出力を入力の線形結合として表現することです。
最も単純なケースとして、入力が1つの x、出力が1つの y の場合、モデルは通常次のように書かれます。
- y ≈ b0 + b1·x
ここで、b0 は切片、b1 は傾きです。「線形(Linear)」とは、方程式に入ってくるパラメータの形(b0、b1 など)のことを指し、現実世界の変数同士の関係の形状そのものを必ずしも意味しません。入力が複数になると、この同じ原理は複数の特徴量へと拡張されます。
FXの研究では、線形回帰は記述的または分析的なツールとして使われることがよくあります。たとえば、説明変数の集合が測定された結果とどのように関連しているかを推定するためです。また、これらの変数に何らかの安定した統計的関係がある場合、その関係を前提にした「期待される変化のモデル」のベースラインを作るためにも使えます。
線形回帰はどのように機能するか
線形回帰には明確なワークフローがあります。変数を選び、パラメータを当てはめ、適合度を評価します。
1) 入力と出力を選ぶ
どの変数を説明したいか(出力)と、どの変数を予測に使うか(入力)を決めます。たとえば、出力は将来のリターン、あるいは別の派生系列になるかもしれません。一方で入力は、過去の値や、市場観測の変換(トランスフォーメーション)である可能性があります。
重要な実務ポイントは、FXデータの処理の選択が効いてくることです。リターンか価格か、入力をどこまで遡るか、そして時間の整合(予測時点では利用できなかった情報を使わないため)をどう合わせるか、という点です。
2) 予測誤差を最小化してパラメータを当てはめる
よくあるアプローチは通常最小二乗法(OLS)です。OLSは、観測された出力とモデル予測の間の二乗誤差の総和が最小になるように、パラメータ(b0 や b1 など)を選びます。
- 各データ点における予測誤差は、観測値から予測値を引いたものです。
- 二乗誤差は、大きなミスをより強く罰します。
その結果、当てはめられた方程式を定義する係数の集合が得られます。
3) 係数は慎重に解釈する
係数は、モデルの前提のもとでの関連(association)として解釈できます。入力が1つの場合、傾き b1 は、モデル構造を固定したまま x が1単位増えたときに、予測される出力が平均してどれだけ変わるかを示します。
入力が複数の場合、係数はそれらの予測変数の間でのモデルの線形な調整を反映します。ただし実際の市場データでは、予測変数同士が相関していることがあり、その場合は個々の係数の解釈が不安定になり得ます。
4) パフォーマンスと汎化を評価する
パラメータ推定に使った同じデータで「良い適合」が得られたとしても、新しいデータで有用であることは保証されません。よくある評価の考え方には次が含まれます。
- 当てはめに使わなかった値(アウト・オブ・サンプル)を、どれだけうまく予測できるかを確認する。
- 目的変数のスケールに適した誤差指標を使う。
市場の関係は変わり得るため、検証戦略が重要です。これがないと、当てはめた方程式が持続的なパターンではなくノイズを反映してしまう可能性があります。
適応的な市場環境における限界とリスク
線形回帰はしばしば単純なものとして提示されますが、金融ではいくつかの制約が頻繁に問題になります。
1) 線形性とモデルのミス指定
線形回帰は、(選んだ特徴量定義の範囲内で)期待される出力が入力に対して線形に変化することを仮定します。真の関係が非線形であるなら、線形モデルは構造を体系的に見落とすかもしれません。
実務上、これは残差パターン(誤差がランダムに散らばらず、一定の形を持つこと)につながり、イン・サンプルでのみ評価すると過度に楽観的な適合になり得ます。
2) 前提とデータ条件への感度
OLSの当てはめは、統計的条件(たとえば安定した分散パターンや、体系的な誤差構造がないこと)に暗黙に依存しています。これらの条件が破られると、係数推定や不確実性が誤解を招くものになり得ます。
市場データでは、ボラティリティが時間とともに変化し得ます。外れ値が発生することもあり、関係がドリフトすることもあります。これらの影響は、あるサンプル期間では「うまく動いている」ように見えても、信頼性を下げる可能性があります。
3) 過学習と見かけの相関
多くの特徴量を使う場合、あるいは特徴量セットを過去の挙動に合わせて繰り返し調整する場合、モデルは一般化しないパターンを捉えてしまうかもしれません。特徴量が少ない場合でも、金融の時系列はノイズが多いため、見かけの相関は起こり得ます。
このリスクを減らすには、規律ある検証が必要です。ホールドアウトテスト、慎重な時間整合、そして将来の情報からのリークを避けることです。
4) 非定常性とレジーム変化
FXの条件は変わります。流動性、ボラティリティ、行動要因は期間によって異なるかもしれません。ある期間で推定した線形関係が、そのまま有効であり続けるとは限りません。
これは線形回帰に固有の欠陥ではなく、非定常なシステムに統計モデルを適用する際の一般的なリスクです。それでも線形回帰は、静かに失敗することがあります。基礎となる関係が弱まっていても、数値としては出力を出し続けてしまう可能性があるのです。
5) 出力を研究に使う—結果の予測ではない
回帰は、選択したモデルのもとでの関連の推定を与えます。将来の市場の動きについての確実性を、本質的に定義するわけではありません。
回帰出力を保証されたもの、あるいは決定論的なものとして扱うと、誤差項に反映されている不確実性や、データ生成プロセスの不安定さを無視してしまいます。
線形回帰が自分の用途に妥当かを確認する方法
実務的な検証の考え方は、その回帰が役に立つ何かを説明しているかどうかを判断するのに役立ちます。
まず、残差(観測値と予測値の差)が、一定の構造を含むのではなくノイズのように振る舞っているかを確認します。次に、当てはめに使わなかったデータで性能をテストし、理想的には時間の順序を尊重します。
第三に、頑健性チェックを行います。特徴量定義を妥当な範囲で変えてみて、結果が単一の前処理の選択に依存していないことを確認し、異なる時間窓にわたって安定性を探します。
最後に前提を文書化します。目的変数は何か、予測変数はどのように構築されるのか、そして検証はどう行うのか。これにより、同じセットアップにおけるモデル挙動に関する主張を、独立に検証できるようになります。
関連の深い線形の考え方との比較
線形回帰は、入力と出力の間に線形関係を作る他の線形モデルとも密接に関連しています。たとえば、正則化を含む線形モデルでも線形のパラメータ構造に依存しますが、複雑さを制御するために当てはめの目的関数を変更します。
このような変種があっても、根本的な問いは同じままです。
- 選んだ表現は、その関係に適切か?
- モデルは新しいデータに汎化するか?
- 結果は、時間や前処理の選択に対して安定しているか?
FXの研究の用語で言えば、その手法の「出力」は常にモデリングのセットアップに条件付けられており、不確実性は避けられません。
独立に評価できる限界
通常、ベンダーの主張や特定のブローカーの挙動に頼らずに、次のことは評価できます。
- 回帰が、単純なベースラインに比べて誤差を減らしているかどうか。
- アウト・オブ・サンプルの性能が、偶然レベルの期待よりも意味のある形で良いかどうか。
- その関係が複数の時間期間にわたって成り立つかどうか。