線形回帰のワーク例とは?
定義:線形回帰とは
線形回帰は、1つの独立変数 (x) と従属変数 (y) の間の関係を、直線の方程式を使用してモデル化する統計的方法です:
[ \hat{y} = a + b x ]
- (\hat{y}) は (y) の予測値です。
- (a) は切片です。
- (b) は傾きです。
主要なアイデアは、フィットした直線が、予測誤差をできるだけ小さくするように選択されることです。具体的には、訓練データにおける残差の二乗和 (\sum (y-\hat{y})^2) を最小化します。残差は、観測された (y) 値と予測された (\hat{y}) 値の差です。
メカニズム:ワーク例が実際に計算するもの
「ワーク例」とは、小さなデータセットを選び、すべての仮定((x) と (y) の定義方法を含む)を明示し、(a) と (b) を計算し、フィットした直線を使用してフィット値と少なくとも1つの新しい予測を生成することを意味します。
以下のワーク数値計算の仮定:
- 組み合わせた観測値 ((x_i, y_i)) があります。
- モデル形式はデータウィンドウに正しい:(x) と (y) の間の線形関係です。
- 係数は最小二乗法(OLS)で計算されます:残差の二乗を最小化します。
- 入力 (x) 値は与えられたものとして扱います((x) に対する追加の不確実性モデルはありません)。
- 例は純粋に説明的なものであり、リアルタイムの市場データを使用しません。
証拠:完全な数値ワーク例
4つの点を観測したと仮定します:
- (x: 1, 2, 3, 4)
- (y: 2, 3, 5, 4)
ステップ1:平均を計算します。 [ \bar{x} = (1+2+3+4)/4 = 2.5 ] [ \bar{y} = (2+3+5+4)/4 = 3.5 ]
ステップ2:傾き (b) を計算します。 [ b = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sum (x_i-\bar{x})^2} ] 表の値を計算します:
- (x=1) の場合:(x-\bar{x}=-1.5)、(y-\bar{y}=-1.5)、積 = 2.25
- (x=2) の場合:(x-\bar{x}=-0.5)、(y-\bar{y}=-0.5)、積 = 0.25
- (x=3) の場合:(x-\bar{x}=0.5)、(y-\bar{y}=1.5)、積 = 0.75
- (x=4) の場合:(x-\bar{x}=1.5)、(y-\bar{y}=0.5)、積 = 0.75
積の合計 = (2.25+0.25+0.75+0.75 = 4.0)。
分母 (\sum (x_i-\bar{x})^2):
- ((-1.5)^2=2.25)、((-0.5)^2=0.25)、((0.5)^2=0.25)、((1.5)^2=2.25)
合計 = (2.25+0.25+0.25+2.25 = 5.0)。
したがって: [ b = 4.0/5.0 = 0.8 ]
ステップ3:切片 (a) を計算します。 [ a = \bar{y} - b\bar{x} = 3.5 - 0.8\cdot 2.5 = 3.5 - 2.0 = 1.5 ]
ステップ4:フィットした直線を記述します。 [ \hat{y} = 1.5 + 0.8x ]
ステップ5:観測された (x) に対するフィット値を計算します。
- (x=1) の場合、(\hat{y}=2.3)
- (x=2) の場合、(\hat{y}=3.1)
- (x=3) の場合、(\hat{y}=3.9)
- (x=4) の場合、(\hat{y}=4.7)
ステップ6(1つの簡単な予測):新しい (x=5) の場合、 [ \hat{y}=1.5+0.8\cdot 5=5.5 ]
上記のすべての数値は、合計とOLSの式を再計算することで独立して確認できます。
制限とリスク:線形回帰が失敗する原因
線形回帰は正確な予測の保証ではありません。重要な制限には以下が含まれます:
- 線形性の仮定が間違っている可能性があります。(x) と (y) の間の真の関係が曲がっている場合、直線はパターンを系統的に逃すことがあります。
- 外れ値に敏感です。極端な (y)(または平均から遠い影響力のある (x))が1つでもあれば、傾きと切片を引っ張ることがあります。
- 歴史的な関係が維持されない可能性があります。フィットした直線が訓練データに合致しても、将来は異なる行動をとる可能性があります。データ生成プロセスが変化する可能性があるためです。
- 省略された変数。(y) が (x) で表現されていない他の要因に依存している場合、誤差はランダムではなく構造化される可能性があります。
- ノイズデータとモデルエラー。二乗残差を最小化することは、フィットの概念を改善しますが、異なる条件下での良好なパフォーマンスを保証するものではありません。
これらの問題は統計モデリングの一般的なものです。結果はデータの特性とデータの収集および処理方法によって異なります。