アウト・オブ・サンプル・テストのワークド例
直接の答え
アウト・オブ・サンプル・テストとは、意思決定ルール(たとえば予測モデルやストラテジー・ルール)が、適合やチューニングの際に見ていないデータに対してどのように機能するかを確認する方法です。ワークド例にするとロジックが明確になります。まず過去データの前半部分でモデルを作り、次に別の「ホールドアウト」部分で評価します。目的は、同じデータに適応することで生じる楽観的バイアスを避けつつ、パフォーマンスを推定することです。
ワークド例では、分割がどのように行われるか、どの計算が繰り返されるか、パフォーマンスがどのように算出されるかといった前提条件を明示するべきです。また、制限についても触れる必要があります。アウト・オブ・サンプルの結果は、市場が変わるとき、コストや執行が現実的でないとき、あるいは評価期間から適合ステップへ情報がリークするときでも失敗し得ます。
メカニズムと定義
以下は、一般化して述べたコアのワークフローです。
- モデルのファミリーと、適合手順を選びます。ここがデータから「学習」し得る部分です。
- 利用可能なデータセットを、互いに交わらない2つの集合に分割します。イン・サンプル(学習)期間と、アウト・オブ・サンプル(テスト)期間です。
- イン・サンプル集合のみに対して、適合またはチューニングを行います(ハイパーパラメータや閾値の選択を含む)。
- モデルを固定し、アウト・オブ・サンプル集合で1回だけ評価します。
この文脈での重要用語:
- 「イン・サンプル」とは、適合/チューニングに使うデータのことです。
- 「アウト・オブ・サンプル」とは、評価のために確保したデータのことです。
- 「ホールドアウト」とは、テスト期間が追加のチューニング判断を行うために使われないことを意味します。
なぜ役に立つのか:評価するのと同じデータでチューニングすると、ノイズを偶然拾ってしまうことがあります。アウト・オブ・サンプル・テストは、見えないデータでの評価を強制することで、そのバイアスを抑えます。
証拠、またはワークドの数値例(明示的な前提条件つき)
次の日の方向(上 or 下)を、各日の次の日が始まる前に利用可能な情報から計算した1つの特徴量 X に基づいて予測したいとします。
この例の前提条件:
- 連続する20日分のデータがあります。
- 1〜12日目はイン・サンプル、13〜20日目はアウト・オブ・サンプルです。
- モデルは単純なルールです。X > T なら「上」、それ以外なら「下」を予測します。
- Xの値と、実際に観測される次の日の結果は固定です(新しいデータは到着しません)。
- チューニング中は、Tを1〜12日目だけを使って選ぶことができます。
- 精度は、日次の「翌日方向」呼び出しが正しい割合として計算します。
手順A:イン・サンプルで T をチューニング(1〜12日目) 候補となる閾値を試したとき、1〜12日目で最も良い閾値が T = 0.50 だとします。
- T=0.50 を使ったイン・サンプルの精度:12日中9日が正解 = 75%。
手順B:固定してアウト・オブ・サンプルで評価(13〜20日目) 次に、固定したルール(X>0.50 なら上、それ以外なら下)を13〜20日目に適用します。 ルールの結果が次のようになったとします。
- 8日中3日が正解。
- アウト・オブ・サンプルの精度 = 3/8 = 37.5%。
この数値結果の解釈方法
- イン・サンプルのスコア(75%)は、ルールが学習期間の何かに適合していることを示唆します。
- 後半期間に対しては、アウト・オブ・サンプルが 37.5% まで低下しており、見かけ上のイン・サンプルの関係がうまく一般化できていないことを示します。
- これは、そのルールが永遠に役に立たないことを証明するものではありません。提示された分割と前提条件のもとでは、評価期間から得られる証拠のほうが、学習から得られる証拠より弱いことを示している、ということです。
制限と重大な失敗パターン
アウト・オブ・サンプル・テストはバイアスの一形態を減らしますが、将来の信頼できるパフォーマンスを保証するものではありません。主な制限には次が含まれます。
-
多重比較とテストセットの使い過ぎ T(または他の選択)をテスト期間の結果に基づいて繰り返し調整するなら、テストは部分的にイン・サンプルになります。これは楽観的バイアスを再導入します。
-
データリーク 適合プロセスのどこかで、予測時点では利用できない情報が偶然使われてしまう場合(たとえば将来由来の入力を使うなど)、分割がクリーンであってもアウト・オブ・サンプルの推定は無効になり得ます。
-
非定常性(レジームの変化) 金融の時系列は時間とともに振る舞いが変わります。ある期間で機能したモデルでも、Xと結果の間の関係がシフトしているため、別の期間では失敗することがあります。
-
現実性の欠如:コストと執行 方向の予測が「正しい」としても、実際の結果は取引コスト、スプレッド、執行タイミングに依存します。単純化された評価指標は、実務上の結果を過大評価してしまう可能性があります。
-
少数サンプルの影響 アウト・オブ・サンプルのデータが限られていると、推定値のばらつきが大きくなり得ます。低い値や高い値は、真の一般化というより偶然を反映しているだけかもしれません。