過度の自信に関する情報はどのように検証できますか?
直接の回答
過度の自信に関する情報は、(1) 一貫した定義を用いること、(2) 人々が後にどのような結果に結びつくかを見て、表明した自信が実際の成り行きと一致しているかをテストすること、(3) 前提と限界を文書化することによって検証できます。このアプローチでは、意見、逸話、ある一度きりの結果を証拠として扱わないようにします。
仕組みと定義
過度の自信とは、一般に「人がどれほど自信を感じているか」と「その人の判断や予測が実際にどれほど正確か」の間に不一致があることを指します。検証は、まず適用範囲を正確に定めることから始めます。つまり、一般的な態度なのか、予測の精度なのか、それとも意思決定行動なのかを評価しているのかを明確にします。
この考え方を実務に落とし込む実用的な方法は、主張を「安定部分」と「変動部分」に分けることです。
- 安定した仕組み:人々が、現実の不確実性に対して、自分の知識、スキル、またはシグナルを過大評価してしまう可能性があるという概念。
- 変動する条件:結果は、コスト、執行の質、タイミング、そして地域ごとのルールに依存し、状況によって変わり得ます。
過度の自信に関するいかなる主張を検証する場合でも、「何が測定されるのか」(自信の度合い、確率の推定、または主観的な確実性)と、「何が予測されるのか」(方向、範囲、または二値の出来事)を明示してください。また、後からの結果による後知恵バイアスを防ぐために、結果が分かる前に自信がどのように記録されるかも定義します。
エビデンスと再現可能な検証手順
リアルタイムの市場データは想定しないため、検証は、記録された判断を用いた一般的で再現可能な方法で行えます。
1) 事前に定義した定義とスコアリングルールを使う
シンプルなテンプレートを作成します。
- 意思決定:あなたが判断する出来事(明確に説明する)。
- 自信:数値の確率(または、順位付けされた自信スケールを確率帯に変換したもの)。
- 時間枠:結果が観測される時期。
- 結果:後で記録される結果。
検証手順:あなたのスコアリングルールに従って、「自信が高いほど精度が高いか」を計算します。
2) キャリブレーション(calibration)チェックを実施する
キャリブレーションテストは、表明された確率が観測された頻度と一致しているかを確認します。例としての前提:多くの試行にわたって「ある出来事は70%の確率で起こる」と言うなら、それは(自然な変動の範囲内で)約70%の確率で起こるはずです。検証手順:判断をビン(例:0–10%、10–20%、…)に分け、予測された頻度と観測された頻度を比較します。
材料上の制約:キャリブレーションには十分な観測数が必要です。サンプル数が小さいと、ランダムな変動が「証明」や「失敗」のように見えてしまうことがあります。
3) 事前コミットメントを使った「解像度(resolution)」チェックを追加する
解像度は、自信が「起こりやすい結果」と「起こりにくい結果」を意味のある形で区別できているかを測ります。検証手順:結果が出る前に、自信の高い順に判断を順位付けします。その後、結果を見て、最も自信が高いグループが最も自信が低いグループよりも正確かどうかをテストします。
失敗パターン:結果を見た後にだけケースを分析してしまうと、その結論は過度の自信ではなく、選択効果を反映している可能性があります。
限界とリスク
少なくとも1つの大きな限界は、過度の自信が単一の数値として直接観測できないことです。測定された自信と、その後の結果から推測する必要があります。
その他のリスク:
- 結果は市場の状況、コスト、執行、そして管轄(jurisdiction)によって変わるため、1つの文脈からすべての文脈へ一般化できません。
- 過去の関係は将来の結果を確立しません。
- 新しい情報、スキルの変化、課題の難易度の変化によって、自信は変わり得ます。
よくある失敗パターンは、「間違っていること」と「過度に自信があること」を混同することです。データの見落としなど、さまざまな理由で間違うことはあり得ますが、それでも適切にキャリブレーションされている可能性があります。
検証するか、次の質問
研究や評価のために過度の自信に関する情報を検証したいなら、プロセスを再現可能に保ってください。
- 主張を正確に定義する(どのタイプの過度の自信か、どの測定か)。
- 結果が出る前に自信を記録する。
- 文書化された前提を用いて、キャリブレーションと解像度(resolution)スタイルのチェックを行う。
- 不確実性とサンプルの限界を報告する。
次に考えるべき質問:あなたが判断している出来事における「真の基準(ground truth)」とは具体的に何で、それを意味のあるキャリブレーションにするだけの記録済みの試行数は十分にありますか?