「予測モデルは人より正しい」——実は平均では正しい。だが避けすぎ・頼りすぎ・劣化で、正しさは条件づきになる
予測モデルは人より正しい——この言い方には、頭から否定できない芯がある。半世紀以上の研究が、単純な統計的予測が専門家の勘に平均して優ると、くり返し確かめてきた。だからこの単位は、まずその不都合な事実を認める。そのうえで値切るのは正しさでなく使い方の側だ。人はモデルを避けすぎも頼りすぎもし、モデル自体も時とともに劣化する。任せるか否かの二択でなく、条件の設計を渡す。
前の単位から、この単位へ
前の単位では、分析を意思決定につなぐことを扱った。ここでは、過去のデータから未来を当てる予測モデルと、人の判断を、どう使い分けるかを扱う。予測モデルとは、過去の数字から規則を作り、次に何が起きそうかを見積もる仕組みのこと——来月の需要予測も、前年同月からの当て推量も、直近の平均で置く目安も、みなその仲間で、大げさな機械でなくてよく、紙の上の計算でも立派な予測モデルだ。
この単位は、少し身構えて読んでほしい。ここまでの棚は「俗説を値切る」流れだったが、今回はその俗説の半分が、実は正しいからだ。「予測モデルは人より正しい」——この言い方には、頭から否定できない芯がある。半世紀以上にわたる研究が、単純な統計的予測が、専門家の勘(臨床的判断)に、平均して優ることを、くり返し確かめてきた。Dawes と Faust と Meehl が1989年に、多くの分野の予測を見渡し、決まった規則で数字を組み合わせる保険数理的なやり方が、人の総合判断に勝ることが多い、と報告した(この主張の源流は、Meehl が1954年に書いた古典にさかのぼる)。だから、この単位は「モデルを信じるな」とは言わない。認めたくないかもしれないが、経験と勘の積み重ねより、素っ気ない計算式のほうが当たることがある——まず、その不都合な事実を認める。 そのうえで、値切るのは「正しさ」ではなく、その「使い方」の側だ。
「予測モデルは人より正しい」——実は、平均では正しい
芯の部分を、もう少し丁寧に見る。この分野は、一本の研究の勢いではなく、メタ分析——たくさんの研究の結果を束ねて全体の傾向を見る方法——で積み上がってきた。Kuncel たちが2013年に、採用や入学選抜の予測を対象に、機械的にデータを組み合わせるやり方と、人が総合的に判断するやり方を、多数の研究を束ねて比べた。結果は、機械的な組み合わせのほうが、平均して当たった。Ægisdóttir たちも2006年に、半世紀分の研究を束ねる大がかりなメタ分析で、同じ向きの結論を得ている。
大事なのは、これが「賢い人工知能が天才を負かした」という話ではない、という点だ。勝ったのは、しばしばごく単純な規則——いくつかの数字を決まった重みで足すだけのようなもの——である。ここが直感に反するところで、複雑で高性能な仕組みが勝ったのではなく、単純で機械的な手続きが勝った。理由はむしろ、単純さの側にある。人は、その場の印象や、直近の出来事や、目立つ例外に引きずられ、同じ材料を見ても判断がぶれる。今日と明日で、同じ状況に違う答えを出すことさえある。単純な規則は、ぶれない。いつ計算しても同じ材料からは同じ答えが出る。この安定が、平均では効くのだ。名人の当たりの高さより、素人でも規則の外さなさが、ならすと勝つ。
だから、自分が勘でやっている見積もりがあるなら、まず過去平均や単純な目安と突き合わせてみる価値がある。案外、素朴な規則のほうが当たる。ここは、素直に受け取ってよい。ただし——これは選抜や診断のような特定の予測課題で積み上がった知見であって、どんな予測にもそのまま当てはまるわけではない。とりわけ、人の心や健康の予測に、この話を安直に持ち込んではいけない。ここで確かめられたのは「単純な規則を、勘の相棒として一度試す価値がある」という穏当な含みであって、「人はいらない」ではない。
だが、導入は一筋縄ではいかない
では、モデルが平均で優るなら、任せればいいだけか。ここからが、この単位の本題だ。正しさと、人がそれを使えるかは、別の問題である。Dietvorst たちが2015年に、興味深いことを示した。人は、モデルが一度でも間違うのを見ると、そのモデルを過度に避けるようになる。たとえ全体では人より当たっているモデルでも、目の前で一つ外すと、「やっぱり当てにならない」と切り捨ててしまう。人の失敗には寛容なのに、機械の失敗には厳しい。これをアルゴリズム回避と呼ぶ。
ところが、逆向きの現象もある。Logg たちが2019年に、状況によっては人がアルゴリズムの判断を、人の判断より好んで受け入れることを示した。これをアルゴリズム選好と呼ぶ。つまり人は、文脈しだいで、モデルを過度に避けもすれば、過度に頼りもする。同じ人が、ある場面では機械を信じず、別の場面では機械に丸投げする。厄介なのは、この振れが、モデルの実際の当たり具合とは無関係に起きることだ。受け止めは、精度ではなく、そのときの気分や場面に左右される。どちらも、正しい使い方ではない。 モデルの導入でつまずくのは、たいてい精度そのものより、この「人の側の受け止め方」だ。避けすぎれば、優れた道具を捨てる。頼りすぎれば、モデルが外す場面で一緒に転ぶ。だから、避けるか頼るかを気分に任せず、どの場面でモデルを信じ、どの場面で人が見直すかを、あらかじめ決めておくほうがいい。
モデルは、時とともに劣化する(ドリフト)
もう一つ、技術的な事実を押さえておく。予測モデルは、作った瞬間がいちばん当たり、あとは環境の変化とともに、じわじわ精度が落ちていくことがある。 過去のデータで作った規則は、その過去の世界を前提にしている。客層が変わり、季節がずれ、流行が動けば、前提はほころぶ。これをドリフト(少しずつずれること)という。だから、一度当たったモデルを、そのまま何年も使い続けるのは危うい。モデルは、作って終わりの道具ではなく、時々当たり具合を見て、必要なら作り直す、手入れの要る道具である。
この事実は、特定のやり方の優劣を言うものではない。単純な過去平均でも、凝った予測でも、環境が変われば外れうる、という共通の注意だ。だから「一度作った予測がずっと当たる」という期待は、持たないほうがいい。当たり続けているように見えても、それは環境がたまたま安定していただけかもしれない。むしろ、長く当たっているモデルほど、みなが安心して見直さなくなり、ずれ始めても気づくのが遅れる。だから、たまに実際の結果と突き合わせて、当たり具合そのものを点検する習慣が要る。予測を出すことと、その予測がまだ当たっているかを確かめることは、別の作業なのだ。
だから、「条件付きの正しさ」に直す
ここまでを一つにまとめる。「予測モデルは人より正しい」は、単純な否定も、単純な肯定も、どちらも間違いだ。正しく言い直すと、こうなる——平均では、単純なモデルでも人の勘に優ることが多い。だが、人はそれを避けすぎたり頼りすぎたりし、モデル自体も時とともに劣化する。だから正しさは、モデルの作り・使い手の受け止め・環境の安定に、条件づけられている。 任せるか任せないかの二択ではない。どの見積もりを、どこまでモデルに委ね、どこで人が目を通し、いつ当たり具合を見直すか——その設計こそが、予測を業務に使うということだ。全部を任せるのでも、全部を勘でやるのでもなく、場面ごとに配分を決める。安定した数字は規則に多く任せ、変動が大きく人の目が要る場面は人が持つ。その線引きは、一度決めて終わりではなく、当たり具合を見ながら引き直していく。
時間・変化:1954年から今へ
順に置く。1954年、Meehl が臨床的判断と統計的予測を比べる古典を著し、統計側が侮れないことを示す。1989年、Dawes と Faust と Meehl が、多くの分野で保険数理的な予測が人の判断に優ると報告する。2006年、Ægisdóttir たちが半世紀分を束ねるメタ分析で同じ向きを確かめ、2013年、Kuncel たちが選抜・入学の予測で機械的な組み合わせの優位をメタ分析で示す。2015年、Dietvorst たちが人はモデルの誤りを見ると過度に避けると示し、2019年、Logg たちが逆に過度に頼る場面もあると示す。
この間に確からしくなったのは、「モデルは万能」でも「勘のほうが確か」でもない。確からしくなったのは、平均ではモデルが優るが、その優位は、人の受け止めと環境の安定に条件づけられている——という、より込み入った事実である。正しさは、無条件ではないのだ。
妨げるもの、助けるもの、最初の一歩
妨げるものは、両側にある。一方は、モデルが一度外すのを見て丸ごと見捨てること。もう一方は、モデルが優ると聞いて中身も環境も見ずに丸投げすること。どちらも、条件を見ていない点で同じ過ちだ。優れているのは平均であって、あなたの次の一件ではない——この当たり前を、忘れやすい。平均で勝つ道具も、目の前の一件では外すことがあるし、その一件がたまたま大事な一件かもしれない。だから任せた後も、肝心なところでは人が目を通す。
助けになるのは、勘とモデルを、こっそり競わせてみることだ。最初の一歩は10分。自分が今、勘で見積もっている数字を一つ選ぶ——来月の来客数でも、仕入れの量でもよい。それを、単純な規則(たとえば直近3か月の平均や、前年同月の値)でも見積もり、両方を書き留めておく。そして実際の結果が出たら、どちらがどれだけ当たったかを記録する。一度だけでは分からないから、しばらく続ける。勘が勝つのか、素朴な規則が勝つのか。自分の予測を、自分のデータで、検算する。 それが、予測モデルを業務に使う第一歩になる。信じるでも疑うでもなく、まず自分の手元で一度、確かめてみる——ただ、それだけのことだ。
次の単位は 540「AIに仕事を任せるには?」——決まった予測から一歩進んで、文章も判断もこなす生成AIに、どこまで・どう任せるかへ進む。
- この単位は逆張り注意——ここまでの棚は俗説を値切る流れだが、今回は俗説の半分が実は正しい。予測モデルは過去の数字から規則を作り次に何が起きそうかを見積もる仕組みで、来月の需要予測も単純な過去平均もその仲間。値切るのは正しさでなく使い方の側で、まず平均ではモデルが優る不都合な事実を認めたうえで導入の壁・劣化・条件依存を扱う
- 統計的予測は人の勘に平均して優る。Dawes・Faust・Meehl 1989は多くの分野で決まった規則で数字を組み合わせる保険数理的なやり方が人の総合判断に勝ることが多いと報告し、源流はMeehl 1954の古典。Kuncel ら 2013は採用・入学選抜でメタ分析により機械的組み合わせの優位を示し、Ægisdóttir ら 2006は半世紀分を束ねて同じ向きを確かめた。勝つのはしばしばごく単純な規則で、人は印象や例外に引きずられぶれるが規則はぶれない
- ただしこれは選抜や診断など特定の予測課題の知見で、どんな予測にもそのまま当てはまるわけではなく、とりわけ人の心や健康の予測に安直に持ち込んではいけない。自分が勘でやる見積もりがあるならまず過去平均や単純な目安と突き合わせる価値があり、案外素朴な規則のほうが当たる。ここは素直に受け取ってよい
- 正しさと人がそれを使えるかは別の問題。Dietvorst ら 2015は人がモデルの誤りを一度見ると全体では人より当たるモデルでも過度に避けるようになる(アルゴリズム回避)ことを示し、人の失敗には寛容なのに機械の失敗には厳しい。Logg ら 2019は逆に状況次第で人がアルゴリズムの判断を人より好んで受け入れる(アルゴリズム選好)ことを示した。避けすぎも頼りすぎもどちらも正しくない
- 予測モデルは作った瞬間がいちばん当たり環境の変化とともにじわじわ精度が落ちることがある(ドリフト)。過去のデータで作った規則は過去の世界を前提にし、客層が変わり季節がずれ流行が動けば前提はほころぶ。単純な過去平均でも凝った予測でも環境が変われば外れうる。一度作った予測がずっと当たるという期待は持たず、時々当たり具合を見て必要なら作り直す手入れの要る道具である
- 予測モデルは人より正しいは単純な否定も単純な肯定もどちらも間違い。平均では単純なモデルでも人の勘に優ることが多いが人はそれを避けすぎたり頼りすぎたりしモデル自体も時とともに劣化する。だから正しさはモデルの作り・使い手の受け止め・環境の安定に条件づけられ、任せるか否かの二択でなく、どの見積もりをどこまで委ねどこで人が目を通しいつ見直すかの設計が予測を業務に使うこと
- 妨げは両側にあり、モデルが一度外すのを見て丸ごと見捨てることと、優ると聞いて中身も環境も見ずに丸投げすることはどちらも条件を見ていない点で同じ過ち。優れているのは平均であってあなたの次の一件ではない。だからこの単位でやるのは、勘で見積もる数字を一つ選び単純な規則(直近3か月平均や前年同月)でも見積もって両方を書き留め、結果でどちらがどれだけ当たったかをしばらく記録し自分の予測を自分のデータで検算することである
| よくある誤解 | 実際のところ |
|---|---|
| 予測は人間の専門家の勘がいちばん確かで、単純な計算式が人の判断に勝つはずがない | これは逆で、単純な統計的予測が人の勘に平均して優ることが多い。Dawes・Faust・Meehl 1989は多くの分野で保険数理的なやり方が人の総合判断に勝ると報告し(源流はMeehl 1954)、Kuncel ら 2013・Ægisdóttir ら 2006はメタ分析で同じ向きを確かめた。勝つのはしばしばごく単純な規則で、人は印象や例外に引きずられぶれるが規則はぶれない。ただしこれは選抜や診断など特定の予測課題の知見で、人の心や健康の予測に安直に持ち込んではいけない |
| モデルが平均で優るなら、あとは全部モデルに任せてしまえばよい | 正しさと人がそれを使えるかは別。Dietvorst ら 2015は人がモデルの誤りを一度見ると全体では人より当たるモデルでも過度に避ける(アルゴリズム回避)と示し、Logg ら 2019は逆に文脈次第で過度に頼る(アルゴリズム選好)と示した。避けすぎれば優れた道具を捨て、頼りすぎればモデルが外す場面で一緒に転ぶ。優れているのは平均であってあなたの次の一件ではなく、どちらも条件を見ていない点で同じ過ちである |
| 一度よく当たる予測モデルを作れば、それをずっと使い続けられる | 予測モデルは作った瞬間がいちばん当たり、環境の変化とともにじわじわ精度が落ちることがある(ドリフト)。過去のデータで作った規則は過去の世界が前提で、客層が変わり季節がずれ流行が動けばほころぶ。単純な過去平均でも凝った予測でも環境が変われば外れうる共通の注意で、当たり続けて見えても環境がたまたま安定していただけかもしれない。モデルは作って終わりでなく、時々当たり具合を見て必要なら作り直す手入れの要る道具である |
皮肉なのは、この単位でいちばん受け入れにくいのが、俗説の正しい半分のほうだ、ということである。単純な計算式が、経験を積んだ人の勘に平均して勝つ——それは、認めたくない不都合な事実だ。だが半世紀のメタ分析が、その向きを一貫して示してきた。勝つのはしばしば、ごく単純な規則である。とはいえ、そこで話は終わらない。人はモデルが一度外すのを見ると過度に避け、あるいは文脈しだいで過度に頼る。そしてモデル自体も、客層や季節や流行が動けば、じわじわ外れていく。だから正しさは、無条件ではない。優れているのは平均であって、あなたの次の一件ではない。モデルが正しさを約束しているように見えるとき、たいていそれは、まだ誰も、平均の優位と、目の前の一件・人の受け止め・環境の変化を、別々に確かめていないだけかもしれない。この単位は、モデルを崇めも貶しもしない——どの見積もりをどこまで委ね、どこで人が目を通し、いつ見直すかを、条件で設計する目を持つための単位である。次の単位は 540「AIに仕事を任せるには?」——決まった予測から一歩進んで、文章も判断もこなす生成AIに、どこまで・どう任せるかへ進む。
Q1. この単位の芯——単純な統計的予測は、人の勘(臨床的判断)に ____ して優ることが多い。だがその優位は、人の ____ と、環境の ____ に条件づけられている。穴埋め
Q2. Dietvorst ら 2015 と Logg ら 2019 が示した、モデル導入における人の受け止め方について正しいものはどれか。選択
Q3. 『予測モデルは人より正しいのだから、勘は捨ててモデルに任せればよい』という考えに対し、この単位が示す反論を、ドリフトと平均の意味を含めて述べよ。一問一答
Q4. Kuncel ら 2013 や Ægisdóttir ら 2006 が積み上げたのはどんな結論か。またその知見を、どこまで一般化してよいか。一問一答
Q5. この単位が扱った事柄を、年の早い順に並べよ。(ア)Dietvorst らが人はモデルの誤りを見ると過度に避けると示す(イ)Meehl が臨床と統計を比べる古典を著す(ウ)Kuncel らが選抜・入学で機械的組み合わせの優位をメタ分析で示す(エ)Dawes・Faust・Meehl が保険数理的予測が人に優ると報告する並べ替え
紙かメモアプリに今日の日付を書く。次に、自分が今『勘』で見積もっている数字を一つ選ぶ(来月の来客数、次回の仕入れ量、頒布の部数など、自分の数字でよい)。同じ対象について、二つの見積もりを書く——(1) 自分の勘による見積もり、(2) 単純な規則による見積もり(たとえば直近3か月の平均、前年同月の値など、決まった計算で出せるもの)。二つの数字を記録しておく。実際の結果が出たら、どちらがどれだけ当たったか(結果との差)を書き足す。一度では分からないので、同じ形で数回くり返し、勘が勝った回数と規則が勝った回数を数える。人の心や健康の予測には使わず、自分の商いの数字だけで完結させる。数字で人を評価・監視する用途には使わない。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Dawes R.M., Faust D., Meehl P.E. (1989) ‘Clinical Versus Actuarial Judgment’, Science 243(4899):1668-1674 — doi.org
- Kuncel N.R., Klieger D.M., Connelly B.S., Ones D.S. (2013) ‘Mechanical versus clinical data combination in selection and admissions decisions: A meta-analysis’, Journal of Applied Psychology 98(6):1060-1072 — doi.org
- Ægisdóttir S. ほか (2006) ‘The Meta-Analysis of Clinical Judgment Project: Fifty-Six Years of Accumulated Research on Clinical Versus Statistical Prediction’, The Counseling Psychologist 34(3):341-382 — doi.org
- Dietvorst B.J., Simmons J.P., Massey C. (2015) ‘Algorithm Aversion: People Erroneously Avoid Algorithms After Seeing Them Err’, Journal of Experimental Psychology: General 144(1):114-126 — doi.org
- Logg J.M., Minson J.A., Moore D.A. (2019) ‘Algorithm appreciation: People prefer algorithmic to human judgment’, Organizational Behavior and Human Decision Processes 151:90-103 — doi.org
- Meehl P.E. (1954) 『Clinical versus Statistical Prediction: A Theoretical Analysis and a Review of the Evidence』, University of Minnesota Press — openlibrary.org