人が確率に弱いのではない。パーセントという書き方に弱いのだ
人間は確率が分からない生き物だ、とよく言われる。ところが同じ問題を、パーセントではなく「1万人のうち何人」という数え方に書き直すだけで、正答率が3倍近くに動いた実験がある。分からなかったのは確率ではなく、確率の書き方のほうだった。
見せ方を変えるだけで、正答率が動く
確率的思考は、起きるかどうか分からないことに重みを付けて扱う道具である。ただしこの棚では、期待値の計算と、自分の予想がどれだけ当たっているかの点検を主役にしない。どちらも開運の棚がすでに扱った持ち場だからだ。ここで扱うのは、その手前——数字がどう書かれているかで、同じ人の答えが変わるという一点に絞る。
言い換えると、この単位は「確率に強くなる方法」ではなく、「確率が読めなくなる書き方」を見分ける道具の話である。
1995年に Psychological Review へ出た実験が、この一点を測っている。オーストリアのザルツブルク大学の学生60人に、15種類の問題を解かせた。どれも、ある印が付いた人のうち本当に該当する人はどれくらいか、を求める同じ形の問題である。
変えたのは、数字の書き方だけだった。確率の形——該当率は0.1%、該当者に印が付く率は90%、そうでない人にも5%に印が付く——で出したときの正答率は16%。同じ問題を自然頻度の形——1万人のうち10人が該当し、そのうち9人に印が付き、残りの9,990人のうち約500人にも印が付く——で出したときは46%だった。情報を絞った短い形でも、確率では28%、自然頻度では50%である。
人が変わったわけではない。同じ学生が、同じ日に、同じ論理の問題を解いている。変わったのは紙の上の書き方だけだ。
この差は一つの研究室の話ではない。2017年に Psychological Bulletin へ出たメタ分析は、20年ぶんの研究から35本の論文・226件の成績の推定値を集めて、この効果を集計している。効果は残った。そして、効果を強める条件として上位に挙がったのが、必要な数字だけに絞った短い提示と、図による補助だった。頭の中で数える代わりに、紙の上で数えられるようにすることが効く、という結論である。
1万人の升目
なぜ自然頻度だと解けるのか。答えは身も蓋もない。割り算が要らなくなるからである。
1万人を並べると、こうなる。該当する人は10人。検査や審査で印が付くのは、そのうち9人。該当しない9,990人のうち、およそ500人にも印が付く。すると印が付いた人は合わせて509人で、そのうち本当に該当するのは9人——およそ1.8%である。
数字は説明のために作ったものだが、形は原典の問題と同じだ。ここでやったのは足し算と、最後に一度の割り算だけである。確率の形で書かれた同じ問題では、この一度の割り算に行き着くまでに、掛け算と足し算を積み上げなければならない。
条件が増えるほど、この差は開く。2015年に Frontiers in Psychology へ出た研究では、手がかりが2つ3つに増えた、より込み入った推論の問題を、ドイツ・ベルリンの医学生64人に解かせている。確率の形での正答率は平均7%、自然頻度の形では45%だった。込み入った問題ほど、書き方の効き方は大きい。
ここに、この単位の値切りが立つ。「人間は確率が分からない生き物だ」という一般化は、実験結果を書き方から切り離して読んだときにだけ成り立つ。同じ人が、書き方を変えれば解く。だから基準率無視は、人の欠陥というより、表現の問題として扱えるところが大きい。
この区別は実務的でもある。人の欠陥だと思えば、打てる手は研修と注意喚起だけになる。表現の問題だと思えば、紙の書き方を変えるという手が使える。後者のほうが安い。
なお、この単位では医療の検査結果の読み方や、保険・投資・賭けの判断には踏み込まない。前者は病気の棚と健康の棚の持ち場であり、後者は金運の棚の持ち場かつ制度に依存するからだ。ここで扱うのは、数字の書き方という一点だけである。
二つ重ねると、確率は下がる
書き方が効かない場所もある。
1983年に Psychological Review へ出た研究が、その代表例を報告している。ある人物の人柄を短く説明した文章を読ませ、いくつかの記述をもっともらしい順に並べさせる課題だ。並べる対象の中に、一つの条件だけを述べた記述と、その条件に別の条件を足した記述が混ぜてある。
論理としては、二つの条件を同時に満たす人は、一つの条件を満たす人の一部でしかない。だから後者のほうが起こりやすい、とは決してならない。ところが、条件を足したほうがその人物の説明としてしっくり来るとき、多くの人は足したほうを上に置いた。
数字はこうである。統計をまったく学んでいない回答者88人で89%、ある程度学んだ回答者53人で90%、統計を専門的に学んだ回答者32人で85%。詳しさは効かなかった。
では何も効かないのか。ここは値切っておく必要がある。2010年に Games and Economic Behavior へ出た米国の実験は、同じ形の課題を361人の大学生に出し、二つの条件を動かした。正解したときだけ4米ドルの報酬が出るかどうかと、答える前に他の参加者と相談できるかどうかである。
段差を踏んだ人の割合は、報酬も相談も無い条件で58.1%。報酬だけを付けると33.0%。相談できる3人の組で、かつ報酬がある条件では10.4%まで下がった。
つまり、この段差は詳しさでは動かず、報酬と相談では動く。基準率無視は書き方で動く。三つとも「人は確率が苦手」という一行にまとめられるが、まとめた瞬間に、何が効くかが見えなくなる。道具として持ち帰るのはこの点だ——効く操作が違うのだから、対処も分けて置く。
訓練は、どれくらい残るのか
書き方が効くなら、書き方を教えればいい。ただし研修の効果は、たいてい翌週には消える。この領域では、そこも測られている。
2001年に Journal of Experimental Psychology: General へ出た研究が、二種類の訓練を比べた。ひとつは公式に数字を当てはめる訓練。もうひとつは、問題を頻度の形に描き直す訓練——木の形や升目の形に置き換える手続きそのものを教える。
ドイツのベルリン自由大学の学生56人を対象にした比較では、訓練直後の正答率は公式が64%、頻度に描き直すほうが86%だった。差はここでは大きくない。差が出たのは5週間後である。公式の訓練を受けた群は14%まで落ち、頻度に描き直す訓練を受けた群は86%のままだった。
残ったのは知識ではなく、手続きである。公式は思い出せなくなるが、「1万人に置き直す」という一手は、置き直し方さえ身についていれば毎回やり直せる。
時間・変化:数字は残り、書き方は消える
数字が人の手を渡っていく過程には、決まった方向がある。
第一に、自然頻度で書かれた数字は、伝わる途中でパーセントに書き換えられる。パーセントのほうが短く、比較しやすく、見出しに収まるからだ。書き換えた時点で、読み手にとっての難しさが跳ね上がる。この書き換えは、たいてい悪意なく行われる。
第二に、分母が落ちる。「印が付いた509人のうち9人」は、伝言の途中で「9人が該当」だけになる。分母は文字数を食うわりに見出しに効かないので、最初に削られる。
第三に、条件が足されていく。二つの条件を重ねた記述のほうが具体的で、話として伝わりやすい。伝わりやすい形と、起こりやすい形は、しばしば逆を向く。1983年の実験が測ったのは、まさにこの逆向きだった。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、確率が出た瞬間に「自分は数字が苦手だ」と判定してしまうことだ。1995年の実験が示したのは、その判定が書き方に依存しているということである。苦手なのは人ではなく、その紙のほうかもしれない。
第二の妨げは、パーセントで書かれた数字をパーセントのまま比べることである。とくにパーセントの変化を表す数字は、元の分母が消えているので、そのままでは大きさが読めない。パーセントとパーセントポイントを混同する余地も、ここに生まれる。
標本の偏りも断っておく。ここで引いた証拠は、オーストリア・ドイツ・米国の大学生と医学生を対象にした実験室課題である。実験室で数分の課題として測られたものが、締切のある本物の判断にそのまま当てはまるとは限らない。日本語の表記——「割」「分」「%」が混在する——での追試はほとんど見当たらない。うまく解けた人のデータは残るが、途中で投げ出した人のデータは残らない。
助けるのは、分母を1万人に固定することだ。問題ごとに分母を変えると比べられなくなる。1万人に固定しておけば、書き直す手続きが毎回同じ形になる。
最初の一歩は5分。今週起きるかどうか分からないことを3件書き、それぞれ起きる確率を%で1つずつ書く。答え合わせは来週でよい。今日は書くところまでで終わる。
次の単位は 191「仮説思考」——確率的思考が、複数の道筋に重みを付けて扱う道具なら、こちらは、先に一本の道筋を立ててから確かめにいく道具である。引き出しは隣にあり、どちらから開けてもかまわない。
- Gigerenzer & Hoffrage 1995(Psychological Review 102(4):684-704)は、オーストリア・ザルツブルク大学の学生60人に15種類の同じ形の問題を解かせ、確率の形で提示したときの正答率は16%、自然頻度の形で提示したときは46%だったと報告した。情報を絞った短い形でも確率28%・自然頻度50%である
- 同じ学生が、同じ日に、同じ論理の問題を解いている。変わったのは紙の上の書き方だけだった。だから基準率無視は、人の欠陥というより表現の問題として扱えるところが大きい
- McDowell & Jacobs 2017(Psychological Bulletin 143(12):1273-1312)は20年ぶんの研究から35本の論文・226件の成績の推定値を集めて集計した。自然頻度の効果は残り、効果を強める条件の上位には、必要な数字だけに絞った短い提示と、図による補助が挙がった
- 自然頻度が効くのは、割り算が要らなくなるからである。1万人のうち該当10人、うち印が付くのが9人、該当しない9,990人のうち約500人にも印が付く、と並べると、印が付いた509人のうち本当に該当するのは9人、およそ1.8%と、足し算と最後の一度の割り算だけで出る
- Hoffrage, Krauss, Martignon & Gigerenzer 2015(Frontiers in Psychology 6:1473)は、手がかりが増えたより込み入った推論の問題をドイツ・ベルリンの医学生64人に解かせ、確率の形での正答率は平均7%、自然頻度の形では45%だったと報告した。込み入った問題ほど書き方の効き方は大きい
- Tversky & Kahneman 1983(Psychological Review 90(4):293-315)では、二つの条件を重ねた記述のほうが起こりやすいと答えた割合が、統計をまったく学んでいない88人で89%、ある程度学んだ53人で90%、専門的に学んだ32人で85%だった。統計の詳しさは効かなかった
- Charness, Karni & Levin 2010(Games and Economic Behavior 68(2):551-556)は米国の大学生361人に同じ形の課題を出し、段差を踏んだ割合が、報酬も相談も無い条件で58.1%、正解時だけ4米ドルの報酬がある条件で33.0%、相談できる3人の組で報酬もある条件で10.4%だったと報告した。詳しさでは動かないが、報酬と相談では動く
| よくある誤解 | 実際のところ |
|---|---|
| 人間は、そもそも確率が分からない生き物である | Gigerenzer & Hoffrage 1995 の実験では、同じ学生が同じ日に同じ論理の問題を解いて、確率の形なら16%、自然頻度の形なら46%だった。変わったのは紙の上の書き方だけである。35本の論文・226件の推定値を集めた McDowell & Jacobs 2017 でもこの差は残り、短い提示と図による補助が効果を強める条件の上位に挙がった。人の欠陥だと思えば打てる手は研修と注意喚起だけになるが、表現の問題だと思えば紙の書き方を変えるという安い手が使える |
| 統計に詳しくなれば、確率の読み違いは減る | Tversky & Kahneman 1983 の直接比較では、二つの条件を重ねた記述のほうが起こりやすいと答えた割合は、統計をまったく学んでいない88人で89%、ある程度学んだ53人で90%、専門的に学んだ32人で85%だった。詳しさは効いていない。ただし何も効かないわけでもなく、Charness ら 2010 では報酬と相談を入れると58.1%が10.4%まで下がった。効く操作が違うのだから、対処も分けて置く |
| 確率の研修を受ければ、読み方は身につく | Sedlmeier & Gigerenzer 2001 のドイツの学生56人の比較では、公式に当てはめる訓練は直後64%から5週間後14%まで落ちた。いっぽう問題を頻度の形に描き直す訓練は直後86%、5週間後も86%だった。残るのは知識ではなく手続きである。覚えるべきは公式ではなく、1万人に置き直すという一手だ |
パーセントは、たいへん便利な書き方である。短く、比べやすく、見出しに収まり、そして読んだ人が分かった気になる。分母が要らないのが最大の利点で、分母が要らないというのは、分母を確かめられないということでもある。皮肉なことに、確率を扱う道具のうち今日いちばん効くのは、確率をやめて人数に書き直す、という一手である。
Q1. Gigerenzer & Hoffrage 1995 は、オーストリア・ザルツブルク大学の学生 ____ 人に15種類の問題を解かせた。すべての数字を出す形で、確率で書いたときの正答率は ____%、自然頻度で書いたときは ____% だった。短い形では確率 ____%、自然頻度 ____% である。穴埋め
Q2. 本文の1万人の例では、該当する人は ____ 人、そのうち印が付くのは ____ 人。該当しない9,990人のうち約 ____ 人にも印が付く。印が付いた人は合計 ____ 人で、そのうち本当に該当するのはおよそ ____% である。穴埋め
Q3. 二つの条件を重ねた記述のほうが起こりやすいと答える段差について、Tversky & Kahneman 1983 と Charness ら 2010 が示した数字をそれぞれ挙げ、本文がそこから引き出している結論を答えよ。一問一答
Q4. Sedlmeier & Gigerenzer 2001 のドイツ・ベルリン自由大学の56人の比較で、二種類の訓練の正答率は訓練直後と5週間後にそれぞれどうなったか。本文はそこから何が残ったと言っているか。一問一答
Q5. 本文が示した「%を人数に置き直す3手の手続き」を、実行する順に並べよ。(A)%をすべて人数に書き直す(B)印が付いた人を足して、そのうち該当する人で割る(C)分母を1万人に固定する並べ替え
今週のうちに起きるかどうか分からないことを、3件だけ手元のメモに書く。自分の身の回りで、来週には結果が分かるものにする。たとえば「金曜までにあの返信が来る」「今週中に洗濯を3回する」「土曜の予定が雨で流れる」など、自分で確認できるものがよい。次に、それぞれについて起きると思う確率を%で1つずつ書く。0%や100%を使ってもよいが、なぜその数字にしたかは書かなくてよい。最後に、3件のうち1件を選んで、その%を「100人の自分が今週を過ごしたら何人に起きるか」という人数の言い方に書き直して、隣に添える。答え合わせは来週でよく、今日は書くところまでで終わる。医療・保険・投資・賭けに関する事柄は選ばない——それらはこの単位の持ち場ではない。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Gigerenzer G., Hoffrage U. (1995) 'How to Improve Bayesian Reasoning Without Instruction: Frequency Formats', Psychological Review 102(4):684-704 — pages.ucsd.edu
- McDowell M., Jacobs P. (2017) 'Meta-Analysis of the Effect of Natural Frequencies on Bayesian Reasoning', Psychological Bulletin 143(12):1273-1312 — pubmed.ncbi.nlm.nih.gov
- Hoffrage U., Krauss S., Martignon L., Gigerenzer G. (2015) 'Natural frequencies improve Bayesian reasoning in simple and complex inference tasks', Frontiers in Psychology 6:1473 — www.frontiersin.org
- Sedlmeier P., Gigerenzer G. (2001) 'Teaching Bayesian Reasoning in Less Than Two Hours', Journal of Experimental Psychology: General 130(3):380-400 — wexler.free.fr
- Tversky A., Kahneman D. (1983) 'Extensional Versus Intuitive Reasoning: The Conjunction Fallacy in Probability Judgment', Psychological Review 90(4):293-315 — apps.dtic.mil
- Charness G., Karni E., Levin D. (2010) 'On the conjunction fallacy in probability judgment: New experimental evidence regarding Linda', Games and Economic Behavior 68(2):551-556 — www.umass.edu