「いつもこうだ」の“いつも”は、たいてい3件くらいでできている
帰納は、事例を集めて法則を作る道具である。困るのは、何件集めれば足りるのかを、この道具自身が教えてくれないことだ。そして人は、その空白を驚くほど小さい数で埋める——訓練を受けた人でも。
帰納という道具は、何をする道具か
帰納は、いくつかの事例から、まだ見ていない場合にも当てはまる一般化を作る道具である。この道具が扱うのは、手元にある3件や30件ではなく、そこに含まれていない残り全部のほうだ。だから帰納には保証がない。18世紀にヒュームが指摘して以来、この穴は塞がれていない。次の1件が前の30件と同じである理由は、前の30件のなかには書かれていない。
それでも帰納は使う。使わなければ何も予測できないからだ。ただし、この道具には目盛りが付いていない。何件集めたら線を引いてよいのか、道具の側からは決まらない。決めるのは使う人であり、そして人が決める数は、たいてい小さい。
もう一つ、この棚のどの道具にも付く断りが、帰納にも付く。実験室と研修室で効いた道具は、部屋を出たとたんに効かなくなることが繰り返し確かめられている。帰納も例外ではない。
何件で「いつも」になるのか
1972年に発表された問題がある。ある町に大きい病院と小さい病院がある。大きい病院では1日におよそ45人、小さい病院ではおよそ15人の赤ちゃんが生まれる。男の子の割合はどちらもだいたい半々だが、日によってぶれる。1年のあいだに、生まれた赤ちゃんの60%以上が男の子だった日は、どちらの病院で多く記録されるか。
正解は小さい病院である。標本が小さいほど、偏った日が出やすい。ところが米国の大学生50人に聞いたところ、大きい病院と答えたのが12人、小さい病院と答えたのが10人、そしてほぼ同じと答えたのが28人だった。半数以上が、標本の大きさは関係ないと答えている。
これは学生に限った話ではない。その前年の1971年、同じ2人の研究者が、専門の心理学者84人に問題を配っている。学会の会合で集めた回答である。
中心の問題はこうだ。20人の参加者で実験をして、統計的に有意な差が出た。同じ実験を追加の10人で繰り返したら、そこでも有意になる確率はどれくらいか。回答の中央値は .85 だった。理論上の値はおよそ .48 である。.40 から .60 のあいだに答えたのは、84人中9人だけだった。
別の問題では、40匹の動物で得た意外な結果について、75人中66人が追試を勧めた。勧められた追試の標本の大きさは、中央値で20だった——元の実験の半分である。さらに別の問題では、27件の有意な相関のうちいくつが再現するかを予想させたところ、予想は18件で、現実的な見積りは8件から10件だった。
研究者たちは、小さい標本が母集団をそのまま縮めた縮図であるかのように扱っていた。少数の法則——大数の法則が大きい標本にしか約束していないことを、小さい標本にも期待してしまう構えである。
訓練を受けた側も、同じ穴に落ちる
この構えは、意見の問題ではない。設計の問題として、数字に出る。
1962年、統計家のコーエンが、ある心理学の専門誌の1960年の巻を1本ずつ調べた。78本の論文のうち統計的検定を含むものが72本、理論上重要な仮説に絞ると70本、検定の数は2,088。そのすべてについて、もし本当に差があったとしたら、それを検出できる確率——検出力——を計算した。
結果は、小さい差に対して18%、中くらいの差に対して48%、大きい差に対して83%だった。中くらいの差が本当にあったとしても、そこで行われていた実験の半分以上は、それを見つけられない大きさだったことになる。
24年後の1984年、同じ系列の雑誌でこの計算をやり直した研究がある。1989年に発表されたその報告によれば、中くらいの差に対する平均の検出力はおよそ50%で、24年前とほとんど変わっていなかった。検出力の問題は広く知られ、教科書にも書かれていたのに、実際の標本の大きさは動かなかった。
近年も形は同じである。2013年に神経科学の分野で行われた点検では、2011年に発表された49のメタ分析に含まれる研究の検出力の中央値は、およそ8%から31%のあいだと見積もられた。
この3つの数字が言っているのは、研究者が怠けているということではない。必要な件数の見積りは、それを職業にしている人にとっても直感に反する、ということである。日常で「3回続いたからそういうものだ」と思うとき、私たちは同じ坂を滑っている。
値切り:引用の連鎖の途中で、主張は強くなる
この棚のもとになった設計資料には、こんな一文があった。「自己懐疑を訓練した思考者は確証バイアスが有意に低下(Lilienfeld et al., 2009)」。数字の付いた、いかにも使いやすい主張である。
原典に当たった。Lilienfeld, Ammirati & Landfield の2009年の論文は実在する。Perspectives on Psychological Science の第4巻4号、390から398ページ。読むと、これは実験の報告ではない。バイアスを減らす手法を実社会でどう役立てられるかを検討した論考である。そして論考の結論は、設計資料の一文とほとんど逆を向いている。実験室では効く手法があるが、それを実社会へ持ち出せるかについては大きな疑問が残る、というものだ。自分のバイアスは自分では見えにくいこと、訓練の効果が別の場面へ広がりにくいこと、時間が経つと消えること——この3つが障害として挙げられている。
同じ論文は、文献の数も数えている。バイアスそのものを扱った文献1,211件に対し、それを減らす方法を扱った文献は158件。8分の1以下である。
つまりここで起きているのは、数字の捏造ではない。引用の連鎖の途中で、主張が少しずつ強くなるという現象である。「実社会への持ち出しは難しい」という慎重な論考が、引かれ、要約され、また引かれるうちに、「訓練すれば有意に低下する」という威勢のよい一文になる。誰も嘘をついていない。ただ、途中で一度も原典に戻らなかっただけだ。
これは帰納の話でもある。ある主張を10回見かけると、それは確からしく思えてくる。だが10回のうち9回が、同じ1つの出どころからの引用だったとしたら、あなたが集めた事例は10件ではない。1件である。
時間・変化:事例は、集まる順番で違う法則になる
帰納の弱点は、件数だけではない。順番にもある。
第一に、早く来た事例が枠を作る。最初の2件で「この取引先は返信が遅い」という枠ができると、3件目の速い返信は、法則を壊す事例ではなく、例外として処理される。同じ3件でも、順番が逆なら別の法則が立つ。
第二に、事例は数えられないと増える。記録がなければ、件数は記憶の鮮明さで置き換えられる。強い印象の1件は、薄い印象の5件より重く扱われる。「いつもこうだ」と言うとき、その「いつも」は件数ではなく、思い出しやすさの合計であることが多い。
第三に、法則は立った日から検証されなくなる。立てるまでは事例を集めるのに、立ったあとは事例を集めるのをやめる。ここで止まるので、あとから来た反証は、そもそも観察されない。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、件数を数えないことだ。数えていないあいだ、3件と30件は同じ顔をしている。
第二の妨げは、出どころの重複である。同じ主張を3か所で見たとき、その3か所が独立かどうかは、たいてい確かめられていない。
ここで、この棚として毎回断ることがある。ここまでの数字は、ほぼすべて英語圏の大学生と研究者を対象に、実験室や質問紙で採られている。会合で配られた1枚の紙に答えるのと、締切のある仕事で判断するのは違う。実験室で数分の課題として測られたものが、締切のある本物の判断にそのまま当てはまるとは限らない。日本語での追試もほとんど無い。数字は方向だけ持ち帰るのが誠実である。
助けるのは、法則の横に件数を書くことだ。「この取引先は返信が遅い(実際に確認できたのは3件)」。この括弧が、法則を主張から観察に戻す。
最初の一歩は5分。直近1週間で「いつもこうだ」と思ったことを1つ選び、その判断のもとになった実際の事例を数える。3件なら3件でよい。少ないことが問題なのではない。3件だと知らないまま3件で決めていることが問題なのである。
次の単位は 179「類推」——帰納が同じ種類の事例を縦に重ねて1本の線を引く道具なら、こちらは種類の違う領域どうしを横に結ぶ道具である。集めるものが違い、外し方も違う。道具箱の隣の引き出しに、それは別々に入っている。
- 帰納は手元の事例から、そこに含まれていない残り全部へ一般化する道具なので、原理として保証を持たない。しかも何件集めれば線を引いてよいかは道具の側から決まらず、決めるのは使う人である
- Kahneman & Tversky 1972(Cognitive Psychology 3:430-454)の病院問題では、米国の大学生50人のうち、大きい病院と答えたのが12人、小さい病院(正解)と答えたのが10人、ほぼ同じと答えたのが28人だった。半数以上が標本の大きさは関係ないと答えている
- Tversky & Kahneman 1971(Psychological Bulletin 76(2):105-110)は専門の心理学者84人に問題を配った。20人で出た有意な結果が追加の10人でも有意になる確率について、回答の中央値は .85、理論上の値はおよそ .48 で、.40 から .60 に答えたのは84人中9人だけだった
- 同じ1971年の調査で、40匹の動物で得た意外な結果について75人中66人が追試を勧め、その追試の標本は中央値で20——元の実験の半分だった。27件の有意な相関のうちいくつ再現するかの予想は18件で、現実的な見積りは8件から10件である
- Cohen 1962(Journal of Abnormal and Social Psychology 65(3):145-153)は、ある心理学専門誌の1960年の巻から70本・2,088の検定を調べ、平均の検出力を小さい差に18%、中くらいの差に48%、大きい差に83%と算出した。中くらいの差が本当にあっても、半分以上の実験はそれを見つけられない大きさだった
- Sedlmeier & Gigerenzer 1989(Psychological Bulletin 105(2):309-316)は24年後の1984年の巻で同じ計算をやり直し、中くらいの差に対する平均検出力はおよそ50%で、ほとんど変わっていないと報告した。2013年に神経科学で行われた点検(Button et al., Nature Reviews Neuroscience 14(5):365-376)でも、2011年発表の49のメタ分析に含まれる研究の検出力の中央値はおよそ8%から31%と見積もられた
- 設計資料の「自己懐疑を訓練した思考者は確証バイアスが有意に低下(Lilienfeld et al., 2009)」は、原典(Perspectives on Psychological Science 4(4):390-398)に当たると実験ではなく論考であり、結論はほぼ逆——実験室では効く手法も実社会へ持ち出せるかには大きな疑問が残る、というものだった。同論文はバイアスを扱った文献1,211件に対し、それを減らす方法を扱った文献は158件だと数えている
| よくある誤解 | 実際のところ |
|---|---|
| 自己懐疑を訓練すると確証バイアスが有意に低下する、という2009年の研究がある | 原典は Lilienfeld, Ammirati & Landfield 2009(Perspectives on Psychological Science 4(4):390-398)で、実在するが実験の報告ではなく論考である。しかも結論はほぼ逆で、実験室では効く手法も実社会へ持ち出せるかには大きな疑問が残る、自分のバイアスは自分では見えにくい、訓練は別の場面へ広がりにくく時間が経つと消える、と書かれている。数字の捏造ではなく、引用の連鎖の途中で慎重な論考が威勢のよい一文に変わった例である |
| 小さい標本でも、母集団の縮図としてだいたい同じ傾向が出る | 標本が小さいほど、偏った結果が出やすい。Kahneman & Tversky 1972 の病院問題では、米国の大学生50人のうち28人が、大きい病院でも小さい病院でも偏る日の数はほぼ同じと答えた。Tversky & Kahneman 1971 は、専門の心理学者84人でも同じ構えが出ることを示している。20人で出た結果が10人の追試でも有意になる確率の回答は中央値 .85、理論値はおよそ .48 だった |
| 同じ主張を複数の場所で見かけたのだから、それだけ事例が集まっているということだ | 10回見かけたうち9回が同じ1つの出どころからの引用なら、集まった事例は10件ではなく1件である。しかも引用が重なるあいだに、主張は少しずつ強くなることがある。件数を数えるときに数えるべきなのは、見かけた回数ではなく、独立した出どころの数のほうである |
「いつもこうだ」という言い方には、便利な性質がある。件数を言わなくて済むのだ。3件でも30件でも、口に出せば同じ長さになるし、聞くほうも数を尋ねない。しかも一度そう言ってしまえば、あとから来た反対の1件は、法則を壊す事例ではなく、めずらしい例外という扱いになる。皮肉なのは、この省エネのおかげで、私たちが持っている法則の在庫が、ほぼ全部たった数件の上に載っていることである。在庫の棚卸しをしないかぎり、それは永久に発覚しない。
Q1. Tversky & Kahneman が1971年に専門の心理学者 ____ 人へ配った調査では、20人で出た有意な結果が追加の10人でも有意になる確率について、回答の中央値は ____ だった。理論上の値はおよそ .48 で、.40 から .60 のあいだに答えたのはわずか ____ 人である。穴埋め
Q2. 「自己懐疑を訓練した思考者は確証バイアスが有意に低下(Lilienfeld et al., 2009)」——本文はこの一文を原典に当たってどう訂正したか。原典が何であるかと、結論の向きの両方に触れて答えよ。一問一答
Q3. 同じ主張を10か所で見かけたとき、本文はそれを何件の事例として数えるべきだと書いているか。理由も添えて答えよ。一問一答
Q4. Cohen が1962年に、ある心理学専門誌の1960年の巻(70本・2,088の検定)について算出した平均の検出力の組み合わせとして、本文の内容に合うものはどれか。選択
Q5. Kahneman & Tversky 1972 の病院問題(1日およそ45人が生まれる大きい病院と、およそ15人の小さい病院で、男の子が60%を超える日はどちらで多いか)について、本文の内容に合うものはどれか。選択
直近1週間で「いつもこうだ」「あの人はだいたいこう」「うちはこうなりがち」と自分が思ったことを1つだけ選び、紙かメモアプリに1行で書く。次に、その判断のもとになった実際の出来事を思い出せるだけ挙げ、件数を数字で書く。思い出せた件数だけを数え、たぶんあっただろう、という分は数えない。数え終えたら、その件数のうち、自分が直接見たものが何件かも書き添える(人から聞いた分は別に数える)。合計の件数を記録すれば完了。誰かに確認を取る必要はなく、相手に伝える必要もない。組織に所属していない場合は、家事・買い物・通学・体調など、自分の生活のなかの「いつもこうだ」で構わない。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Kahneman D., Tversky A. (1972) 'Subjective probability: A judgment of representativeness', Cognitive Psychology 3(3):430-454 — www.sciencedirect.com
- Tversky A., Kahneman D. (1971) 'Belief in the law of small numbers', Psychological Bulletin 76(2):105-110 — psycnet.apa.org
- Cohen J. (1962) 'The statistical power of abnormal-social psychological research: A review', Journal of Abnormal and Social Psychology 65(3):145-153 — pubmed.ncbi.nlm.nih.gov
- Sedlmeier P., Gigerenzer G. (1989) 'Do studies of statistical power have an effect on the power of studies?', Psychological Bulletin 105(2):309-316 — www.semanticscholar.org
- Button K.S., Ioannidis J.P.A., Mokrysz C., Nosek B.A., Flint J., Robinson E.S.J., Munafò M.R. (2013) 'Power failure: why small sample size undermines the reliability of neuroscience', Nature Reviews Neuroscience 14(5):365-376 — www.nature.com
- Lilienfeld S.O., Ammirati R., Landfield K. (2009) 'Giving Debiasing Away: Can Psychological Research on Correcting Cognitive Errors Promote Human Welfare?', Perspectives on Psychological Science 4(4):390-398 — journals.sagepub.com