「最善の説明」の“最善”を決めているのは、たいてい説明の短さである
思考法の本は、うまくいった判断を後から集めて「こう考えたからだ」と名前を付ける。名前は増える。ところが、その道具をどこまで持ち出せるかは、どの本にも書かれていない。この棚は、名前ではなく、持ち出せる範囲のほうを書く。
この棚の入口——読者は、賢くなりたい人ではない
ここまでの11の棚は、すべて人生の領域だった。病気、健康、家族、学業、芸道、就職と職業、友達、恋愛と結婚、金運、開運、組織の基盤。この棚だけが領域ではない。道具箱である。 どの領域でも使う道具そのものを、16の引き出しに分けて扱う。
だから読者の像も変えておく。この棚が想定しているのは、賢くなりたい人ではない。判断を間違えたとき、どこで間違えたかを言えるようになりたい人である。
この区別は、書けることを大きく狭める。この棚は、思考法を身につければ判断がよくなる、とは言わない。言うのは3つだけだ——その道具は何をする道具か。どこまで効くことが確かめられているか。その範囲の外で何が起きるか。
読者定義はここで一度だけ書く。以降の15単位では繰り返さない。ただし、順に読まないと分からない書き方もしない。どの単位も単独で読める。
道具箱の地図——5つの層
この棚は梯子ではない。引き出しの並んだ道具箱である。16の道具は掛け算で効き、固有の順序を持たない。上から順に登るものではないので、地図も梯子の形にはならない。
引き出しは5つの層に分かれている。推論のOS——前提から降りる、事例から昇る、領域をまたぐ、観察から跳ぶ(177から180)。現実への接続——分かっているつもりを検める、言葉を固定する、証拠の独立を見る(181から183)。整理と判断——分け方を選ぶ、遅れとループを見る、諦めたものを見えるところに置く(184から186)。生み出す——量を出す、最初の案を疑う、逆からたどる、確率を扱う、先に答えを立てる(187から191)。そして全体の監視——自分の思考を見る道具(192)。
地図を描くのはここだけである。以降の15単位では描き直さない。
アブダクションという道具は、何をする道具か
観察がある。その観察が、もしある仮定のもとでなら当たり前になる。だから、その仮定はもっともらしい——この動きがアブダクションである。19世紀末に米国のパースが、演繹でも帰納でもない第三の推論として名前を付けた。
他の2つと並べると、性格がはっきりする。演繹は前提から結論へ降り、前提が正しければ結論も正しいという保証を持つ。帰納は事例から一般化へ昇り、保証は無いが、事例を増やせば確からしさは上がる。アブダクションはどちらでもない。観察1件から、その裏側にある説明へ跳ぶ。 増やせるものが無い。
保証が無いことは、形を見れば分かる。AならばBが成り立っていて、Bが観察された。ここからAを結論するのは、論理としては誤りである。Bを引き起こすものはAだけとは限らない。にもかかわらず、私たちは日に何十回もこれをやる。返信が来ない、機械が止まった、相手の口数が少ない——観察はいつも1件で、説明はいつも複数ありうる。
では、この道具は何を保証するのか。候補を並べて比べたという手続きだけである。保証されるのは、少なくとも2つ目を考えたという事実だけだ。実務では、この差がいちばん大きい。1つしか思い浮かばなかった説明は、比べられていない。比べられていない説明は、選ばれてもいない。
「最善」の中身は、場面で入れ替わる
アブダクションは、しばしば「最善の説明への推論」と呼ばれる。では、最善とは何か。ここが弱点である。
2007年に発表された実験が、この問いを正面から測った。参加者に架空の生き物の症状を2つ見せ、1つの病気で両方を説明する案と、2つの病気でそれぞれを説明する案のどちらがよいかを選ばせる。病気の頻度も知らせてある。
結果はこうだった。頻度が同じとき、83%が1つの病気で説明する案を選ぶ。ところが、2つの病気で説明するほうが2倍確からしい条件でも、56%が1つの病気の案を選び続けた。逆転には、確率でおよそ4対1の差が必要だった。実験4では、両方の確率を掛け合わせた値を明示すると、単純なほうを選ぶ人は61%から17%まで落ちた。数字を見せられれば直せる。見せられないあいだ、人が読んでいるのは確率ではなく短さである。
面白いのはその先だ。2017年に発表された別の研究は、実際にやりとりされている説明を大量に集め、質の評価が何で決まるかを調べた。ここでは逆の結果が出る。評価と強く結びついていたのは、内的な整合性(R = .82)、説明の込み入り具合(R = .79)、話し手の専門性らしさ(R = .66)、そして挙げられた根本原因の数(R = .64)と長さ(R = .60)だった。単純さは、質の高さを予測しなかった。
実験室で選択肢を2つ並べられると、人は短いほうを取る。現実の説明を読まされると、長くて原因の多いほうを高く評価する。最善の基準は、こちらの状況しだいで入れ替わっている。アブダクションが「最善の説明」を選ぶ道具だとして、その最善の物差しは、道具の外にある。
値切り:思考法を学べば判断がよくなる、という前提
ここでこの棚全体の前提を値切っておく。思考法を学べば判断がよくなる、という前提である。
この主張には、めずらしく大規模なメタ分析がある。2015年に Review of Educational Research へ出た批判的思考の指導の集計だ。最終的な標本は684件の研究で、そのうち標準化された尺度を使った準実験・実験から341の効果量を集計している。1940年代から2009年までが対象で、その半分近くが2000年代のものだった。
全体の効果量は g+ = 0.30。95%信頼区間は .25 から .34。研究間のばらつきは大きく、異質性の指標は72.27%。効果はある。ただし、講演の見出しに使える大きさではない。
重要なのは内訳である。本物に近い問題を扱うだけ 0.25(22件)。対話の機会を作るだけ 0.23(43件)。この2つを組み合わせると 0.32(45件)。そこに助言者が個別に手ほどきする形が加わった19件だけが 0.57 に届いている。
つまり、道具の名前を教えることの効果はほとんど無く、使いどころごと教わったときにだけ、効果が倍近くになる。
翌2016年に同じ雑誌へ出た71件の集計も同じ側を向く。大学に4年通えば批判的思考は伸びるが、カリキュラム全体で教える取り組みが、通常の在学以上の上積みを長期に生むとは限らない。
訓練が部屋の外へ出ない現象は、思考法に限らない。2017年の整理では、チェス・音楽・記憶の訓練が別の能力へ広がるかを調べた研究群を並べ、効果の大きさが実験計画の質と逆に動くことが示された。音楽の訓練の遠い転移は、何もしない群と比べると 0.25(64の比較)だが、別の活動をした群と比べると 0.03(54の比較)に落ちる。記憶の訓練も 0.18 から 0.05 へ。いっぽう、訓練したものに近い課題への効果は 0.44 から 0.46 で残る。近くへは届く。遠くへは届かない。
2002年に出た総説は、この議論が噛み合わない理由そのものを整理している。転移という言葉は、何が運ばれるか(具体的な手順か、一般的な原理か)と、どこへ運ばれるか(分野・場所・時間の隔たり・場面の性格・一人か複数か・見た形と使う形)という複数の軸を持っていて、軸を指定しないまま転移する/しないと論じても、互いに別のものを指したままになる。転移の効果量は1つではない。
ここまでが、この棚の通奏低音の一つめである。実験室と研修室で効いた道具は、部屋を出たとたんに効かなくなることが、何十年も繰り返し確かめられている。 道具の名前は増えるのに、どこまで持ち出せるかは書かれない。以降の15単位では、この手つきに1文だけ触れて、それぞれの値切りへ進む。
ついでに、この単位に付いていた出典も1つ返上しておく。設計資料には「医師の診断や刑事の推理の多くがアブダクション的推論に依拠(Magnani, 2001)」という一文があった。参照先は理論書である。枠組みとしては読めるが、実際の診断や捜査の何割がこの形かを測った数字ではない。断定の根拠には使わない。
時間・変化:候補は、最初の数分で出そろってしまう
アブダクションの弱点は、比べる段階ではなく、並べる段階にある。
第一に、候補は早い時期に出そろう。最初に浮かんだ説明が、後から来る観察の解釈の枠になる。同じ観察が、枠に合えば裏づけになり、合わなければ雑音になる。
第二に、候補の数は増えない。1つ目が十分にもっともらしいと、2つ目を探す動機が消える。比べたという手続きが成立しないまま、結論だけが残る。
第三に、時間が経つと選んだ理由が消える。半年後に思い出せるのは「あれはこういうことだった」であり、何と何を比べたかではない。だから候補は、選んだ日に書いておくしかない。3行で済む。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、説明が思いついた瞬間の手応えである。腑に落ちる感じは、正しさの信号ではなく、その説明が短くて既知の枠に収まったという信号であることが多い。2007年の実験が測ったのは、その手応えだった。第二の妨げは、候補が1つしか無いときにも比べたつもりになれることだ。1つの説明は、比べられていない。
ここで、この棚として毎回断ることがある。ここまでの数字は、ほぼすべて英語圏の学生と実験参加者から採られている。課題は数分で終わり、締切もなければ、間違えても失うものがない。実験室で数分の課題として測られたものが、締切のある本物の判断にそのまま当てはまるとは限らない。 効果量のメタ分析も、その多くは教育場面での測定であって、仕事の判断そのものを測ってはいない。日本語での追試もほとんど無い。数字は方向だけ持ち帰るのが誠実である。
助けるのは、候補を数える習慣である。良い説明を思いつく訓練ではない。2つ目を書くという、それだけの手続きだ。
最初の一歩は10分。今日か昨日、意外だと思った出来事を1件選ぶ。小さいもので構わない。その説明を3つ書く。3つ目は、たいてい無理やり出てくる。無理やりで構わない。書けたら、どれを最善としたかに丸を付け、その理由を1行だけ書く。そして、書いたものを最後にもう一度読み返す。丸を付けた理由が「いちばん短いから」だったなら、それは今日いちばんの収穫である。
次の単位は 181「実体」——アブダクションが説明の候補を並べる道具なら、こちらは、その候補が本当に説明になっているかを、自分の手で書き出して確かめる道具である。並べるのと、中身を開けるのは別の作業だ。道具箱の隣の引き出しに、それは別々に入っている。
- この棚だけが領域ではなく道具箱である。読者は賢くなりたい人ではなく、判断を間違えたときにどこで間違えたかを言えるようになりたい人。書くのは3つだけ——何をする道具か、どこまで効くと確かめられているか、その範囲の外で何が起きるか
- 道具箱は5つの層に分かれる。推論のOS(177から180)、現実への接続(181から183)、整理と判断(184から186)、生み出す(187から191)、全体の監視(192)。梯子ではないので固有の順序はなく、地図を描くのはこの単位だけである
- アブダクションは観察1件からその裏側の説明へ跳ぶ推論で、19世紀末に米国のパースが第三の推論として名づけた。AならばBが成り立ちBが観察されたときAを結論するのは論理としては誤りであり、保証されるのは結論の正しさではなく、候補を並べて比べたという手続きだけである
- Lombrozo 2007(Cognitive Psychology 55(3):232-257)の実験2(144人)では、頻度が同じとき83%が1つの原因で説明する案を選び、2つの原因で説明するほうが2倍確からしい条件でも56%が1つの原因の案を選び続けた。逆転にはおよそ4対1の差が必要で、実験4(48人)では確率を掛け合わせた値を明示すると単純なほうを選ぶ人が61%から17%へ落ちた
- Zemla, Sloman, Bechlivanidis & Lagnado 2017(Psychonomic Bulletin & Review 24(5):1488-1500)が現実の説明の質の評価を調べたところ、強く結びついたのは内的整合性 R=.82、込み入り具合 R=.79、根本原因の数 R=.64、長さ R=.60 で、単純さは質を予測しなかった。最善の物差しは道具の外にあり、場面で入れ替わる
- Abrami, Bernard, Borokhovski, Waddington, Wade & Persson 2015(Review of Educational Research 85(2):275-314)は684件の研究から341の効果量を集計し、批判的思考の指導の平均効果を g+ = 0.30(95%信頼区間 .25 から .34、異質性 72.27%)と報告した。組み合わせ別では、本物に近い問題だけ 0.25(22件)、対話だけ 0.23(43件)、両方で 0.32(45件)、助言者の個別の手ほどきが加わった19件だけが 0.57 に届いた
- Sala & Gobet 2017(Current Directions in Psychological Science 26(6):515-520)では、音楽の訓練の遠い転移は何もしない群との比較で 0.25(64の比較)、別の活動をした群との比較で 0.03(54の比較)、記憶の訓練は 0.18 から 0.05 へ落ちた。近い課題への効果は 0.44 から 0.46 で残る。Barnett & Ceci 2002(Psychological Bulletin 128(4):612-637)は、転移は何がどこへ運ばれるかの軸を指定しないと議論が噛み合わないと整理した
| よくある誤解 | 実際のところ |
|---|---|
| 思考法を身につければ、判断がよくなる | 684件から341の効果量を集めた Abrami et al. 2015 のメタ分析で、批判的思考の指導の平均効果は g+ = 0.30(95%信頼区間 .25 から .34)にとどまる。内訳では、本物に近い問題だけ 0.25、対話だけ 0.23、両方で 0.32、助言者の個別の手ほどきが加わった19件だけが 0.57 だった。Huber & Kuncel 2016(71件)も、カリキュラム全体の取り組みが通常の在学以上の上積みを長期に生むとは限らないと報告している。効くのは名前ではなく、使いどころごと教わったときである |
| 訓練で身についた考え方は、別の場面にも持ち出せる | Sala & Gobet 2017 が示したのは、効果の大きさが実験計画の質と逆に動くことだった。音楽の訓練の遠い転移は、何もしない群と比べると 0.25 だが、別の活動をした群と比べると 0.03 に落ちる。記憶の訓練も 0.18 から 0.05 へ。いっぽう近い課題への効果は 0.44 から 0.46 で残る。Barnett & Ceci 2002 が整理したように、転移は何がどこへ運ばれるかの軸を指定しないかぎり、賛成派も反対派も別のものを指したままになる |
| 腑に落ちる説明は、たいてい正しい説明である | Lombrozo 2007 では、2つの原因で説明するほうが2倍確からしい条件でも56%が1つの原因の案を選び続けた。逆転にはおよそ4対1の差が必要で、確率を掛け合わせた値を明示された途端、単純なほうを選ぶ人は61%から17%へ落ちている。いっぽう Zemla et al. 2017 が現実の説明の評価を調べると、高く評価されたのは長くて原因の多い説明で、単純さは質を予測しなかった。腑に落ちる感じは、正しさの信号ではなく、その場面での読みやすさの信号である |
思考法には、道具として理想的な性質がある。学んだかどうかを、本人以外は確かめられないのだ。名前を覚えれば学んだことになり、使ったかどうかは自己申告で足りる。しかも使わなかった日には何も起きない——起きなかったことは記録されないので、検証もされない。皮肉なのは、この棚が並べる16の道具のうち、いちばん確かに効くのが、今日3つ書いて1つに丸を付ける、という手続きのほうだということである。名前は何も付いていないし、研修では売れない。
Q1. Abrami らが2015年に発表したメタ分析は、684件の研究から ____ の効果量を集計し、批判的思考の指導の平均効果を g+ = ____(95%信頼区間 .25 から .34)と報告した。組み合わせ別では、対話だけ 0.23、本物に近い問題だけ 0.25、両方で 0.32、そこに助言者の個別の手ほどきが加わった19件だけが ____ に届いた。穴埋め
Q2. Lombrozo が2007年に発表した実験2(144人)では、2つの原因で説明するほうが2倍確からしい条件でも ____% が1つの原因で説明する案を選び続けた。選択が逆転するには、確率でおよそ ____ 対1の差が必要だった。実験4で確率を掛け合わせた値を明示すると、単純な案を選ぶ人は61%から ____% へ落ちた。穴埋め
Q3. アブダクションが保証するものは何か。演繹・帰納との違いに触れて答えよ。一問一答
Q4. Sala & Gobet 2017 が示した、訓練が別の能力へ広がるかについての結果として、本文の内容に合うものはどれか。選択
Q5. この道具箱の5つの層を、番地の若い順に並べよ。(生み出す/推論のOS/全体の監視/整理と判断/現実への接続)並べ替え
紙かメモアプリを開く。今日か昨日、意外だと思った出来事を1件だけ選ぶ——返信が遅かった、いつもより混んでいた、うまくいくと思ったものが外れた。小さいもので構わない。1行で書く。次に、その出来事の説明を3つ書き出す。3つ目はたいてい無理やり出てくるが、無理やりで構わない。3つ書けたら、いま最善だと思うものに丸を付け、なぜそれを最善としたのかを1行だけ書く。最後に、書いたもの全体をもう一度読み返し、丸を付けた理由が「いちばん短いから」だけだったかどうかを確かめる。誰にも見せなくてよく、当事者に確かめる必要もない。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Abrami P.C., Bernard R.M., Borokhovski E., Waddington D.I., Wade C.A., Persson T. (2015) 'Strategies for Teaching Students to Think Critically: A Meta-Analysis', Review of Educational Research 85(2):275-314 — journals.sagepub.com
- Huber C.R., Kuncel N.R. (2016) 'Does College Teach Critical Thinking? A Meta-Analysis', Review of Educational Research 86(2):431-468 — journals.sagepub.com
- Sala G., Gobet F. (2017) 'Does Far Transfer Exist? Negative Evidence From Chess, Music, and Working Memory Training', Current Directions in Psychological Science 26(6):515-520 — journals.sagepub.com
- Barnett S.M., Ceci S.J. (2002) 'When and where do we apply what we learn? A taxonomy for far transfer', Psychological Bulletin 128(4):612-637 — pubmed.ncbi.nlm.nih.gov
- Lombrozo T. (2007) 'Simplicity and probability in causal explanation', Cognitive Psychology 55(3):232-257 — www.sciencedirect.com
- Zemla J.C., Sloman S., Bechlivanidis C., Lagnado D.A. (2017) 'Evaluating everyday explanations', Psychonomic Bulletin & Review 24(5):1488-1500 — link.springer.com