無能な人ほど自分を過大評価する、というあのグラフは、乱数からでも同じ形が出てくる
自分の判断の理由を、あなたは自分で報告できる。厄介なのは、その報告が本当に思い出したものなのか、たった今こしらえたものなのか、報告している本人にも見分けがつかないことのほうだ。
自分の思考を、自分で見張るという道具
メタ認知は、思考についての思考である。いま何をしているのか、進み具合はどうか——判断の最中に、判断そのものを見る位置を取る。呼び名はフレイヴェルが1979年に提案した整理に由来するが、枠組みは、効くかどうかの証拠ではない。
道具箱の中で、この道具だけは性質が違う。他の15個は、見る相手が自分の外にある。前提と結論、事例と法則、確率と頻度——どれも外に置いたものを見る。メタ認知だけは、見る相手が自分の思考であり、見るための装置は、見られる思考を作っているのと同じ場所にある。軸は1つに絞れる。自分の思考を監視するというこの道具だけは、その道具自身で点検できない。なお、覚え方や復習の間隔といった学習方略は、学習と成長の棚の持ち場なので踏み込まない。
値切り:よく引かれる、あのグラフ
研修資料に必ず出てくる曲線がある。横軸に習熟、縦軸に自信。初心者のところに高い山、少し学ぶと谷、熟練とともにゆるやかに戻る。説明はいつも同じだ——無能な人ほど自分を過大評価する。
元の研究はある。KrugerとDunningが1999年に Journal of Personality and Social Psychology へ発表した論文で、米国・コーネル大学の学部生が対象だ。ユーモアの判定課題(65人)では、下位4分の1の実際の順位は下から12パーセンタイル、自己評価は58パーセンタイル。文法課題(84人)では実際が10パーセンタイル、自己評価が61パーセンタイル。まず1つ、あの山と谷の曲線は、この論文には無い。論文にあるのは四分位ごとの折れ線で、絵は後から誰かが描き起こした。
そして、その折れ線に厄介な事情がある。下位4分の1を取り出せば、その群の順位の平均は定義上12.5あたりになる。誰がどう答えようと、そうなる。ここで自己評価が実力とまったく無関係な乱数なら、その平均は50。差は37.5ポイントである。人間の思い上がりは、1グラムも入っていない。
観測された46ポイント(実際12、自己評価58)のうち、37.5ポイントは乱数でも出る。残る8.5ポイントは、58が真ん中の50より上に寄っているぶん——多くの人が自分を平均より上と答える傾向のぶんだ。この37.5は論文の報告値ではなく、四分位に割ると算術的にそうなる数である。
Nuhferらが2017年に Numeracy 誌へ発表した論文は、自己評価と実測を1,154人ぶん集め、乱数によるノイズがどう効くかを検討した。名指しされたのは2つの図だ。四分位ごとに平均を並べる図と、縦軸に(自己評価−実測)、横軸に実測を取る図である。同じ測定値が両方の軸に入る図では、実力と自己評価が無関係でも、右下がりの直線が必ず現れる。
GignacとZajenkowskiが2020年に Intelligence 誌へ発表した研究は、一般市民929人に知能の自己評価と Advanced Raven's Progressive Matrices を実施し、四分位の図ではなく Glejser 検定と2次の回帰で確かめた。有意なばらつきの不均一さは見つからず、関係は本質的にすべて直線だった。結論は、効果の大きさは報告されてきたよりずっと小さいかもしれない、である。
だから、効果が存在しない、とは書かない。書けるのはこれだけだ——よく引かれるあのグラフは、その形だけでは主張を支えない。矛先は答えた人にも研究者にも向けない。おかしいのは、その図から山と谷の絵を描き起こし、名前を付け、研修資料の1枚目に貼った側だ。
探して見つからなかった——「最大30%向上」
設計資料には、こうあった。メタ認知訓練により学習効率が最大30%向上(Hattie & Timperley, 2007)。当たってみた。HattieとTimperleyが2007年に Review of Educational Research へ発表したこの論文は「The Power of Feedback」という題で、フィードバックのレビューである。報告されているのは、12のメタ分析・196件の研究・6,972の効果量を集計した平均効果量0.79という数字だ。訓練の実験ではないし、学習効率という指標も出てこない。
探したのは3か所。公開されている論文の全文、要旨と表、そして「学習効率が最大30%」に相当する表現と論文名を組み合わせた検索である。30%という数値には、たどり着けなかった。この論文が出所だという帰属は成り立たない。ある資料が別の資料を引く途中で、数値と出典が入れ替わっただけである。だからこの単位は、メタ認知の訓練について数値を掲げない。
後づけの説明——人は、自分がどう考えたかを自分では見られない
NisbettとWilsonが1977年に Psychological Review へ発表した論文「Telling More Than We Can Know」は、1つの現場実験を報告している。米国の商業施設に消費者調査の体裁で台を出し、通りかかった52人に4足のストッキングを並べ、どれがいちばん良いかを選ばせた。4足はすべて同一の品である。右端が左端のおよそ4倍選ばれた。
選んだ理由を尋ねると、生地の質、手ざわり、透け具合——理由は返ってくる。位置を挙げた人は1人もおらず、直接尋ねると事実上全員が否定した。論文の主張はこうだ。人が自分の認知過程を報告するとき、それは真の内省ではなく、あらかじめ持っている暗黙の因果理論にもとづいている。しかも本人の報告と、外から見た観察者の報告は強く一致していた。自分の判断の理由について、本人は観察者より有利な立場にいない。
30年近くたって、別の実験がこれを裏づけた。Johanssonらが2005年に Science へ発表した研究は、スウェーデンで120人に2枚の顔写真を見せて選ばせ、一部の試行では手品の手法でカードをすり替え、選ばなかったほうの写真を渡して理由を語らせた。その場で気づかれたのは13%。残りでは、参加者は選ばなかった写真について、選んだ理由を語った。その語りは、すり替えのない試行の語りと、感情の強さでも確信の度合いでも区別がつかなかった。
判断は先に起きる。説明は後から作られる。作られた説明は、本物と同じ手ざわりをしている。「私はこのとき、こういう思考法を使った」という報告は、この形式の報告である。
16の引き出しに戻る
この棚は道具箱だった。16の引き出しがあり、順番はない。必要なものを開けて、使う。
右端の列——効く範囲——は、どれも似た形をしている。「その外側」の中身は、16回とも同じ2つに帰着した。
一つめ。実験室と研修室で効いた道具は、部屋を出たとたんに効かなくなることが、何十年も繰り返し確かめられている。道具の名前は増えるのに、どこまで持ち出せるかは書かれない。右端の列は、道具の説明ではなく、持ち出せる距離の記録として読むのが正しい。
二つめ。人は、自分がどう考えたかを、自分では見られない。ストッキングを選んだ人も、すり替えられた写真の理由を語った人も、嘘はついていない。判断の理由を報告できないので、もっともらしい説明を作った。本人には、それが作られたものだという印が見えない。
ここから、思考法の本の作られ方も見えてくる。うまくいった判断を後から集め、当事者にどう考えたかを聞き、説明に名前を付ける。集めているのは判断の記録ではなく、後から作られた説明のほうだ。だから、この道具箱に入れておく価値があるのは道具の名前ではない。判断の前に、自分が何を考えたかを1行書いておくこと。
時間・変化:判断の前・最中・後で、見えるものが違う
判断の前には、見積もりが立てられる。これは書ける。最中には、ほとんど何も見えない。見る装置が、見られる思考を作っているのと同じ場所にあるからだ。後には、説明が作られる。自動で、素早く、本物と区別がつかない形で。何もしなければ、それがそのまま自分の履歴になる。
だからやることは1つに決まる。前に書く。最中は諦め、後は前に書いたものと突き合わせる。済んでから本当はどう考えたかを思い出そうとしても、思い出しているのではなく、作っているからだ。今日書いた1行は、明日の自分にとって唯一の外部証拠になる。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、この道具に自信の話をさせてしまうことだ。研究が測っていたのは自信ではなく、自己評価と実測のずれである。第二の妨げは、性格の話にすること。測れるのは2つ——書いた見積もりと実際との差、後から出てきた説明と前に書いた1行との食い違いだけだ。
標本の偏りを断っておく。この単位の証拠は、ほとんどが大学生を対象にした実験室課題と、数分から数十分で終わる作業から採られている。実験室で数分の課題として測られたものが、締切のある本物の判断にそのまま当てはまるとは限らない。ストッキングの実験は米国で1977年、顔写真の実験はスウェーデンで2005年、自己評価の研究は米国と欧州の参加者が中心で、日本語での追試はほとんど見当たらない。最後まで答えた人のデータは残るが、投げ出した人のデータは残らない。数字は向きだけ持ち帰るのが誠実である。
助けるのは、道具ではなく紙だ。最初の一歩は5分。今日した判断を1つ選び、この棚の道具のどれを使ったと思うかと、その理由を1行書く。最後に、その理由が判断の前からあったのか、いま作ったのかを吟味する。作ったものでも構わない。分かっている状態と、分からない状態は違う。
道具箱を閉じる
16の引き出しを開け終えた。1つだけ持ち帰るなら、棚卸し表の右端の列——どこまで効くと確かめられているか——を、道具ごとに1行で言えるようにしておくことだ。名前を覚えた人は道具を全部持っている。範囲を覚えた人は、出す場面を選べる。そしてこの最後の引き出しには、点検されないままの道具が1つ入っている。外から点検できるのは1つだけ——判断の前に書いた1行と、後から出てきた説明の、食い違いである。
- Kruger & Dunning 1999(Journal of Personality and Social Psychology 77(6):1121-1134)は米国・コーネル大学の学部生で4つの実験を行った。ユーモア判定課題(65人)では下位4分の1の実際の順位が下から12パーセンタイル、自己評価は58パーセンタイル。文法課題(84人)では実際10パーセンタイル、自己評価61パーセンタイル
- 四分位に割る操作そのものが差を作る。下位4分の1の実際の順位の平均は定義上12.5あたりで、自己評価が実力と無関係な乱数(平均50)でも差は37.5ポイントになる。観測された46ポイントのうち37.5がここから出て、残る8.5は自己評価58が50より上に寄っているぶんである。37.5は論文の報告値ではなく算術的にそうなる数である
- 16の道具にはそれぞれ確かめられた範囲があり、その外側で起きることは16回とも同じ2つに帰着した——実験室と研修室で効いた道具は部屋を出ると効かなくなること、そして人は自分がどう考えたかを自分では見られないこと
- Nuhfer ら 2017(Numeracy 10(1), 論文4)は自己評価と実測を1,154人ぶん集め、ランダムなノイズと図の慣習の効き方を検討した。問題は2つの図——四分位ごとに平均を並べる図と、縦軸に(自己評価−実測)、横軸に実測を取る図。同じ測定値が両方の軸に入るため、無関係でも右下がりの直線が現れる
- Gignac & Zajenkowski 2020(Intelligence 80, 論文番号101449)は一般市民929人に知能の自己評価と Advanced Raven's Progressive Matrices を実施し、Glejser 検定と2次の回帰で検証した。有意なばらつきの不均一さは見つからず、関係は本質的にすべて直線で、効果の大きさは報告されてきたよりずっと小さいかもしれないと結論した
- 「メタ認知訓練により学習効率が最大30%向上(Hattie & Timperley, 2007)」の30%は、論文全文・要旨と表・表現と論文名を組み合わせた検索の3か所を探したが、たどり着けなかった。この論文(Review of Educational Research 77(1):81-112)はフィードバックのレビューで、12のメタ分析・196件の研究・6,972の効果量から平均効果量0.79を報告している
- Nisbett & Wilson 1977(Psychological Review 84(3):231-259)は米国で52人に同一の品であるストッキング4足を選ばせ、右端が左端のおよそ4倍選ばれたと報告した。位置を挙げた人は1人もおらず、直接尋ねると事実上全員が否定した。Johansson ら 2005(Science 310(5745):116-119)はスウェーデンで120人の選んだ写真をすり替えたが、気づかれたのは13%だった
| よくある誤解 | 実際のところ |
|---|---|
| 無能な人ほど自分を過大評価する、という現象は有名な実験で確かめられている。あの山と谷のグラフがその証拠だ | まず、山と谷の曲線は元の1999年の論文には無い。論文にあるのは四分位ごとの折れ線で、そこには算術の問題がある。下位4分の1の実際の順位の平均は定義上12.5あたりで、自己評価が実力と無関係な乱数(平均50)でも差は37.5ポイントになる。観測された46ポイントの大半がここから出る。Nuhfer ら 2017 は、同じ測定値が両方の軸に入る図では無関係でも右下がりの直線が現れることを示し、Gignac & Zajenkowski 2020 は929人を Glejser 検定と2次の回帰で調べて、有意な不均一さも曲線も見つけなかった。効果が無いとまでは言えないが、あのグラフはその形だけでは主張を支えない |
| 自分がどう考えて決めたかは、落ち着いて思い出せば分かる | 1977年に米国で報告された実験では、同一の品であるストッキング4足のうち右端が左端のおよそ4倍選ばれたが、位置を理由に挙げた人は1人もおらず、直接尋ねると事実上全員が否定した。論文の主張は、人が自分の認知過程を報告するとき、それは真の内省ではなく、あらかじめ持っている暗黙の因果理論にもとづく、というものである。2005年のスウェーデンの実験では、選んだ写真をすり替えても気づかれたのは13%だった |
| メタ認知の訓練で学習効率が最大30%上がる、という研究がある | 出所とされる Hattie & Timperley 2007 は、Review of Educational Research に載ったフィードバックのレビューであって、メタ認知訓練の実験ではない。論文全文、要旨と表、表現と論文名を組み合わせた検索の3か所を探したが、30%にはたどり着けなかった。この論文が報告しているのは、12のメタ分析・196件の研究・6,972の効果量からの平均効果量0.79である |
メタ認知には、他の15個の道具にない特権がある。使えたかどうかを確かめる方法が、使った本人の報告しかないことだ。したがってこの道具は、いちばん使えていないときに、いちばん使えている気がする。しかもその報告は、いつでも用意できる。あなたが今日下した判断についても、たぶんもう1つ、立派な理由が用意されているはずだ——たった今、この文を読みながら作ったものでなければ。
Q1. 自分の判断についての説明ができあがる順に並べ替えよ。A その説明が記憶として残る/B 判断が下される/C もっともらしい原因が選ばれ、説明ができあがる/D 理由を尋ねられる並べ替え
Q2. 判断の「前」「最中」「後」で見えるものが違う。時間の順に並べ替えよ。A 見る装置が、見られる思考を作る場所と同じなので、ほとんど何も見えない/B 説明が自動で、本物と区別がつかない形で作られる/C 見積もりを書いて残すことができる並べ替え
Q3. 「メタ認知訓練により学習効率が最大30%向上(Hattie & Timperley, 2007)」について、本文はどこを探して何が分かったと書いているか。その論文が報告している数値も1つ挙げよ。一問一答
Q4. 成績下位4分の1の「実際12パーセンタイル、自己評価58パーセンタイル」という46ポイントの差の内訳として、正しいものはどれか。選択
Q5. 米国で1977年に報告されたストッキングの実験について、正しいものはどれか。選択
今日1回、5分。今日した判断を1つ選ぶ。大きさは問わない——買うものを決めた、返信の順番を決めた、やめると決めた、後回しにした、どれでもよい。次の3行を書く。1行目:この棚の道具のどれを使ったと思うか(演繹、帰納、類推、アブダクション、実体、意味、証拠、構造化思考、システム思考、トレードオフ思考、発散思考、ラテラル思考、逆算思考、確率的思考、仮説思考。どれでもないと思うなら「どれでもない」と書く)。2行目:そう思う理由を1行で書く。3行目:その理由が判断の前から自分の中にあったのか、いま書きながら作ったのかを吟味し、「前からあった」「いま作った」「分からない」から選んで、手がかり(前に書いたメモがある、誰かに話していた、など)を添える。書いたら1度読み返す。「いま作った」でも構わない——突き合わせる相手を1つ作るための課題である。誰にも見せなくてよい。他人の判断については書かない。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Kruger J., Dunning D. (1999) 'Unskilled and Unaware of It: How Difficulties in Recognizing One's Own Incompetence Lead to Inflated Self-Assessments', Journal of Personality and Social Psychology 77(6):1121-1134 — psycnet.apa.org
- Nuhfer E., Fleisher S., Cogan C., Wirth K., Gaze E. (2017) 'How Random Noise and a Graphical Convention Subverted Behavioral Scientists' Explanations of Self-Assessment Data: Numeracy Underlies Better Alternatives', Numeracy 10(1), Article 4 — digitalcommons.usf.edu
- Gignac G.E., Zajenkowski M. (2020) 'The Dunning-Kruger effect is (mostly) a statistical artefact: Valid approaches to testing the hypothesis with individual differences data', Intelligence 80, 101449 — www.sciencedirect.com
- Hattie J., Timperley H. (2007) 'The Power of Feedback', Review of Educational Research 77(1):81-112 — journals.sagepub.com
- Nisbett R.E., Wilson T.D. (1977) 'Telling More Than We Can Know: Verbal Reports on Mental Processes', Psychological Review 84(3):231-259 — home.csulb.edu
- Johansson P., Hall L., Sikström S., Olsson A. (2005) 'Failure to Detect Mismatches Between Intention and Outcome in a Simple Decision Task', Science 310(5745):116-119 — www.science.org