「下手なほど過信する」というあの図は、乱数でもだいたい描ける
自分の演奏を、自分は一度も客席で聴いたことがない。書いている線は、自分の手と筆で隠れている。踊っている自分を見るには鏡が要るが、鏡を見た瞬間に視線が死ぬ。芸道で最初に不足するのは、才能でも時間でもなく、座席である。
前の単位を受ける:本番は終わった。誰も採点表をくれない
前の単位で扱ったのは、本番で崩れる仕組みだった。自分の動きに注意が向くと、自動化されたものが壊れる。手順を先に決めておけば、その注意を外へ逃がせる。
では、本番が終わったあとはどうするのか。ここからが、芸道でいちばん人手の足りない場所である。学業なら答案が返ってくる。職業なら上司が何か言う。芸には、一瞬で終わった本番と、拍手か沈黙しか残らない。採点表は、自分で作るしかない。
先に宣言しておく。この単位は認知バイアスの一覧表を扱わない。総覧は思考法の棚の持ち場である。ここで扱うのは、いま何かの技を身につけようとしている人の手元に狙い撃ちで効いてくる話を、3つだけだ。
芸道の非対称:自分の演奏は、自分の席から聴けない
まず、物理の話から入る。芸道の自己観察が難しいのは、性格が甘いからではない。座席の問題だからだ。
管楽器の奏者は、自分の楽器の内側に耳がある。歌い手は、外気を通った自分の声ではなく、頭蓋を通った低い方に寄った音を聴いている。書き手の視界では、いま引いている線が手と筆に隠れる。ダンサーは自分の全身を見られないので鏡を使うが、鏡を見た瞬間に視線が正面から外れ、その視線こそが評価される対象である。料理人の舌は、同じ味を30分嗅ぎ続けたあとの舌だ。
つまり芸道の自己評価は、動機の問題ではなく、観測点の問題である。あなたは、あなたが立てないただ一つの位置から評価される。
この非対称は、測ってみると想像より大きい。デイヴィスらが2006年に医学教育で行った系統的レビューは、725本の論文から条件を満たす17件を選び、自己評価と外部から観察された能力の比較を20件抽出した。そのうち13件で、関係はほとんどないか、あるいは逆向きだった。しかも自己評価がもっとも不正確だったのは、技能がもっとも低い者と、自信がもっとも高い者である。医師という、記録も試験も評価制度も揃っている職種でこれである。
ダニング=クルーガーを、正しく読む
ここで、この話をするとほぼ必ず出てくる名前を扱う。扱わないと、あなたが別の場所で雑に受け取ってくるからだ。
クルーガーとダニングが1999年に発表した研究は、参加者にユーモア・論理・文法の課題を解かせ、そのうえで自分の成績と、他の参加者と比べた自分の順位を推定させた。成績の低い群ほど、自分の順位を大きく高く見積もった。エーリンガーらが2008年にこの系列のデータを整理し直したところ、論理課題の下位四分位の参加者は、実際には13.2パーセンタイルの位置にいながら、自分の成績を52.3パーセンタイル、自分の一般的な能力を54.9パーセンタイルと見ていた。おおむね40ポイント分の上振れである。
ここまでが、世間で流通している部分だ。ここからが値切りである。
一段階目。ナフアーらが2016年に発表した研究は、自分の科学リテラシーを自己評価した1,154人分の対データを使い、同じ形の図が乱数からどれだけ出てくるかを調べた。結論は身も蓋もない。自己評価から実際の成績を引いた値を、実際の成績に対して描くグラフや、成績の四分位ごとに平均を集計して折れ線でつなぐグラフは、信号がまったくない乱数でも、あの見慣れた形を生む。図の作り方そのものが人工物を作っていた。
二段階目。ギニャックとザイェンコフスキが2020年に発表した研究は、地域社会から集めた929人に、知能の自己評価と客観的な課題を両方行わせた。ダニング=クルーガーの仮説が正しければ、能力が低い側で自己評価のばらつきが大きくなる——統計の言葉で不等分散が出る——はずである。出なかった。客観的な能力と自己評価の関係は、ほぼ完全に直線だった。著者らの結論は、この現象がある程度もっともらしい技能もあるかもしれないが、効果の大きさはこれまで報告されてきたよりずっと小さい可能性がある、というものだ。
仕掛けは2つの合成である。ひとつは平均への回帰。自己評価と実力が完全に相関しない以上、下の人は上に、上の人は下に見積もりがずれる。もうひとつは、人はだいたい自分を平均より上だと思っている、というありふれた傾向。この2つを足すだけで、あの図の形はほぼ出る。
公平のために書いておくと、話は終わっていない。エーリンガーらの2008年の論文は、まさにこの2つで説明できるかを検証し、上位群が自分を低く見積もる部分はよく説明できるが、下位群の大きな過大評価は説明しきれないと報告している。この現象は「全部が計算の産物」でも「教科書どおりの心理法則」でもない。効果は宣伝より小さく、議論はまだ現役だ。
芸道に持ち帰るのは、順位ではなく誤差の大きさのほう
では、この論争から何を持って帰るのか。順位の話は捨てていい。あなたが自分を全国で何番目だと思っているかは、稽古場では一円の価値もない。
持ち帰るのは、もっと地味な一行だ。自己評価の誤差は、技能が低い側でより大きい。始めたばかりの人ほど、自分の記録を読む力がない。これはダニング=クルーガーの解釈を全部認めなくても、デイヴィスらのレビューからも、知覚の弁別の話からも同じ方向に出てくる。この一行が生む実務的な結論はひとつ——始めたばかりのときこそ、外部の目が要る。そして外部の目には3種類しかない。人、記録、そして先に決めた観点である。
録画は、見れば効くわけではない
記録の話に入る。ここでもう一段、期待値を下げておく。
メディンガーらが2021年に発表した系統的レビューは、体育の場面での映像フィードバックについて2,030件を検索し、基準を満たした11件を分析した。全体としては、映像による視覚的フィードバックは言語だけのフィードバックより有効に見える。ただし内訳が重要で、採用された11件のうち10件では、学習者は自分の動きの映像に加えて、教師からの言語的なフィードバック——主な誤りと、見るべき要点——を受け取っていた。映像だけを渡された条件ではない。さらに、動きの経験が少ない年少の学習者は、経験のある学習者より映像から得るものが少なかった。著者らは、学習の初期段階では言語によるフィードバックのほうが選択肢として妥当だと述べている。
これを大人の学び直しに翻訳すると、こうなる。録画は情報ではない。情報になるのは、見る前に観点を決めたときだけだ。何も決めずに自分の動画を再生した人が受け取るのは、たいてい一つの情報しかない——自分は思っていたより下手だ。それは、すでに知っていたことである。
目と耳は、混ぜずに使う
もうひとつ、記録の見方に効く実験がある。少し寄り道に見えるが、実務は明確だ。
ツァイが2013年に発表した研究は、国際音楽コンクールの決勝進出者の記録を使い、7つの実験で1,164人に優勝者を当てさせた。三択なので偶然は33%である。映像だけを見た素人の正答率は46.4%から52.5%、音だけを聴いた場合は25.5%から28.8%。つまり映像だけのほうが偶然を上回り、音だけは偶然以下だった。プロの音楽家でも同じで、映像だけで46.6%から47.0%、音だけで20.5%から25.7%。音と映像を両方与えると、どちらの群も偶然の水準に戻った。
この結果は派手なので、当然の値切りが来る。メーアらが2018年に発表した追試は、実験1で原研究と同じ映像を使い、N = 375で効果を再現した。ところが実験2(N = 300)と実験3(N = 150)で、映像を変えたり演奏の質の差を明確にしたりすると効果は消え、実験3では音声条件の68.4%が映像のみの45.2%を大きく上回った。原研究の解釈可能性は限定的だ、というのが著者らの結論である。
断定はできない。しかし、稽古場に持ち込む形はどちらの結果からも同じだ。音と映像は、混ぜると互いを汚染する。自分の記録を見返すときは、音だけで一度通し、映像だけで一度通す。同時に流さない。これは30秒の手間で、判断の質を上げる数少ない操作である。
時間・変化:自己観察の精度は、技能より遅れて上がる
時間の話を一本立てておく。この単位でいちばん誤解されるのが、ここだからだ。
始めて最初の数週間、あなたの記録はほとんど情報を持たない。見ても聴いても、下手だということしか分からない。それは記録が悪いのではなく、読む側の弁別の解像度がまだ低いからだ。この棚の2番目の単位で扱った知覚の弁別が育つまで、記録は鏡ではなく、単なる罰である。
数か月経つと、記録の意味が変わる。同じ映像を見ても、前は見えなかった箇所が見えるようになる。ここで多くの人が過去の自分の記録を消したくなるが、消してはいけない。半年前の映像は、いまのあなたの弁別能を測る唯一の物差しである。半年前に気づかなかったことにいくつ気づけるか——それが上達の、数少ない直接の証拠だ。
そして較正そのものも動く。クルーガーとダニングの4番目の研究では、短い訓練を受けた下位群の見積もりのずれは、訓練前より小さくなった。自己評価の精度は性格ではなく、訓練で動く量である。ただしこれは1999年の実験室課題であって、あなたの楽器でも同じ速さで動く保証はない。
妨げるもの、助けるもの、最初の一歩
標本の断りを先に入れる。ここで挙げた研究は、医学教育・大学生・体育の授業・音楽コンクールと場面がばらばらで、参加者は欧米に偏り、多くが実験室の一回きりの課題である。向きは信用してよいが、大きさをあなたの稽古場にそのまま持ち込めるものではない。
妨げるのは、記録を全部見ることだ。10分の録画を10分かけて見る人は、たいてい最初の30秒で気分を悪くし、残りの9分半を上の空で流す。もうひとつは、気分のいい日にだけ見返すこと。これをやると、記録は評価の道具ではなく自己肯定の道具になる。
助けるのは、観点を先に紙に書くことだ。1回の見返しにつき観点は1つ。見る前に書き、見たあとにその観点についてだけ一行書く。書かないことが技術である。
最初の一歩は5分で終わる。今日の稽古の90秒だけを録る。録る前に、見る観点を1つだけ書く。たとえば右手の高さ、語尾の長さ、包丁を置く位置。それから音だけで1回、映像だけで1回通す。その観点についてだけ一行書く。
次の単位は 078「稽古設計力」——この一行を稽古の設計に変換する。何を何分、どの順で、どこで休むか。そして技能が固まるのは、練習している最中ではないという話に入る。
- Davis et al. 2006(JAMA 296(9):1094-1102):725本の論文から17研究を採用し、医師の自己評価と外部から観察された能力の比較20件を抽出。うち13件で関係はほとんどないか逆向きだった。自己評価がもっとも不正確だったのは、技能がもっとも低い者と自信がもっとも高い者
- Kruger & Dunning 1999(JPSP 77(6):1121-1134):ユーモア・論理・文法の課題で、成績下位の参加者ほど自分の順位を大きく高く見積もった。第4研究では短い訓練後に下位群の見積もりのずれが小さくなり、自己評価の精度は訓練で動く量だと示された
- Ehrlinger et al. 2008(OBHDP 105(1):98-121):論理課題の下位四分位は実際には13.2パーセンタイルにいながら、自分の成績を52.3、一般的能力を54.9パーセンタイルと見ていた。回帰効果と平均以上効果は上位群の過小評価をよく説明するが、下位群の過大評価は説明しきれないと報告
- Nuhfer et al. 2016(Numeracy 9(1) Article 4):1,154人分の対データを用いた乱数シミュレーション。自己評価から実測を引いた値を実測に対して描く図や、四分位ごとに集計する折れ線は、信号がゼロの乱数でもダニング=クルーガー型の形を生む。図の作り方が人工物を作っていた
- Gignac & Zajenkowski 2020(Intelligence 80:101449):地域社会の929人で知能の自己評価と客観課題を測定。仮説が予測する不等分散は検出されず、関係はほぼ完全に線形だった。効果の大きさは従来の報告よりずっと小さい可能性があると結論
- Mödinger, Woll & Wagner 2021(German Journal of Exercise and Sport Research 52(3):447-460):2,030件から11件を分析。映像フィードバックは言語のみより有効に見えるが、11件中10件では映像に教師の言語フィードバック(主な誤りと要点)が付いていた。経験の少ない学習者ほど映像から得るものが少ない
- Tsay 2013(PNAS 110(36):14580-14585):7実験・1,164人。優勝者を当てる正答率は映像のみで素人46.4-52.5%・プロ46.6-47.0%(偶然は33%)、音のみでは20.5-28.8%と偶然以下。ただしMehr et al. 2018(PLOS ONE 13(9):e0202075)の追試では、実験1(N=375)で再現された効果が実験2・3で消え、実験3では音声条件68.4%が映像のみ45.2%を上回った
| よくある誤解 | 実際のところ |
|---|---|
| 下手な人ほど自分を過大評価する、というのは確立した心理法則だ | 1,154人分の対データを使った乱数シミュレーションでは、信号がゼロでもあの図の形が出た。929人を対象にした検証でも、仮説が予測する不等分散は検出されず、関係はほぼ完全に線形だった。効果が完全に消えたわけではないが、宣伝されている大きさではない |
| 自分の演奏を録画して見返せば、客観的に評価できる | 2,030件から採用された11件の分析では、有効だった条件の10件までが、映像に加えて教師の言語的な指摘——主な誤りと見るべき要点——を伴っていた。経験の浅い学習者ほど映像単独から得るものが少ない。録画は、見る観点を先に決めたときだけ情報になる |
| 自己評価が甘いのは、その人の性格や覚悟の問題だ | 芸道の自己評価が難しいのは観測点の問題である。奏者は楽器の内側に耳があり、書き手の視界では線が手で隠れ、ダンサーは鏡を見た瞬間に視線が評価対象から外れる。記録も評価制度も揃っている医師でさえ、20比較のうち13で自己評価と客観評価の関係はほとんどないか逆だった |
自己評価の研究には、少し笑える構造がある。人が自分をどれだけ正しく測れないかを調べた分野が、その測り方そのものを間違えていた、という話だからだ。図の描き方を変えたら、有名な法則の相当部分が乱数に化けた。ここから引き出せる教訓は、たぶん「自分を疑え」ではない。自分を疑うのは誰でもできるし、しかも安上がりに気分がいい。効くのはもっと退屈なほうだ——見る前に、何を見るかを一行書く。それだけで、あなたの録画は罰から道具に変わる。
Q1. Davis らの系統的レビューは____本の論文から____研究を採用し、医師の自己評価と外部から観察された能力の比較____件を抽出した。そのうち____件で、関係はほとんどないか逆向きだった。穴埋め
Q2. ダニング=クルーガー効果に対する2つの値切りを、それぞれ研究の規模とともに説明せよ。また、この現象が完全には否定されていない理由も答えよ。一問一答
Q3. 映像フィードバックについての系統的レビュー(2,030件から11件を採用)が示したのはどれか。選択
Q4. 音楽コンクールの優勝者を当てる実験(7実験・1,164人)の3条件の正答率と偶然の水準を答え、追試がそれをどう修正したかも述べよ。一問一答
Q5. 本文が推奨する、記録を情報に変える手順を正しい順に並べよ。(映像だけで1回通す/観点を1つ紙に書く/その観点について一行書く/90秒だけ録る/音だけで1回通す)並べ替え
今日の稽古や練習から、90秒だけを録画または録音する。録る前に、見る観点を1つだけ紙かメモに書く(例:右手首の高さ/語尾の伸ばし方/包丁を置く位置/踏み込みの深さ)。観点は1つに限る。録ったら、まず音だけで1回通す(映像は伏せるか目を閉じる)。次に映像だけで1回通す(音を切る)。最後に、書いた観点についてだけ一行書く。それ以外は何も書かない。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Davis D.A., Mazmanian P.E., Fordis M., Van Harrison R., Thorpe K.E., Perrier L. (2006) 'Accuracy of physician self-assessment compared with observed measures of competence: a systematic review', JAMA 296(9):1094-1102 — jamanetwork.com
- Kruger J., Dunning D. (1999) 'Unskilled and unaware of it: How difficulties in recognizing one's own incompetence lead to inflated self-assessments', Journal of Personality and Social Psychology 77(6):1121-1134 — www.semanticscholar.org
- Ehrlinger J., Johnson K., Banner M., Dunning D., Kruger J. (2008) 'How chronic self-views influence (and potentially mislead) estimates of performance / How unaware are the unskilled? Empirical tests of the (absent) self-insight among the incompetent', Organizational Behavior and Human Decision Processes 105(1):98-121 — socialvisionlab.pre.ss.ucla.edu
- Nuhfer E., Cogan C., Fleisher S., Gaze E., Wirth K. (2016) 'Random number simulations reveal how random noise affects the measurements and graphical portrayals of self-assessed competency', Numeracy 9(1), Article 4 — digitalcommons.usf.edu
- Gignac G.E., Zajenkowski M. (2020) 'The Dunning-Kruger effect is (mostly) a statistical artefact: Valid approaches to testing the hypothesis with individual differences data', Intelligence 80:101449 — www.sciencedirect.com
- Mödinger M., Woll A., Wagner I. (2021) 'Video-based visual feedback to enhance motor learning in physical education—a systematic review', German Journal of Exercise and Sport Research 52(3):447-460 — link.springer.com
- Tsay C.J. (2013) 'Sight over sound in the judgment of music performance', Proceedings of the National Academy of Sciences 110(36):14580-14585 — www.pnas.org
- Mehr S.A., Scannell D.A., Winner E. (2018) 'Sight-over-sound judgments of music performances are replicable effects with limited interpretability', PLOS ONE 13(9):e0202075 — journals.plos.org