平均は0.41。ただし、607個の効果量のうち38%超はマイナス側にあった
フィードバックは効く——これは、平均の話としては正しい。同じ論文の同じページに、効果の38%超がマイナス側にあったと書いてあることは、あまり運ばれない。平均だけが運ばれ、ばらつきは置いていかれる。
返ってくるもののほうを見る
前の単位では、経験の量ではなく難度が効いていること、そしてその効き方がフィードバックを得られるかどうかで変わることを見た。ここではその上に、返ってくるものそのものを置く。
持ち場を狭めておく。聴き方や対話の技術は、友達の棚が扱った。評価面談の運用も、相談の受け方もここでは書かない。この単位が扱うのは、フィードバックという介入の効果が、どういう分布をしていたか、だけである。
平均は0.41
1996年に Psychological Bulletin へ出たメタ分析が、この分野でいちばん引かれる論文である。原典に当たる。
集められたのは131本の論文で、そこから607個の効果量が取り出された。もとになったのは12,652人の参加者と、23,663回の観測である。標本サイズで重みを付けた平均の効果量は d=0.41。つまり平均としては、フィードバックは成績を上げていた。
ここまでが、いちばんよく引用される部分である。
平均の下に何があるか
同じページに、続きが書いてある。607個の効果量のうち、38%を超えるものがマイナス側にあった。つまりフィードバックを受けた側の成績が下がっていた。
数え方を正確に書いておく。これは、38%の人が下がったという意味ではない。研究から取り出された効果の3分の1以上が、負の値だったという意味である。要旨のほうには「3分の1を超える」と書かれ、結果の節では「38%を超える」と書かれている。世に出回るときに丸まりやすいのは、当然ながら要旨の側の数字である。
そして、著者らはこのばらつきが偶然ではないことも数字で示している。効果量の分布の重み付き分散は0.97。いっぽう、標本の揺らぎだけで生じるはずの分散は0.09と見積もられた。10倍以上の開きがある。ばらつきは本物である、というのがこの論文の中心的な結論である。
平均が0.41で、分散が0.97。この2つの数字は、同じ分布についての記述である。片方だけを運ぶと、まるで別の分布の話になる。
何が符号を分けたか
では、上がる場合と下がる場合を分けているのは何か。
同じ著者らが1998年に出した短い解説論文では、こう書かれている——フィードバックという介入が、注意を自分自身へ向けさせたとき、成績を高めるのではなく損なう危険が高まる。そして冒頭にはこうある。フィードバックの効果は、これまで一度も一貫していないし、単純でもなかった。
注意の行き先が課題のほうに留まっているあいだは、指摘は手順の情報になる。行き先が自分の値打ちのほうへ移ると、同じ言葉が別のものになる。同じ内容の指摘が、受け取る側の注意の位置ひとつで、逆向きの効果を持ちうる——これが、分散0.97の中身である。
多面評価のあとに、どれくらい動いたか
実務でいちばん密度の高いフィードバックは、複数の相手からまとめて返ってくる形のものだろう。2005年に Personnel Psychology へ出たレビューが、24本の縦断研究を統合して、そのあとで評価がどれくらい動いたかを補正後の効果量で報告している。
直属の部下による評価で d=0.15(21件・7,705人)。上司による評価で d=0.15(10件・5,358人)。同僚による評価で d=0.05(7件・5,331人)。自己評価は d=−0.04(11件・3,684人)で、わずかに下を向いた。
目安として、この分野で小さいとされる効果量が0.20である。並んでいる数字は、そのどれもが小さいの手前にある。著者らは結論にこう書いている——多面的なフィードバックを受けたあとに、誰もが大きく改善すると期待するのは現実的ではない。
方向はプラスである。大きさが小さい、という話である。
「下がった」が報告されない場所
もう一つ、分布の見え方に効くことがある。どのレビューが、下がった例を報告しているかである。
2001年に出た組織現場のレビューは、43本の研究から68の適用例を取り出し、フィードバックは一様に成績を上げるわけではないと結論した。他の手立てと組み合わせたときに、効果の一貫性が上がるとも報告している。
2012年に Educational Research Review へ出た、チームへのフィードバックのレビューは59本の実証論文を扱った。成績についてのフィードバックを使った研究の半分は一貫して正の効果を報告し、残り半分は一部の指標にだけ効いて他には効かなかった。やり方についてのフィードバックを使った研究は、すべてが混在した結果だった。そして——負の効果を報告した研究は、1本も無かった。
1996年のメタ分析が38%の負の効果を数えられたのは、実験室の研究を含む広い範囲を集めたからである。現場のレビューで負の例が出てこないことは、現場では起きていないことの証拠にはならない。測られたか、報告されたか、集められたか——分布の左半分は、この3つのどこででも落ちる。
密度という言葉が指しているもの
この単位の名前にある密度は、少なくとも3つの別物を指している。どれだけ頻繁か、どれだけ早いか、どれだけ細かいか。
このうち頻度については、2011年に Organizational Behavior and Human Decision Processes へ出た実験がある。頻度を操作したところ、成績との関係は山なりになった。あるところまでは上がり、それを越えると下がる。著者らは、下がる区間を、注意の資源が使い尽くされて課題そのものに向ける労力が減るためだと説明している。多いほどよい、という前提は、この実験では支持されなかった。
ここで、減らせという話にはならない。減らしても増やしても、同じ分布の別の位置に移るだけである。分かっているのは、量そのものが効きどころではない、ということだけである。
時間・変化:ばらつきが平均に丸められるまで
1996年、論文の要旨には2つの数字が並んで書かれた——平均は0.41、そして3分の1を超えるものが成績を下げた。
その後、この論文は膨大に引用される。引用のたびに、前半だけが運ばれる。フィードバックは効く、平均の効果量は0.41である、と。後半は、注釈の位置へ移り、やがて注釈からも落ちる。
2020年代の実務の言葉づかいでは、こうなっている。フィードバックは高頻度であるほどよい。ここには、平均も分散も残っていない。残っているのは向きだけである。
落ちた順番を見ておくと分かりやすい。最初に落ちるのは分散、次に落ちるのは平均の値、最後まで残るのは符号。運ばれる過程で情報が減るとき、減り方には順番がある。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、平均を個人に当てはめることである。d=0.41 は、あなたが次に受け取る指摘の効き目ではない。607個の効果量が並んだ分布の、重心の位置にすぎない。
第二の妨げは、量を目標にすることである。頻度を上げれば密度が上がる、という言い換えは、少なくとも1つの実験で支持されなかった。
標本の偏りも断っておく。ここまでの証拠は、欧米の大学生や大企業の従業員を対象に採られたものが中心で、30人規模の組織を対象にした研究はほとんど見当たらない。学習の成果は自己申告で測られたものが多く、客観指標まで追った研究はその一部である。そして——フィードバックを求める人ほど、フィードバックを得やすい。学ぼうとする人ほど学ぶ機会を得やすい、という逆向きは、ここまでのどの研究でも排除できていない。
助けるのは、受け取った指摘について、そのとき自分の注意がどこを向いていたかだけを後から見ることである。内容の当否は判定しなくてよい。判定するのは、向きだけでよい。
最初の一歩は2分。直近1週間で受け取った指摘を1件だけ思い出し、そのとき注意が作業のほうに向いていたか、自分の評価のほうに向いていたかに印を付ける。
次の単位は 199「育成責任の分散」——ここでは、返ってくるものが平均の下でどう散らばっているかを見た。その上に、返す人を増やすとどうなるか、という問いを置く。増えるのは、返ってくるものだとは限らない。
- Kluger & DeNisi 1996(Psychological Bulletin 119(2):254-284)は131本の論文から607個の効果量を集めた。もとになったのは12,652人の参加者と23,663回の観測で、標本サイズで重みを付けた平均の効果量は d=0.41 だった
- 同じ論文の同じページに、607個の効果量のうち38%を超えるものがマイナス側にあったと書かれている。これは38%の人が下がったという意味ではなく、取り出された効果の3分の1以上が負の値だったという意味である。要旨では「3分の1を超える」、結果の節では「38%を超える」と書かれている
- 効果量の分布の重み付き分散は0.97、標本の揺らぎだけで生じるはずの分散は0.09と見積もられた。10倍以上の開きがあり、ばらつきが偶然ではないことがこの論文の中心的な結論である。平均0.41と分散0.97は同じ分布についての記述で、片方だけを運ぶと別の分布の話になる
- 同じ著者らの1998年の解説論文(Current Directions in Psychological Science 7:67-72)は、フィードバックが注意を自分自身へ向けさせたとき、成績を高めるのではなく損なう危険が高まると書いている。冒頭には、フィードバックの効果は一度も一貫していないし単純でもなかった、とある
- Smither, London & Reilly 2005(Personnel Psychology 58(1):33-66)は24本の縦断研究を統合し、多面評価のあとの改善を補正後の効果量で報告した。直属の部下による評価 d=0.15(21件・7,705人)、上司 d=0.15(10件・5,358人)、同僚 d=0.05(7件・5,331人)、自己評価 d=−0.04(11件・3,684人)。小さいとされる目安が0.20である
- Gabelica ら 2012(Educational Research Review 7(2):123-144)は59本の実証論文を扱い、成績についてのフィードバックの研究の半分が一貫して正、半分が一部の指標にだけ効いたと報告した。やり方についてのフィードバックの研究はすべて結果が混在し、負の効果を報告した研究は1本も無かった
- Lam ら 2011(Organizational Behavior and Human Decision Processes 116(2):217-228)は頻度を操作した実験で、フィードバックの頻度と成績の関係が山なりになることを示した。ある点を越えると下がり、その説明は、注意の資源が使い尽くされて課題に向ける労力が減るためだとされている
| よくある誤解 | 実際のところ |
|---|---|
| 具体的なフィードバックは、高頻度であるほどよい | Lam ら 2011 が頻度を操作した実験では、頻度と成績の関係は山なりになり、ある点を越えると下がった。説明は、注意の資源が使い尽くされて課題に向ける労力が減るためである。さらに Kluger & DeNisi 1996 では、607個の効果量のうち38%を超えるものがマイナス側にあった。量が効きどころではない、という話であって、減らせという話ではない |
| メタ分析で d=0.41 と出たのだから、フィードバックはおおむね効くと考えてよい | 同じ論文が報告した効果量の分布の重み付き分散は0.97で、標本の揺らぎだけで生じるはずの分散0.09の10倍以上ある。平均0.41と分散0.97は同じ分布についての記述であり、著者らの中心的な結論は、ばらつきが偶然では説明できないというほうである。平均だけを運ぶと、逆向きの例が丸ごと消える |
| 現場のレビューでは悪い結果が出ていないのだから、実務では害は起きていない | Gabelica ら 2012 のチームへのフィードバックのレビュー59本では、負の効果を報告した研究が1本も無かった。これは害が無いことの証拠にはならない。分布の左半分は、測られたか、報告されたか、集められたか、の3つのどこででも落ちる。1996年のメタ分析が38%を数えられたのは、実験室の研究を含む広い範囲を集めたからである |
0.41 という数字には、ひとつだけ弱点がある。覚えやすすぎることだ。0.97 のほうは覚えにくいうえ、話の途中で出すと場が静かになる。だから30年のあいだ、この論文は前半だけが引かれ続けた。皮肉なのは、この論文がいちばん力を入れて書いたのが後半だということである。著者たちは、ばらつきは偶然ではないと証明するために、標本誤差の分散まで計算してみせた。運ばれたのは、その手前の1行だった。
Q1. Kluger & DeNisi 1996 のメタ分析では、607個の効果量の重み付き平均は d=0.41 だったが、そのうち( )%を超えるものはマイナス側にあった。穴埋め
Q2. Kluger & DeNisi 1996 が、効果のばらつきは偶然では説明できないと結論した根拠となる2つの数字を挙げよ。一問一答
Q3. 同じ著者らの1998年の解説論文によれば、フィードバックが成績を損なう危険が高まるのはどういうときか。一問一答
Q4. Gabelica ら 2012 のチームへのフィードバックのレビュー59本で、負の効果を報告した研究は何本あったか。またそれをどう読むべきか。一問一答
Q5. Smither, London & Reilly 2005 の報告として、本文の内容に合うものはどれか。選択
直近1週間で自分が受け取った指摘を1件だけ思い出し、そのとき自分の注意が、作業のことに向いたか、自分の評価のことに向いたかに印を付ける。指摘の中身が正しかったかどうかは判定しない。相手が誰だったかも書かない。相手の言い方を評価する項目も作らない。印を付けるのは、自分の注意がどちらを向いていたか、その一点だけである。指摘を思い出せなければ、無かった、と記録すればそれで完了とする。仕事の場でなくてもよく、家のことでも、習い事でも、投稿への返信でもよい。印を付けたあと、その指摘に自分が何をしたかまでは、今日は書かなくてよい。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Kluger A.N., DeNisi A. (1996) 'The Effects of Feedback Interventions on Performance: A Historical Review, a Meta-Analysis, and a Preliminary Feedback Intervention Theory', Psychological Bulletin 119(2):254-284 — mrbartonmaths.com
- Kluger A.N., DeNisi A. (1998) 'Feedback Interventions: Toward the Understanding of a Double-Edged Sword', Current Directions in Psychological Science 7:67-72 — journals.sagepub.com
- Smither J.W., London M., Reilly R.R. (2005) 'Does Performance Improve Following Multisource Feedback? A Theoretical Model, Meta-Analysis, and Review of Empirical Findings', Personnel Psychology 58(1):33-66 — leeds-faculty.colorado.edu
- Alvero A.M., Bucklin B.R., Austin J. (2001) 'An Objective Review of the Effectiveness and Essential Characteristics of Performance Feedback in Organizational Settings (1985-1998)', Journal of Organizational Behavior Management 21(1):3-29 — www.tandfonline.com
- Gabelica C., Van den Bossche P., Segers M., Gijselaers W. (2012) 'Feedback, a powerful lever in teams: A review', Educational Research Review 7(2):123-144 — www.mitemainehealth.org
- Lam C.F., DeRue D.S., Karam E.P., Hollenbeck J.R. (2011) 'The impact of feedback frequency on learning and task performance: Challenging the “more is better” assumption', Organizational Behavior and Human Decision Processes 116(2):217-228 — eric.ed.gov