「訓練すれば評価者の目は揃う」——だが査読では、訓練は評価の質を高めるが、限定的で、減衰し、評価者に根ざす差は残る
訓練すれば評価者の目は鍛えられ、揃う、と教わる。だが査読の到達点は、もっと慎重だ。評価者訓練は評価の質を確かに高める——寛大化もハローも減らす。ただし効果は限定的で、時間とともに減衰し、そもそもばらつきの主な源は評価者そのものに根ざしていて、訓練だけでは消えない。目は鍛えられるが、揃いきりはしない。縮められる差と、残る差を、分けて見るのがこの単位の答えである。
評価の質は、まず「見る人」から
前の単位では、評価のばらつきを、会議で揃えようとする試み——キャリブレーション——まで扱った。ここでは、その一歩手前にある、評価する人の目そのものを、訓練で鍛えられるのかを扱う。ここから段はひとつ進んで、制度の骨格を組む青の段から、評価の質を問う緑の段に入る。
この棚の読者は、人の処遇を自分が決める立場にある人だ。数人のチームの評価をつける代表、はじめて部下の査定をする店主、家業で働く家族の働きを見て取り分を決める人——誰であってもよい。ここで言う評価者訓練(rater training)とは、評価する人に、何を・どう見るかを教える研修のことである。とくによく知られるのがFOR訓練(frame-of-reference訓練=「この行動なら、この評点」という共通のものさしを、あらかじめ頭に入れる訓練)だ。
具体的には、評価者訓練はいくつかのことを教える。評価の基準を言葉でそろえる、ありがちな偏り——甘くつけすぎる、一つの長所で全体を良く見てしまう——に気づかせる、同じ事例に模擬的に評点をつけて答え合わせをする。研修の名前や実施する会社はさまざまだが、狙いはおおむね、評価者の頭の中のものさしを、共通のものへ近づけることにある。名前の華やかさより、この狙いのほうを覚えておくとよい。読者が数人の店やチームなら、外部の研修に頼らなくても、この狙いは日々の中で追える——同じ場面に自分ならどうつけるかを、記録に照らして確かめるだけでも、ものさしは共通のものに近づいていく。
よく聞くのは、「訓練すれば、評価者の目は鍛えられ、揃う」という言い方だ。この単位は、その言い方が半分正しく、半分は言いすぎであることを見る。
ひとつ、この棚全体を貫く見方を、緑の段の入口でも思い出しておく。制度の精密さと、納得感は、別物である。 評価のものさしをどれだけ細かく作り込んでも、それを使う人の目が自動で揃うわけではない。むしろ評価の科学が最も確かに示してきたのは、評価者の目は、そう簡単には揃わないという事実のほうだ。だからこの単位は、訓練という手立てを、過大にも過小にも見積もらずに測る。
訓練は効く——ただし、限定的に
まず、効くほうから。Woehr と Huffcutt が1994年にまとめた定量レビュー(複数の研究を数量的に統合したメタ分析)は、評価者訓練が評価の質を高める効果を持つことを示した。Roch らが2011年に更新したFOR訓練のメタ分析も、FOR訓練は評価の正確さに効くことを確かめている——ただし、その効果は限定的で、万能ではない。
なぜ効くのか。Gorman と Rentsch が2009年に示したのは、FOR訓練が効くのは、評価者の頭の中のスキーマ(何をどう評価するかの枠組み)の精度が上がるからだ、という機序である。さらに古く、Bernardin が1978年に示した研究は、訓練が寛大化(全体に甘くつけてしまう傾向)やハロー(一つの良い印象で全体を高くつけてしまう傾向)を減らすことを扱った——ただし、これも文脈しだいだ。つまり「訓練しても無駄」ではない。効く。だが、「効く」と「目が完全に揃って万能になる」は、別のことである。
「限定的」とは、こういうことだ。訓練を受けた評価者は、受けない評価者より、同じ行動をより近い評点で捉えるようになる——だが、その差が完全に消えるわけではないし、あらゆる評価場面で同じだけ効くわけでもない。効き方は、訓練の型(何をどう教えるか)や、評価する対象の難しさによって変わる。だから「研修を一度受けたから、この評価は正確だ」とは言えない。効いた、とは言えても、揃った・正確になった、とまで飛躍はできない。効果量の細かな数値まではここでは断定しないが、効くという向きと、限定的だという但し書きは、どちらも外さない。
効果は、減衰する
次に、値切りの核心。効果は、時間とともに薄れる。Gorman らが2017年に行った、アセスメントセンター(評価者が候補者を多面的に見る場)の訓練効果の保持を調べた研究は、訓練で高めた評価の質が、時間の経過とともに保たれにくいことを示した。一度鍛えた目も、使い続け、繰り返し確かめなければ、元へ戻っていく。
さらに根の深い話がある。Landy と Farr が1980年にまとめた評価研究の大きなレビュー(数多く引用されてきた古典)は、評価のばらつきの主な源は評価者そのものに根ざしており、評価様式や訓練だけでは完全には消えないことを整理した。だから訓練は、一回で終わるイベントではなく、反復と、現場の設計(何を記録し、いつ見直すか)とセットにして初めて維持される。
ここには、直感に反する含みがある。評価者の腕は、一度身につけたら固定される技能ではない。 使わなければ鈍り、確かめなければずれていく。だから、良い評価者を「育てた」で話を終えると、その良さは静かに目減りしていく。維持には、評点をつけたあとで基準に照らして見直す、似た事例を持ち寄って擦り合わせる、といった日常の反復が要る。長い目で見れば、一回きりの研修の予算より、この反復を回す仕組みのほうが効く。
なぜ、目は完全には揃わないのか
同じ行動を見ても、見る人によって重みが違う。何を重要と感じるか、どの場面が記憶に残るか——そこが人ごとに違う。訓練は、この差を縮める。だが、ゼロにはしない(Landy & Farr 1980)。
ここで、姿勢を一つ決めておく。過信も、放棄もしない。 「訓練すれば目は揃う」を目標に掲げると、揃わずに残った差を、評価者個人の努力不足のせいにしがちだ。だが残るのは、たいてい努力の問題ではなく、人が人を評価するという営みの構造から来る差である。訓練は、その差を縮める道具であって、消し去る魔法ではない。縮められる差と、残る差を、分けて見るほうがよい。
もう一歩、踏み込む。評価者に根ざす差は、能力の優劣だけを意味しない。人によって、丁寧さを重く見る人もいれば、成果の量を重く見る人もいる。どちらが正しいという話ではなく、同じ制度の下でも、重みの置き方が違えば評点は違う、という話だ。この差は、訓練で完全にはならされない。だからこそ、評価を一人の目だけで確定させず、複数の目で照らし合わせる仕組み——前の段で扱ったキャリブレーションのような——が、訓練と並んで要る。訓練と照らし合わせは、どちらか一方ではなく、両輪である。
時間・変化:1978年から今へ
順に置く。1978年Bernardin が訓練による寛大化・ハローの低減を、1980年Landy と Farr が評価者に根ざす差の深さを、1994年Woehr と Huffcutt が訓練効果のメタ分析を示した。2009年Gorman と Rentsch がFOR訓練の効く機序を、2011年Roch らが更新メタで効果の限定を、2017年Gorman らが効果の減衰を確かめた。
この数十年で確からしくなったのは、「訓練すれば目は揃う」ではない。確からしくなったのは、訓練は評価の質を高めるが、その効果は限定的で、時間とともに減衰し、評価者に根ざす差は残る、という慎重な向きのほうである。
言い換えれば、この数十年でわかったのは、良い問いが「どうやって目を完全に揃えるか」ではない、ということでもある。目は完全には揃わない。だから問いは、揃わないことを前提に、どこまで縮められるか/残る差をどう扱うかへと移っていく。訓練は、その縮める側の主力の一つだが、唯一ではない。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、一度の訓練で目が完成したという過信と、その裏返しの、どうせ揃わないという放棄だ。どちらも、効くが限定的で減衰する、という実像を外している。もうひとつの妨げは、訓練の効果を、他人と一致したかどうかだけで測ることである——揃うことは大事だが、それがすべてではない。
助けになるのは、他人と目を揃える前に、自分の目が、時間の中でぶれていないかを、自分の評価記録で確かめることだ。ものさしは、他人との一致より先に、自分の中で一定であることが土台になる。
付け加えれば、訓練が効いたかどうかを、他人との一致率だけで判定しないことも大事だ。一致率は、上げようと思えば、みなが無難な中央の評点に寄せるだけでも上がってしまう——それは目が揃ったのではなく、区別することをやめただけかもしれない。効いたかどうかは、一致の数字より、同じ基準を、似た事例に一貫して当てられるようになったかで見るほうが、実像に近い。揃って見えることと、正しく見分けられることは、混ぜないでおく。
最初の一歩は10分。自分が過去につけた評価を数件見返し、似たような行動に対して、自分の評点や基準がぶれていないかを書き出す。他人の評価と突き合わせる必要はない。従業員を新たに観察する必要もない——自分がすでに書いた評価の記録だけで、自分のものさしの一貫性を見る。ぶれている箇所が見つかれば、それが、自分の目を鍛え直す最初の手がかりになる。
一人で全部を回している場合も、同じ形でよい。比べる相手の評価が無くても、過去の自分の評点は、いまの自分にとっての比較対象になる。 半年前の自分と、いまの自分とで、同じような働きへの評価がずれていれば、それは制度が変わったのか、自分の目が動いたのかを考える入口になる。誰かを測り直す前に、まず自分のものさしを一定にしておく——それが、鍛えるという言葉の、地に足のついた中身である。
次の単位は 438「目標を正しく立てさせるには?」——評価する目を鍛える話から、評価の的になる目標そのものを、どう立てるのかへ進む。
- この棚の読者は人の処遇を自分が決める立場にある人で、評価者訓練(rater training=評価する人に何をどう見るかを教える研修)を扱う。とくにFOR訓練(frame-of-reference訓練=この行動ならこの評点という共通のものさしを頭に入れる訓練)が知られる。俗説『訓練すれば目は鍛えられ揃う』は半分正しく半分は言いすぎで、これは緑の段(評価の質)の入口の単位である
- 訓練は効く。Woehr & Huffcutt 1994の定量レビュー(メタ分析)は評価者訓練が評価の質を高めることを、Roch 2011の更新メタはFOR訓練が評価の正確さに効くこと(ただし限定的)を示した。効果量の具体数値は逐語未取得のため断定しないが、効くという向きははっきりしている
- 訓練が効く機序は、評価者の頭の中のスキーマ(何をどう評価するかの枠組み)の精度が上がることにある(Gorman & Rentsch 2009)。さらにBernardin 1978は訓練が寛大化(全体に甘くつける傾向)やハロー(一つの良い印象で全体を高くつける傾向)を減らすことを示した——ただし文脈依存で、ハローは評価文脈の研究として扱い一般認知バイアスのカノンには寄せない
- 効果は減衰する。Gorman 2017のアセスメントセンター訓練保持研究は、訓練で高めた評価の質が時間とともに保たれにくいことを示した。一度鍛えた目も使い続け繰り返し確かめなければ元へ戻る。だから訓練は一回のイベントではなく、反復と現場の設計(何を記録しいつ見直すか)とセットにして初めて維持される
- ばらつきの主な源は評価者そのものに根ざしており、評価様式や訓練だけでは完全には消えない(Landy & Farr 1980の古典レビュー)。同じ行動を見ても見る人によって重みが違うためで、訓練はこの差を縮めるがゼロにはしない。揃わずに残った差を評価者個人の努力不足のせいにせず、構造から来る差として認める
- 確からしくなったのは『訓練すれば目は揃う』ではなく、訓練は評価の質を高めるが限定的で減衰し評価者に根ざす差は残る、という向きである。過信(一度の訓練で目が完成したと思う)も放棄(どうせ揃わないと決めつける)もせず、縮められる差と残る差を分けて見る。訓練の効果を他人と一致したかどうかだけで測らない
- 最初の一歩は10分。自分が過去につけた評価を数件見返し、似たような行動に対して自分の評点や基準がぶれていないかを書き出す。他人の評価と突き合わせる必要も、従業員を新たに観察する必要もなく、自分がすでに書いた評価の記録だけで自分のものさしの一貫性を見る。ぶれている箇所が、目を鍛え直す最初の手がかりになる
| よくある誤解 | 実際のところ |
|---|---|
| 評価者を訓練すれば、目は鍛えられ、みなの評価は揃う。研修を一度やれば、評価は公正になる | 訓練は評価の質を確かに高める(Woehr & Huffcutt 1994のメタ分析、Roch 2011のFOR訓練メタ、Gorman & Rentsch 2009の機序、Bernardin 1978の寛大化・ハロー低減)。だが効果は限定的で万能ではなく、時間とともに減衰して保たれにくい(Gorman 2017)。さらにばらつきの主な源は評価者そのものに根ざしており、評価様式や訓練だけでは完全には消えない(Landy & Farr 1980)。目は鍛えられるが、揃いきりはしない。訓練は一回のイベントではなく、反復と現場の設計とセットで初めて維持される |
| 訓練しても評価は揃わないのだから、評価者訓練そのものに意味はない | これも実像を外している。訓練は評価の質を高め、寛大化やハローを減らす——効果はある。研究が否定するのは『訓練で目が完全に揃い万能になる』であって『訓練は効く』ではない。だから過信も放棄もせず、縮められる差と、人が人を評価する構造から残る差を分けて見る。揃わずに残った差を、評価者個人の努力不足のせいにしない |
| 評価者の腕が良ければ、その良い目はずっと保たれる | 訓練で高めた評価の質は、時間の経過とともに保たれにくい(Gorman 2017のアセスメントセンター訓練保持研究)。一度鍛えた目も、使い続け繰り返し確かめなければ元へ戻っていく。だから訓練は反復と現場の設計とセットにする必要がある。効果の減衰を前提に置かないと、昔の研修を根拠にいまの目を過信することになる |
皮肉なのは、「うちは評価者研修をやっているから大丈夫」と最も強く言えるときほど、その研修が何年前だったかを忘れていることだ。訓練の効果は、掲げた日から静かに薄れていく。しかも、どれだけ鍛えても、人が人を見て評点をつけるかぎり、評価者に根ざした差は残る。評価者の目が訓練で揃ったように見えるとき、たいていそれは、まだ運よく、見る対象が易しく、記憶が新しく、ものさしがずれる前の、短い期間にいるだけかもしれない。だから、揃える、ではなく、縮めて、残る差を認めて設計する。
Q1. 『訓練すれば評価者の目は揃う』を、査読の到達点はどう修正するか。効果の大きさと時間の観点に触れて述べよ。一問一答
Q2. 評価者訓練でよく知られるのは ____ 訓練で、頭の中の ____ (何をどう評価するかの枠組み)の精度が上がることで効く(Gorman & Rentsch 2009)。だが効果は時間とともに ____ し、ばらつきの主な源は ____ に根ざして訓練だけでは消えない(Landy & Farr 1980)。穴埋め
Q3. 『訓練しても揃わないのだから評価者訓練に意味はない』という考えに対する、この単位の立場はどれか。選択
Q4. Gorman らが2017年に示した『効果の減衰』は、評価者訓練の設計にどんな含意を持つか。一問一答
Q5. この単位が扱った評価者訓練研究を、年の早い順に並べよ。(ア)Woehr と Huffcutt が訓練効果のメタ分析を示す(イ)Bernardin が訓練による寛大化・ハロー低減を示す(ウ)Gorman らが訓練効果の減衰を示す(エ)Landy と Farr が評価者に根ざす差を整理する並べ替え
紙かメモアプリに今日の日付を書く。次に、自分が過去につけた評価(査定・フィードバックのメモ・評点など)を数件、手元の記録から並べる。似たような行動や成果に対して、自分がつけた評点や用いた基準がぶれていないかを見て、ぶれている組に印を付け、どうぶれていたかを一言書く。良し悪しの判定や、他人の評価との突き合わせはしない。従業員を新たに観察する必要もなく、自分がすでに書いた評価の記録だけで完結させる。最後に、見返した件数と、ぶれが見つかった組の数を書き添える。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Woehr D.J., Huffcutt A.I. (1994) ‘Rater training for performance appraisal: A quantitative review’, Journal of Occupational and Organizational Psychology 67(3):189-205 — doi.org
- Roch S.G., Woehr D.J., Mishra V., Kieszczynska U. (2011) ‘Rater training revisited: An updated meta-analytic review of frame-of-reference training’, Journal of Occupational and Organizational Psychology 85(2):370-395 — doi.org
- Gorman C.A., Rentsch J.R. (2009) ‘Evaluating frame-of-reference rater training effectiveness using performance schema accuracy’, Journal of Applied Psychology 94(5):1336-1344 — doi.org
- Gorman C.A. et al. (2017) ‘Retention of Assessment Center Rater Training’, Journal of Personnel Psychology 16(4) — doi.org
- Bernardin H.J. (1978) ‘Effects of rater training on leniency and halo errors in student ratings of instructors’, Journal of Applied Psychology 63(3):301-308 — doi.org
- Landy F.J., Farr J.L. (1980) ‘Performance rating’, Psychological Bulletin 87(1):72-107 — doi.org