「会議を開けば目線は揃う」——だが、放っておくと合意は正しさでなく居心地に揃う
評価がばらつくなら、みんなで話して揃えればいい。もっともに見える。だが会議は揃える機能を持ちうるが、開けば揃うではない。そもそも評点を支配するのは評価者ひとりの癖で、目は初期設定として揃わない。会議は条件しだいで効くが、放っておくと声の大きさや寛大化に引きずられ、合意は正しさでなく居心地に揃う。鍵は開くこと自体でなく、揃うのを妨げるものを進め方で抑えることだ。
「会議を開けば、目線は揃う」——だが、揃うとは限らない
前の単位では、基準を書いても、その言葉の解釈が評価者ごとにぶれることを扱った。ここでは、そのぶれた目を、会議で揃えようとする試み——キャリブレーションを扱う。
キャリブレーションとは、複数の評価者が集まって、それぞれの評点を持ち寄り、「この人はA、この人はB」と目線をすり合わせる会議のことだ。評価がばらつくなら、みんなで話して揃えればいい——一見、もっともな解決に見える。だが、この単位が最初に置く見方はこうだ。会議は「揃える機能を持ちうる」が、「開けば揃う」ではない。 すり合わせは、うまく設計されたときに効くのであって、ただ人を集めて話させれば、別の何かに揃ってしまうことすらある。評価がばらつくのは、みんなが不真面目だからでも、基準の言葉が足りないからでもない。もっと根の深い、評価という営みそのものの性質から来ている。だから「会議で揃える」の前に、その性質を知っておく必要がある。まずは、なぜ目がそもそも揃わないのか、そのうえで会議に何ができて何ができないのか、を順に見ていく。
そもそも、評点を支配するのは評価者の癖
会議に期待する前に、揃わなさの正体を押さえておく。前の段でも触れたが、業績評価のばらつきの主な源は、評価される人の側ではなく、評価する人の側にある。Scullen・Mount・Goff が2000年に、評点を最も大きく動かしているのは評価対象の実際の出来ばえより、評価者ひとりひとりの癖(評価者固有のばらつき)だと分解した。同じ人を見ても、甘くつける人と辛くつける人がいて、その差は本人の実力とは別に生じる。
これは一つの研究の言い分ではない。Conway と Huffcutt が1997年に、上司・同僚・部下・自己という複数の評価源を横断したメタ分析で、源が違えば評価はそれほど一致しないことを示し、Mount らが1998年に、360度評価を分解して、評価者が誰かという効果が大きいことを確かめた。さらにさかのぼれば、Landy と Farr が1980年に、評価研究を広く総括して、ばらつきの主因が評価者側にあることをすでに指摘していた。つまり「目が揃わない」は、例外ではなく、評価というものの初期設定に近い。会議は、この初期設定の上で開かれる。念のため言い添えると、これは「だから評価は無駄だ」という話ではない。ばらつくと分かっているものを、ばらつく前提で扱うか、揃っているふりをして扱うかで、その先の公正は大きく変わる。揃わなさを認めることが、まともに向き合う出発点になる。
キャリブレーションは、条件しだいで効く
では会議は無力かというと、そうではない。ここは公平に見ておく必要がある。Demeré・Sedatole・Woods が2019年に Management Science 誌で、主観的な業績評価におけるキャリブレーション委員会の役割を調べ、委員会が情報を持ち寄り活用することを通じて、評価を改善しうることを示した。ばらばらの評価者が知らなかった事情——別の場面でのその人の働きぶり、他の候補との相対的な位置——が会議で共有されれば、評点はより確からしい方へ動くことがある。
ただし、この効果は無条件ではない。同じ研究が示すのは、効き方がコストと情報の構造に依存するということだ。会議に時間と手間がかかること、そして「持ち寄る情報が実際に価値を持つ場面かどうか」で、効果は変わる。全員がすでに同じ狭い情報しか持っていない会議なら、いくら話しても、新しく揃うものは少ない。会議が効くのは、それぞれが違う断片を持っていて、それを突き合わせられるときだ。だから問いは「会議を開くか」ではなく、「持ち寄る価値のある情報があるか、それを引き出す進め方になっているか」になる。この点は、忙しい現場ほど見落とされやすい。会議を「やることになっているから開く」のと、「この人については誰も全体像を持っていないから、断片を持ち寄る」のとでは、同じ会議でも中身がまるで違う。前者は儀式になり、後者は情報の統合になる。
会議の落とし穴——合意が「正しさ」でなく「居心地」で動く
しかも、会議には固有の落とし穴がある。人が集まって評点をすり合わせるとき、合意は必ずしも「より正しい評価」へ向かうとは限らない。声の大きい人の見立てに引きずられ、その場の空気に合わせ、角を立てない線で落ち着く——合意が、正しさではなく居心地で動いてしまうことがある。
その一因として、評価には寛大化(leniency)——甘めにつける傾向——が働くことが知られている。Villanova らが1993年に、業績評価にともなう評価者の不快感が寛大化と結びつくことを扱った。悪い評価をつけて相手と気まずくなるのは、誰にとっても居心地が悪い。だから、はっきり低くつけるより、みんな真ん中あたりに寄せておこう、という力が働く。会議は、この寛大化を胸の内から、テーブルの上の合意へと格上げしてしまうことがある。全員が少しずつ角を丸めた結果が「揃った評価」に見えるが、それは正しさに揃ったのではなく、気まずさの回避に揃っただけかもしれない。厄介なのは、この揃い方が、当人たちには「きちんと議論して合意できた」という手応えを残すことだ。角が立たずに終わった会議ほど、うまくいったように感じられる。だが、なめらかに終わったことと、正しく揃ったことは、まったく別の出来事である。
「開けば揃う」ではなく、設計で抑える
ここまでをまとめると、キャリブレーションは「効きうるが、放っておくと別の何かに揃う」道具だということになる。だから使いこなす鍵は、会議を開くこと自体ではなく、揃うのを妨げるもの——同調、声の大きさ、寛大化——を、進め方で抑えることにある。
たとえば、話し合う前にそれぞれの評点を先に書き出しておく(後から人に合わせて変えにくくする)、意見を言う順を立場の上下と逆にする(下の人が先に言えるようにする)、「なぜその評点か」を根拠の事実で語らせる(印象や声の大きさで決めない)、といった工夫だ。ここで大事なのは、これらが人を格付けするための技術ではなく、目線をすり合わせるための手続きだということである。目的は、誰かを高く・低く仕分けることではなく、同じ物差しで見られているという状態に近づけることだ。会議は、そう設計されて初めて、揃える機能を発揮する。素朴に「集まって話す」だけでは、居心地に揃うほうへ滑りやすい。こうした手続きは、堅苦しく感じられるかもしれない。だが、堅苦しさは、力の弱い人の見立てや、少数の異論が、その場の空気に押しつぶされないための、ささやかな防波堤でもある。手続きが守るのは、評価の正しさであると同時に、遠慮して黙ってしまう人の声でもある。もっとも、どんな進め方も万能ではない。ここで言えるのは、揃わせたいなら、揃うのを妨げる力の存在を前提に段取りを組め、ということだけだ。妨げる力を見ないまま開かれた会議は、たいてい、いちばん強い声のほうへ流れていく。
時間・変化:1980年から今へ
順に置く。1980年、Landy と Farr が、評価のばらつきの主因は評価者側にあると総括する。1993年、Villanova らが、評価にともなう不快感が寛大化と結びつくことを示す。1997年、Conway と Huffcutt が評価源間の一致の低さを、1998年、Mount らが評価者効果の大きさを、2000年、Scullen らが評点を支配するのは評価者の癖だと分解する。そして2019年、Demeré らがキャリブレーション委員会が条件しだいで評価を改善しうることを示した。
この数十年で確からしくなったのは、「会議を開けば目線は揃う」という因果ではない。確からしくなったのは、目はそもそも揃わず、会議は条件しだいで効くが、放っておくと寛大化や同調で居心地に揃う——という、慎重な向きのほうである。この向きは、キャリブレーションをやめる理由にはならない。むしろ、何を期待し、何を警戒すればよいかを教えてくれる——会議には、断片を統合する力と、居心地へ流れる力の、両方が同時に働いている。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、会議を開いたこと自体を「揃った」証拠だと思うことである。全員が合意した、角が立たなかった——それは、正しさに揃った印ではなく、気まずさを避けた印かもしれない。合意の滑らかさは、正確さの保証ではない。
助けになるのは、他人の目を揃える前に、まず自分の評価の癖を、自分の記録から見つけることだ。最初の一歩は10分。自分が最近つけた評点や、人への評価の言葉を思い出し、甘めに振れた回と辛めに振れた回を書き出し、それぞれ「その時、何があったか」(相手との関係、直前の評価との比較、その場の気分)を一言そえる。相手を評価し直す必要も、誰かに確かめる必要もない。ただ、自分の評点が、相手の出来ばえ以外の何に動かされたかを、自分の記録から見る。 自分の癖が見えていない人が集まっても、会議は癖の足し算にしかならない。逆に、一人ひとりが自分の甘辛の傾向を知っていれば、会議はその傾向を差し引きながら話せる。揃えるための第一歩は、テーブルを囲むことではなく、自分がどちらへ振れやすいかを、あらかじめ手元で見ておくことだ。癖は消せなくても、見えていれば、差し引いて話すことはできる。
次の単位は 437「評価者の目を鍛えるには?」——揃わない目を、訓練でどこまで鍛えられるのか、その効果と限界へ進む。
- この単位は青段(骨格)の締めで、書いても解釈がぶれる目を会議で揃えようとするキャリブレーション(複数の評価者が評点を持ち寄り目線をすり合わせる会議)を扱う。俗説は『会議を開けば目線は揃う』。だが会議は揃える機能を持ちうるが開けば揃うではなく、うまく設計されたときに効くのであって、ただ人を集めて話させれば別の何かに揃ってしまうことすらある
- 業績評価のばらつきの主な源は評価する人の側にある。Scullen・Mount・Goff 2000(Journal of Applied Psychology 85(6):956-970)は評点を最も動かすのが評価者ひとりひとりの癖だと分解し、Conway & Huffcutt 1997 は評価源間の一致の低さを、Mount ら 1998 は評価者効果の大きさを、Landy & Farr 1980 はばらつきの主因が評価者側にあることを示した。目が揃わないは評価の初期設定に近い
- 会議は無力ではない。Demeré・Sedatole・Woods 2019(Management Science 65(4):1562-1585)は主観的評価におけるキャリブレーション委員会が情報を持ち寄り活用することを通じて評価を改善しうることを示した。ばらばらの評価者が知らなかった事情が共有されれば評点はより確からしい方へ動くことがある。ただし効果は無条件でなくコストと情報の構造に依存し、それぞれが違う断片を持ち突き合わせられるときに効く
- 会議には固有の落とし穴がある。人が集まって評点をすり合わせるとき合意は必ずしもより正しい評価へ向かわず、声の大きい人に引きずられ空気に合わせ角を立てない線で落ち着く——合意が正しさでなく居心地で動くことがある。Villanova ら 1993(Educational and Psychological Measurement 53(3):789-799)は評価にともなう評価者の不快感が寛大化(甘めにつける傾向)と結びつくことを扱った。会議は寛大化を個人の胸の内からテーブルの上の合意へ格上げしてしまう
- キャリブレーションは効きうるが放っておくと別の何かに揃う道具で、使いこなす鍵は会議を開くこと自体でなく揃うのを妨げるもの(同調・声の大きさ・寛大化)を進め方で抑えることにある。話す前に評点を先に書き出す、意見を言う順を立場の上下と逆にする、なぜその評点かを根拠の事実で語らせる、といった工夫。これらは人を格付けする技術でなく目線をすり合わせるための手続きで、目的は同じ物差しで見られている状態に近づけることである
- この数十年で確からしくなったのは、会議を開けば目線は揃うという因果ではなく、目はそもそも揃わず会議は条件しだいで効くが放っておくと寛大化や同調で居心地に揃うという慎重な向きである。会議を開いたこと自体を揃った証拠だと思うのが落とし穴で、合意の滑らかさは正確さの保証ではない
- だからこの単位でやるのは、他人の目を揃える前にまず自分の評価の癖を自分の記録から見つけることである。自分が最近つけた評点や人への評価の言葉を思い出し、甘めに振れた回と辛めに振れた回を書き出し、それぞれその時何があったか(相手との関係・直前の評価との比較・その場の気分)を一言そえる。自分の癖が見えていない人が集まっても会議は癖の足し算にしかならない
| よくある誤解 | 実際のところ |
|---|---|
| 評価がばらつくなら、評価者を集めて会議で話し合えば、目線は揃って公正な評価に近づく | 会議は揃える機能を持ちうるが開けば揃うではない。そもそも Scullen ら 2000・Conway & Huffcutt 1997・Mount ら 1998・Landy & Farr 1980 が示すように、評点を支配するのは評価対象の出来ばえより評価者ひとりひとりの癖で、目は初期設定として揃わない。会議はこの初期設定の上で開かれ、うまく設計されたときに効くのであって、ただ集めて話させれば別の何かに揃ってしまうことすらある |
| キャリブレーション委員会を開きさえすれば、評価は必ず改善する | Demeré ら 2019 は委員会が情報を持ち寄り活用することで評価を改善しうることを示したが、その効果はコストと情報の構造に依存し無条件ではない。全員が同じ狭い情報しか持たない会議ではいくら話しても新しく揃うものは少なく、効くのはそれぞれが違う断片を持ち突き合わせられるときである。問いは会議を開くかでなく、持ち寄る価値のある情報があるか、それを引き出す進め方かになる |
| 会議で全員が合意して角が立たなければ、それは評価が正しく揃った証拠だ | 人が集まると声の大きさや同調が働き、Villanova ら 1993 が示すように評価にともなう不快感が寛大化(甘めにつける傾向)と結びつく。会議はこの寛大化を個人の胸の内からテーブルの上の合意へ格上げし、合意が正しさでなく居心地で動きうる。合意の滑らかさは正確さの保証ではない。だからこの単位でやるのは、他人の目を揃える前に、自分の評点が甘辛どちらに何によって振れたかを自分の記録から見つけることである |
皮肉なのは、評価を揃えようと開いた会議が、いちばん揃えたくなかったもの——気まずさの回避——にみんなを揃えてしまいうることである。評点はもともと、対象の出来ばえより評価者の癖で動く。その癖を持ち寄って話し合えば、うまくいけば違う断片が突き合わさって確からしくなるが、放っておけば、声の大きさと寛大化に引かれて、角の立たない真ん中へ寄っていく。会議が公正を約束しているように見えるとき、たいていそれは、まだ誰も、合意が正しさに揃ったのか、それとも居心地に揃ったのかを、別々に測っていないだけかもしれない。キャリブレーションは、開けば揃う道具ではない——揃うのを妨げるものを設計で抑えて、はじめて揃える機能を発揮する。ここまでで、等級・報酬・基準・ばらつきという骨格の段を積み終えた。次の単位は 437「評価者の目を鍛えるには?」——揃わない目を、訓練でどこまで鍛えられるのか、その効果と限界へ進む。
Q1. キャリブレーションは『揃える ____ を持ちうる』が『開けば揃う』ではない。合意は必ずしも正しさへ向かわず、声の大きさや ____ が働くと、正しさでなく ____ で動いてしまうことがある。穴埋め
Q2. Demeré ら 2019 が示したキャリブレーション委員会についての知見として正しいものはどれか。選択
Q3. 『会議を開けば目線は揃う』が単純には成り立たない理由を、評価者間のばらつきの源(Scullen ら 2000 ほか)と会議の落とし穴(Villanova ら 1993)の両面から述べよ。一問一答
Q4. キャリブレーションで『揃うのを妨げるもの』を抑えるための進め方の工夫を、具体的に挙げよ。それらが何のための手続きかも述べよ。一問一答
Q5. この単位が扱った研究を、年の早い順に並べよ。(ア)Demeré らがキャリブレーション委員会の条件付きの効果を示す(イ)Landy & Farr がばらつきの主因は評価者側だと総括する(ウ)Scullen らが評点を支配するのは評価者の癖だと分解する(エ)Villanova らが不快感と寛大化の結びつきを示す並べ替え
紙かメモアプリに今日の日付を書く。次に、自分が最近つけた評点や、人への評価の言葉(会話や心のなかのものでもよい)を、思い出せる範囲でいくつか挙げる。各件について、それが甘めに振れたか辛めに振れたかを書き、そのとき『相手の出来ばえ以外に何があったか』——相手との関係の近さ、直前につけた評価との比較、その日の自分の機嫌、気まずさを避けたい気持ちなど——を一言そえる。相手を評価し直したり、本人や他の人に確かめたりする必要はなく、自分の評価の記録だけで完結させる。最後に、甘めに振れた件数と辛めに振れた件数、そして出来ばえ以外の事情が思い当たった件数を書き添える。自分の癖が見えることが、会議で目を揃える前の下ごしらえになる。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Scullen S.E., Mount M.K., Goff M. (2000) ‘Understanding the latent structure of job performance ratings’, Journal of Applied Psychology 85(6):956-970 — doi.org
- Conway J.M., Huffcutt A.I. (1997) ‘Psychometric Properties of Multisource Performance Ratings: A Meta-Analysis of Subordinate, Supervisor, Peer, and Self-Ratings’, Human Performance 10(4):331-360 — doi.org
- Mount M.K., Judge T.A., Scullen S.E., Sytsma M.R., Hezlett S.A. (1998) ‘Trait, Rater and Level Effects in 360-Degree Performance Ratings’, Personnel Psychology 51(3):557-576 — doi.org
- Landy F.J., Farr J.L. (1980) ‘Performance rating’, Psychological Bulletin 87(1):72-107 — doi.org
- Demeré B.W., Sedatole K.L., Woods A. (2019) ‘The Role of Calibration Committees in Subjective Performance Evaluation Systems’, Management Science 65(4):1562-1585 — doi.org
- Villanova P. et al. (1993) ‘Rater Leniency and Performance Appraisal Discomfort’, Educational and Psychological Measurement 53(3):789-799 — doi.org