「指標を見ていれば副作用に気づく」——だが、その指標こそ、制度にすでに歪められている
制度の副作用に気づくには、指標をダッシュボードで見張ればいい、と教わる。皮肉なことに、副作用にいちばん気づけないのは、指標をいちばん熱心に見ている人だ。ダッシュボードが緑に光っているうちは順調に見える。だが、その緑は、人々が緑になるように振る舞った結果かもしれない。数字が良いことと実際に良いことのずれは、皆がその数字を見ていると知っているとき、最大になる。
前の単位では、柔軟な働き方の副作用まで見ないと対応にならないことを扱った。ここでは、制度そのものが生む副作用に、どうすれば気づけるのか——制度の副作用に気づくにはどうすればいいのかを扱う。
「評価点、離職率、残業時間——指標を並べてダッシュボードで見ていれば、制度の副作用にはちゃんと気づける」——これが、この単位が向き合う俗説である。一見、賢いやり方に見える。数字を見張っていれば、おかしなことが起きたら数字に出るはずだ、と。だが、ここには深い落とし穴がある。副作用を映すはずのその指標こそが、制度によって、すでに歪められているからだ。ある指標を目標に据えると、その指標は目標であることをやめて、ゲームの的になる——これは「グッドハートの法則」という言葉で古くから語られてきた見立てだが、この単位はその法則を持ち出して終わりにはしない。人事の現場で、指標が実際にどう歪むのかを、人事固有の研究で一つずつ確かめていく。
評価という指標は、そもそも人を測れているか
まず、いちばん基本の指標である「評価点」から疑う。2000年、Scullen・Mount・Goff が *Journal of Applied Psychology* 誌 85(6):956-970 で、業績評価の点数が何を映しているのかを分解し、驚くべきことを示した。評価点のばらつきの大きな部分は、評価される人の実際の働きぶりではなく、評価する側——誰が評価したかという評価者の癖で説明されてしまう。同じ人を評価しても、評価者が違えば点が違う。つまり評価点は、その人の実力を測る物差しである前に、評価者という測定器の癖を色濃く映した数字だということだ。この一点を押さえておかないと、後のすべての指標を読み違える。ある人の評価が下がったとき、それがその人の働きの変化なのか、評価者が代わった・評価者の機嫌や基準が変わっただけなのかは、点数を見ているだけでは切り分けられない。同じ体重計でも、乗るたびに目盛りの起点がずれていたら、増えたのか減ったのか分からない。評価点という体温計は、測られる人の熱と、測る人の手の温度を、混ぜて表示している。評価点は、人を測る前に、測る人を映している。
強制分布——指標を良くしようとして、指標を歪める
次に、指標を「良くしよう」とする制度そのものが、指標を歪める例を見る。強制分布(きょうせいぶんぷ=評価をS・A・B・Cのような割合にあらかじめ振り分ける仕組み。上位何%・下位何%と枠を決める)は、評価の甘辛をそろえる狙いで導入される。だが、その帰結は素直ではない。2005年、Scullen・Bergey・Aiman-Smith が *Personnel Psychology* 誌 58(1):1-32 で、強制分布を回し続けたときに職場の力がどう変わるかをシミュレーションで検討し、条件によっては期待ほど働かないことを示した。2013年、Berger・Harbring・Sliwka が *Management Science* 誌 59(1):54-68 で、上司が実際に評価する実験を行い、強制分布が評価行動そのものを歪めることを示す。近年のレビュー(Moon ら2016)も、強制分布が業績に及ぼす、時に逆機能的な効果を総説にまとめている。下位に必ず一定割合を置く仕組みは、たとえ全員が優秀でも誰かを下位に落とし、良い人が理不尽に低く評価されて去る、という副作用を生みうる。指標をそろえようとして入れた仕組みが、指標の中身を別の方向へねじってしまう。
指標があると、人はそれを操作する
指標が処遇に直結すると、人はその指標を「上げる」ために動く——たとえそれが本来の仕事とずれていても。2014年、Larkin が *Journal of Labor Economics* 誌 32(2):199-227 で、強い成果連動の報酬が入ったソフトウエア営業の現場を調べ、社員が報酬のしくみに合わせて売り方や計上のタイミングを操作する(ゲーミング)ことを示した。値引きの取り方、売上を立てる時期の選び方——指標で報われるように、行動が最適化される。会社が見たかったのは「良い営業」だったのに、指標が測っていたのは「指標で高く出る動き方」になっていく。指標は、見られていることを知った瞬間から、測りたかったものと、測りやすいものの、ずれを広げていく。 だからこそ、指標を眺めるだけでは副作用に気づけない。副作用は、まさにその指標の中に溶け込んで隠れているからだ。しかも、ゲーミングは不正とは限らない。ルールの中で、報われるように振る舞っているだけのことが多い。値引きをいつ出すか、契約をどの月に立てるか——どれも許された範囲の工夫だ。だから「ずるい社員がいる」という話に矮小化すると、本当の問題を見失う。問題は個人の悪意ではなく、そう振る舞うと得をするように指標を設計してしまったこと、そしてその指標を無防備に信じてしまうことのほうにある。指標を厳しく締めるほど、ゲーミングは巧妙になり、いっそう見えにくくなる。いたちごっこの果てに残るのは、実態から遠く離れた、きれいな数字だけだ。だから、締めつけの強化は、副作用への答えにはならない。答えは、指標の外へ目を移すことのほうにある。
バイアスは、必ずしも悪ではない
ここで一つ、単純化への歯止めをかけておく。「評価のバイアスはすべて害だ、取り除け」という話ではない。2011年、Bol が *The Accounting Review* 誌 86(5):1549-1575 で、管理者の評価バイアス——寛大化(甘くつける)や中心化(真ん中に寄せる)——が何によって生まれ、どんな効果を持つかを調べ、寛大化バイアスが必ずしも有害ではなく、その後の業績と正の関連を持つことさえあることを示した。甘くつけることが、関係を保ち、やる気を支える方向に働く場合がある。1993年、Prendergast と Topel が *European Economic Review* 誌 37(2-3):355-365 で、評価者の裁量が「えこひいき」を生む理屈を示したが、その裁量は同時に、数字に表れない事情をくむ余地でもある。介護で親を看ながら働いた一年を、規則どおりの数字だけでは拾えないとき、評価者の裁量だけがそれをくめる。裁量を全部つぶして機械のように評価をそろえれば、えこひいきは減るかもしれないが、事情をくむ余地も一緒に消える。バイアスは、歪みでもあり、人間の判断が入る余地でもある。 副作用を「気づく」とは、バイアスをゼロにすることではなく、どのバイアスがどちらへ働いているかを見分けることだ。
時間・変化:1993年から2016年へ
順に置く。1993年、Prendergast と Topel が、評価者の裁量が偏りを生む理屈を示す。2000年、Scullen・Mount・Goff が、評価点の大きな部分は評価者側の癖で説明されると示す。2005年、Scullen らが、強制分布が期待ほど働かない条件をシミュレーションで示す。2011年、Bol が、寛大化バイアスは必ずしも害ではなく将来業績と正の関連もあると示す。2013年、Berger らが、強制分布が評価行動を歪めると実験で示す。2014年、Larkin が、社員が指標をゲーミングすると示す。2016年、Moon らが、強制分布の逆機能的な効果を総説にまとめる。この四半世紀で確からしくなったのは、「指標を見ていれば副作用に気づける」ではない。確からしくなったのは、指標そのものが歪み・ゲームされ、しかもバイアスには両面がある。だから指標の中だけを見ても副作用は見えない——という向きのほうだ。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、汚染された指標を、副作用を映す中立な鏡だと信じることである。評価点も、離職率も、残業時間も、制度によってすでに色をつけられている。助けになるのは、指標の外の兆候を、意識して拾いにいくことだ。誰が辞めたのか、辞め際に何を言い残したのか。会議でどの話題が急に出なくなったのか。良い人ほど静かに評価を下方修正されていないか。これらは、ダッシュボードには出てこない。だが、副作用はしばしば、まずここに現れる。数字が異常を告げる頃には、たいてい手遅れになっている。辞めた人の一言や、誰も口にしなくなった不満は、数字よりずっと早い、生の警報だ。皮肉なことに、いちばん早く副作用を教えてくれる情報ほど、いちばん数値化しにくく、ダッシュボードに載せられない。だから、指標を見張ることと、指標の外に耳をすますことは、どちらか一方では足りず、両方いる。指標は結果を、外の声は予兆を教える。
処遇を決めることは、人の生活と誇りに触れることだ。指標で人を並べ替えるほど、人は指標に合わせて自分を作り変える。それは怠慢ではなく、生きるための当然の反応だ。だから副作用の責任を、指標をゲームした個人に押しつけない。歪みを生んだのは、その指標を処遇に結びつけた制度の側である。人を責める方向に進むと、副作用は地下にもぐり、ますます指標に映らなくなる。制度を直せば、同じ人が、無理に指標を取りにいかずに済むようになる。
最初の一歩は10分。自分の評価や処遇の決め方に潜んでいそうな副作用を、一つ書き出す——たとえば「数字の出やすい仕事ばかりが選ばれる」「甘くつけたほうが波風が立たない」など。次に、その副作用の兆候を、指標ではなく指標の外から一つ探す——最近辞めた人、こぼれた一言、避けられている仕事。特定の従業員を監視・観察の対象にしない。自分の決め方が生む歪みを、自分の側の点検として書く。
- この単位の芯は、副作用を映すはずの指標こそが制度によってすでに歪められているということ。ある指標を目標に据えると指標はゲームの的になる——グッドハートの法則という言葉で語られてきた見立てを、この単位は人事固有の研究で確かめる。証拠の読み違え方は、汚染された指標を副作用を映す中立な鏡と取り違えること
- Scullen・Mount・Goff 2000(Journal of Applied Psychology 85(6):956-970)は、業績評価の点数のばらつきの大きな部分が、評価される人の実際の働きぶりではなく、誰が評価したかという評価者の癖で説明されると示した。評価点はその人の実力を測る物差しである前に、評価者という測定器の癖を色濃く映した数字である。評価点は、人を測る前に、測る人を映している
- 強制分布(評価をあらかじめ上位何%・下位何%と割合で振り分ける仕組み)の帰結は素直ではない。Scullen 2005(Personnel Psychology 58(1):1-32)は期待ほど働かない条件をシミュレーションで示し、Berger 2013(Management Science 59(1):54-68)は評価行動を歪めると実験で示し、近年のレビュー(Moon ら2016)も業績への時に逆機能的な効果を総説にまとめた。指標をそろえようとした仕組みが指標の中身をねじる
- Larkin 2014(Journal of Labor Economics 32(2):199-227)は、強い成果連動の報酬が入ったソフトウエア営業で、社員が報酬のしくみに合わせて売り方や計上のタイミングを操作するゲーミングを示した。会社が見たかったのは良い営業だったのに、指標が測るのは指標で高く出る動き方になる。指標は見られていることを知った瞬間から、測りたかったものと測りやすいもののずれを広げる
- Bol 2011(The Accounting Review 86(5):1549-1575)は、管理者の寛大化バイアスが必ずしも有害ではなくその後の業績と正の関連を持つことさえあると示した。Prendergast・Topel 1993(European Economic Review 37(2-3):355-365)の評価者の裁量は、えこひいきを生むと同時に数字に表れない事情をくむ余地でもある。バイアスは歪みでもあり人間の判断が入る余地でもあり、バイアス=悪と単純化しない
- 確からしくなったのは、指標を見ていれば副作用に気づける、ではない。指標そのものが歪み・ゲームされ、しかもバイアスには両面があるため、指標の中だけを見ても副作用は見えない、という向き。助けになるのは、指標の外の兆候(誰が辞めたか・辞め際の一言・どの話題が出なくなったか・良い人が静かに下方修正されていないか)を意識して拾いにいくこと
- 処遇を決めることは人の生活と誇りに触れること。指標で人を並べ替えるほど人は指標に合わせて自分を作り変えるが、それは怠慢ではなく生きるための当然の反応。副作用の責任を指標をゲームした個人に押しつけず、歪みを生んだのはその指標を処遇に結びつけた制度の側だと見る。従業員を格付け対象として非人格化しない
| よくある誤解 | 実際のところ |
|---|---|
| 評価点や離職率や残業時間の指標を並べて見張っていれば、制度の副作用が起きたら数字に出るので気づける | 副作用を映すはずのその指標こそが制度によってすでに歪められている。Scullen・Mount・Goff 2000は評価点のばらつきの大きな部分が評価者側の癖で説明されると示し、Larkin 2014は指標が処遇に直結すると人がそれをゲーミングすると示した。指標は見られていることを知った瞬間から、測りたかったものと測りやすいもののずれを広げる。汚染された指標を、副作用を映す中立な鏡と取り違えてはならない |
| 評価の甘辛をそろえるために強制分布(上位何%・下位何%と割合を決める仕組み)を入れれば、評価が正確になり副作用も防げる | Scullen 2005は強制分布が条件によっては期待ほど働かないと示し、Berger 2013は評価行動そのものを歪めると実験で示し、Moon 2016は業績への時に逆機能的な効果を総説にまとめた。指標をそろえようとして入れた仕組みが、指標の中身を別方向へねじる。制度そのものが副作用の源になりうる |
| 評価のバイアスはすべて害なのだから、寛大化や中心化のバイアスを取り除けば評価は良くなる | Bol 2011は、寛大化バイアス(甘くつける)が必ずしも有害ではなく、その後の業績と正の関連を持つことさえあると示した。Prendergast・Topel 1993の裁量は、えこひいきを生むと同時に数字に表れない事情をくむ余地でもある。バイアスは歪みでもあり人間の判断が入る余地でもあり、副作用に気づくとはバイアスをゼロにすることではなく、どのバイアスがどちらへ働くかを見分けること |
皮肉なのは、副作用にいちばん気づけないのは、指標をいちばん熱心に見ている人だ、ということである。ダッシュボードが緑に光っているうちは、すべて順調に見える。だが、その緑は、人々が緑になるように振る舞った結果かもしれない。数字が良いことと、実際に良いことの、ずれが最大になるのは、皆がその数字を見ていると知っているときだ。だから、制度の副作用を探すなら、指標のいちばん外側——誰かが黙って去った理由や、口にされなくなった不満のほうを、見にいくことである。副作用は、たいてい、あなたのダッシュボードには映らない場所で、静かに起きている。
Q1. 「指標を見張っていれば制度の副作用に気づける」という言い方の落とし穴を説明せよ。Larkin 2014 の「ゲーミング」に触れること。一問一答
Q2. Scullen・Mount・Goff 2000 が業績評価の点数について示したこととして正しいものはどれか。選択
Q3. Bol 2011 は、管理者の ____ バイアス(甘くつける)が必ずしも有害ではなく、その後の ____ と正の関連を持つことさえあると示した。だから副作用に気づくとは、バイアスを ____ にすることではなく、どのバイアスが ____ へ働くかを見分けることである。穴埋め
Q4. この単位は、制度の副作用に気づくために「指標の外」を見るべきだと言う。指標の外の兆候の具体例を挙げ、なぜ指標の中だけでは足りないのかを説明せよ。一問一答
Q5. この単位が扱った研究を、年の早い順に並べよ。(ア)Scullen・Mount・Goff が評価点の大部分は評価者の癖と示す(イ)Prendergast・Topel が評価者の裁量が偏りを生む理屈を示す(ウ)Larkin が社員が指標をゲーミングすると示す(エ)Bol が寛大化バイアスは害とは限らないと示す並べ替え
紙かメモアプリに今日の日付を書く。自分の評価や処遇の決め方に潜んでいそうな副作用を、一つ書き出す——たとえば『数字の出やすい仕事ばかりが選ばれる』『甘くつけたほうが波風が立たないので差がつかない』『声の大きい人が高く出やすい』など。次に、その副作用の兆候を、指標(評価点・離職率など)ではなく、指標の外から一つ探して書く——最近辞めた人がいたか、辞め際や普段にこぼれた一言はなかったか、誰も引き受けたがらない仕事はどれか。最後に、その副作用が起きているとしたら、指標ではなく何を見れば早く気づけるかを一言書く。特定の従業員を監視・観察の対象にしない。点検するのは人ではなく、自分の決め方が生む歪みである。一人で働いている場合は、自分の値づけや仕事の選び方に潜む偏りを同じ手順で点検すればよい。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Scullen S.E., Mount M.K., Goff M. (2000) ‘Understanding the Latent Structure of Job Performance Ratings’, Journal of Applied Psychology 85(6):956-970 — doi.org
- Scullen S.E., Bergey P.K., Aiman-Smith L. (2005) ‘Forced Distribution Rating Systems and the Improvement of Workforce Potential: A Baseline Simulation’, Personnel Psychology 58(1):1-32 — doi.org
- Berger J., Harbring C., Sliwka D. (2013) ‘Performance Appraisals and the Impact of Forced Distribution—An Experimental Investigation’, Management Science 59(1):54-68 — doi.org
- Prendergast C., Topel R. (1993) ‘Discretion and Bias in Performance Evaluation’, European Economic Review 37(2-3):355-365 — doi.org
- Bol J.C. (2011) ‘The Determinants and Performance Effects of Managers’ Performance Evaluation Biases’, The Accounting Review 86(5):1549-1575 — doi.org
- Larkin I. (2014) ‘The Cost of High-Powered Incentives: Employee Gaming in Enterprise Software Sales’, Journal of Labor Economics 32(2):199-227 — doi.org