「基準を書けば明確になる」——だが、それは半世紀ちかく決着しない論争の途中だ
評価が曖昧だと言われると、求める行動をコンピテンシーとして書き出せば誰が評価しても同じになる、と考えたくなる。だが基準を書けば明確になるという前提そのものが、半世紀ちかく決着していない論争の途中にある。コンピテンシーの起点は批判にさらされ、妥当に使うには重い検証が要り、言葉は読む人ごとにぶれ、様式を磨いてもばらつきの主因は評価者側にある。明確とは読みやすさではなく、成果とつながっていることだ。
「基準を書けば、明確になる」——だが、それは論争の途中だ
前の単位では、報酬をどう見せ、誰と比べさせるかを扱った。ここでは、その額の根拠になる評価の基準を、書けば明確になるのか、を扱う。
評価が曖昧だという声が出ると、「基準を言葉にしよう」と考える。求める行動をコンピテンシー——仕事で成果を出す行動の特性——として書き出し、一覧にすれば、誰が評価しても同じになるはずだ、と。だが、この「基準を書けば明確になる」という前提そのものが、実は半世紀ちかく決着していない論争の途中にある。基準の言葉を増やすことと、評価が明確になることのあいだには、素朴に思うほど近い関係はない。
言葉をほどく。予測妥当性とは、その基準が将来の成果をどれだけ言い当てられるか、という度合いのことだ。基準が「明確」であるとは、読みやすいことではなく、測ったものが本当に成果とつながっていることを指す。ここを取り違えると、きれいな基準表を「明確な基準」と呼んでしまう。逆に言えば、基準づくりの本当の難しさは、言葉を選ぶことではなく、その言葉が指す先——現場の成果——を突き止めることにある。ところが実務では、前者に時間の大半が費やされ、後者はほとんど確かめられないまま運用に入る。だからこの単位は、基準を「きれいに書く」話ではなく、「書いた基準が本当に効くのか」を疑う話として進める。
コンピテンシーの由緒と、その正面からの批判
コンピテンシーという考えの起点は、McClelland が1973年に American Psychologist 誌で置いた主張だ。彼は、知能検査のような一般的な能力テストではなく、実際に仕事で成果を生む「できること(competence)」を直接測れ、と論じた。学歴や知能では現場の成果を十分に説明できない、という問題意識である。この主張は実務に大きな影響を与え、コンピテンシーという言葉は人事の共通語になった。
だが、これは決着した理論ではない。Barrett と Depinet が1991年に、同じ American Psychologist 誌で、McClelland の主張を正面から再検討し、その実証的な裏づけは弱いと論じた。コンピテンシーの測定が、従来の能力テストを上回る予測妥当性を持つと言えるだけの証拠は乏しい、というのだ。つまり「知能より能力を測れ」は、魅力的な号令ではあったが、それが実際に成果をよく予測するかは、論争として残っている。コンピテンシーを「明確な基準の完成形」として持ち上げるのは、この論争の片側だけを見ていることになる。付け加えれば、この批判はコンピテンシーを捨てよという主張ではない。使ってもよいが、それが成果を予測すると素朴に信じ込むな、という警告だ。魅力的な号令ほど、検証を飛ばして受け入れられやすい——「知能より能力」という言い回しの分かりやすさが、かえって実証の吟味を後回しにさせた面もある。
妥当に使うには、重い検証が要る
では、コンピテンシーはまったく使えないのか。そうではない。ただ、妥当に使うには、書くよりずっと重い作業が要る。Bartram が2005年に Journal of Applied Psychology 誌で、汎用的なコンピテンシーの枠組み(Great Eight)を検討し、その妥当性を言うには基準中心の検証——実際の成果という外部の物差しと突き合わせる作業——が要ることを示した。基準を列挙しただけでは、それが成果とつながっている保証はどこにもない。
Campion らが2011年に Personnel Psychology 誌で、コンピテンシーの設計の「うまくやるための実務の要点」を広く整理した。そこに並ぶのは、関係者を巻き込み、定義を吟味し、検証し、運用を管理する、という手間のかかる一連の工程である。裏を返せば、素朴に基準を書き出すだけでは、コンピテンシーは機能しない。 「基準を書けば明確になる」の落とし穴はここにある——書く作業は入口にすぎず、それを成果とつなぎ、運用を支える検証こそが本体なのに、しばしば入口だけで終わってしまう。重い検証を省く誘惑には理由がある。検証には時間も人手もかかり、しかも「この基準は成果とつながっていなかった」という不都合な結論が出ることもある。書いて配って終わりにすれば、少なくとも何かをやった形にはなる。だが、形だけ整えた基準は、明確さの手応えだけを残して、評価のぶれには手を触れない。
言葉を精緻にしても、読む人でぶれる
もう一つの問題は、基準の言葉そのものにある。「主体性」「リーダーシップ」「協調性」——こうした言葉は、書けば共有されたように見えて、読む人ごとに思い浮かべる具体的な行動が違う。ある評価者にとっての「主体性」は「指示を待たずに動くこと」で、別の評価者にとっては「周りを巻き込んで進めること」かもしれない。同じ一語が、頭のなかでは別の光景を指している。
だから、コンピテンシー辞書を細かく作り込んでも、言葉の網の目をくぐって、解釈のばらつきは残る。ここで大事なのは、基準の言葉を、人を値踏みするための立派な辞書として崇めないことだ。言葉はあくまで、評価者どうしが「何を見るか」をすり合わせるための、途中の道具にすぎない。 精緻な定義は出発点を揃える助けにはなるが、それだけで解釈が一つに定まるわけではない。むしろ、辞書が精緻になるほど、評価者は「定義に書いてあるから揃っているはず」と思い込みやすくなり、ぶれに気づく機会を失うことすらある。言葉を足すことと、目線を合わせることは、別の作業だ。前者は机の上で完結するが、後者は、同じ場面を見て「これは主体性に当たるか」を突き合わせる、地道なすり合わせを要する。
ばらつきの主因は、様式ではなく評価者
では、評価の様式をもっと精密にすれば——行動で目盛りを定めた尺度(BARS)などを凝れば——ばらつきは消えるのか。ここに、評価研究が古くから示してきた、少し苦い知見がある。Landy と Farr が1980年に Psychological Bulletin 誌で、評価の様式をあれこれ精緻にしても、評価の質はそれほど改善しないことを広く総括した。むしろ、ばらつきの主な源は、様式ではなく評価する人の側にある、というのだ。
これは前の単位——骨格の話——で見たことと地続きである。Scullen・Mount・Goff が2000年に示したように、評点を最も大きく動かすのは、評価対象の実際の出来ばえより、評価者ひとりひとりの癖だった。基準の様式をいくら磨いても、それを読み取る目のばらつきは、様式の外側にある。 だから「基準を書けば明確になる」は、二重に楽観的だ——書いた基準の妥当性も論争の途中で、しかもそれを使う人の解釈も揃わない。この二重の楽観は、誰かを責める話ではない。基準を書く人は、たいてい誠実に明確化を目指している。ただ、努力の向かう先が「言葉の精密化」に偏りがちで、本当に効く「成果との照合」と「目線のすり合わせ」に届きにくい、という構造がある。後者——揃わない目をどう扱うか——は、基準を書く作業だけでは片づかない、別の課題である。
時間・変化:1973年から今へ
順に置く。1973年、McClelland が「知能ではなく能力を測れ」と論じ、コンピテンシーの起点を置く。1980年、Landy と Farr が、評価様式の精緻化は評価の質をそれほど改善しないと総括する。1991年、Barrett と Depinet が McClelland の主張の実証的裏づけの弱さを正面から論じる。2000年、Scullen らが評点を支配するのは評価者の癖だと分解し、2005年、Bartram が妥当性には基準中心の検証が要ると示す。そして2011年、Campion らがコンピテンシー設計の重い工程を整理した。
この数十年で確からしくなったのは、「基準を書けば明確になる」という因果ではない。確からしくなったのは、基準の妥当性は論争の途中にあり、妥当に使うには重い検証が要り、それでも解釈は評価者でぶれる——という、慎重な向きのほうである。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、きれいに書けた基準表を「明確な基準」と取り違えることである。読みやすさは明確さではない。基準が明確であるとは、それが成果とつながり、しかも評価者のあいだで同じように読まれることだ。書いただけでは、そのどちらも保証されない。
助けになるのは、基準を増やす前に、いま自分が使っている評価の言葉を、具体的な行動に言い換えてみることだ。最初の一歩は10分。自分が人を評価するときに使っている言葉——「主体性がある」「詰めが甘い」など——をいくつか書き出し、それぞれ「つまり、どんな行動を見てそう言ったのか」を、一つずつ具体的な場面に言い換える。言い換えがすぐ出る言葉と、詰まる言葉が分かれるはずだ。誰かを評価し直す必要も、聞く必要もない。ただ、自分の使う基準の言葉が、どれだけ具体的な行動に降りられるかを、自分で確かめる。 詰まった言葉こそ、解釈が人によってぶれている場所である。言い換えが詰まったからといって、その言葉を捨てる必要はない。詰まりに気づいたこと自体が、次に何を評価者どうしで確かめればよいかを教えてくれる。基準は増やすより、まず自分の言葉を疑うところから始めるのがよい。
次の単位は 436「評価のばらつきを減らすには?」——基準を書いても揃わない目を、会議で揃えようとするキャリブレーションが、どこまで効くのかへ進む。
- この単位は青段(骨格)3単位目で、報酬の額の根拠になる評価基準を書けば明確になるのかを扱う。俗説は『基準を書けば明確になる』。だがこの前提自体が半世紀ちかく決着していない論争の途中にある。コンピテンシーとは仕事で成果を出す行動の特性、予測妥当性とはその基準が将来の成果をどれだけ言い当てられるかの度合い。基準が明確とは読みやすいことではなく、測ったものが本当に成果とつながっていることを指す
- コンピテンシーの起点は McClelland 1973(American Psychologist 28(1):1-14)で、知能検査でなく実際に仕事で成果を生むできること(competence)を直接測れと論じた。だが Barrett & Depinet 1991(American Psychologist 46(10):1012-1024)は同誌でこの主張を正面から再検討し、コンピテンシーが従来の能力テストを上回る予測妥当性を持つという実証的裏づけは弱いと論じた。つまり基準の妥当性は論争として残っている
- コンピテンシーを妥当に使うには書くよりずっと重い作業が要る。Bartram 2005(Journal of Applied Psychology 90(6):1185-1203)は汎用枠組み(Great Eight)の妥当性を言うには基準中心の検証(実際の成果という外部の物差しと突き合わせる作業)が要ると示し、Campion ら 2011(Personnel Psychology 64(1):225-262)はコンピテンシー設計の実務の要点として関係者の巻き込み・定義の吟味・検証・運用管理という手間のかかる工程を整理した。素朴に書き出すだけでは機能しない
- 基準の言葉そのものにも問題がある。主体性・リーダーシップ・協調性といった言葉は書けば共有されたように見えて、読む人ごとに思い浮かべる具体的な行動が違う(ある評価者の主体性は指示を待たず動くこと、別の評価者には周りを巻き込むこと)。コンピテンシー辞書を細かく作り込んでも解釈のばらつきは残る。言葉は評価者どうしが何を見るかをすり合わせる途中の道具にすぎず、人を値踏みするための辞書として崇めない
- 評価の様式を精密にしても(行動で目盛りを定めたBARSなどを凝っても)ばらつきは消えにくい。Landy & Farr 1980(Psychological Bulletin 87(1):72-107)は評価様式の精緻化が評価の質をそれほど改善せず、ばらつきの主な源は様式ではなく評価する人の側にあると総括した。Scullen ら 2000 と地続きで、基準の様式をいくら磨いてもそれを読み取る目のばらつきは様式の外側にある
- この数十年で確からしくなったのは、基準を書けば明確になるという因果ではなく、基準の妥当性は論争の途中にあり妥当に使うには重い検証が要りそれでも解釈は評価者でぶれるという慎重な向きである。コンピテンシーを明確な基準の完成形として持ち上げるのは論争の片側だけを見ることで、この単位は McClelland(由緒)と Barrett & Depinet(批判)の論争として提示する
- だからこの単位でやるのは、基準を増やす前に、いま自分が使っている評価の言葉(主体性がある・詰めが甘いなど)を書き出し、それぞれ『つまりどんな行動を見てそう言ったのか』を具体的な場面に言い換えてみることである。言い換えがすぐ出る言葉と詰まる言葉が分かれ、詰まった言葉こそ解釈が人によってぶれている場所である。誰かを評価し直す必要も聞く必要もなく自分の記録で完結する
| よくある誤解 | 実際のところ |
|---|---|
| 求める行動をコンピテンシーとして基準に書き出して一覧にすれば、誰が評価しても同じになり、評価は明確になる | 基準を書けば明確になるという前提自体が半世紀ちかく決着していない論争の途中にある。コンピテンシーの起点である McClelland 1973(知能でなく能力を測れ)は、Barrett & Depinet 1991 に正面から再検討され、従来の能力テストを上回る予測妥当性の実証的裏づけは弱いと論じられた。基準が明確とは読みやすいことではなく、測ったものが本当に成果とつながっていることを指す |
| コンピテンシーの基準表を作り込みさえすれば、それだけで評価の道具として機能する | Bartram 2005 は妥当性を言うには実際の成果と突き合わせる基準中心の検証が要ると示し、Campion ら 2011 は設計の要点として関係者の巻き込み・定義の吟味・検証・運用管理という手間のかかる工程を整理した。書く作業は入口にすぎず、成果とつなぎ運用を支える検証こそが本体である。さらに主体性・協調性などの言葉は読む人ごとに思い浮かべる行動が違い、辞書を作り込んでも解釈のばらつきは残る |
| 評価の様式(行動で目盛りを定めたBARSなど)を精密にすれば、評価のばらつきは消える | Landy & Farr 1980 は評価様式の精緻化が評価の質をそれほど改善せず、ばらつきの主な源は様式ではなく評価する人の側にあると総括した。Scullen ら 2000 も評点を支配するのは評価者の癖だと示した。基準の様式を磨いても読み取る目のばらつきは様式の外側にある。だからこの単位でやるのは、基準を増やす前に、自分の使う評価の言葉を具体的な行動に言い換えて、どの言葉で解釈がぶれるかを自分で確かめることである |
皮肉なのは、基準を細かく書き込むほど、それが「明確になった」という手応えだけが増えることである。だが読みやすさは明確さではない。コンピテンシーという発想は、そもそも成果をよく予測するのかという点で、いまも論争の途中にある。妥当に使おうとすれば、書く何倍もの検証が要る。そして言葉をどれだけ精緻にしても、それを読む評価者の目は、様式の外側でぶれ続ける。基準表が客観を約束しているように見えるとき、たいていそれは、まだ誰も、書かれた言葉と、それが成果とつながっているかと、読む人ごとの解釈のぶれを、別々に測っていないだけかもしれない。基準は、書けば明確になるのではない——成果とつなぐ検証と、評価者の目のすり合わせを伴って、はじめて働きだす。次の単位は 436「評価のばらつきを減らすには?」——書いても揃わない目を、会議で揃えようとするキャリブレーションが、どこまで効くのかへ進む。
Q1. 『基準を書けば明確になる』という前提は、半世紀ちかく決着していない ____ の途中にある。基準が明確とは読みやすいことではなく、測ったものが本当に ____ とつながっていること——つまり ____ 妥当性が問われる。穴埋め
Q2. コンピテンシーをめぐる McClelland 1973 と Barrett & Depinet 1991 の関係として正しいものはどれか。選択
Q3. 『基準を書き出せばコンピテンシーは機能する』という考えに対し、Bartram 2005・Campion ら 2011 から言える反論を述べよ。一問一答
Q4. 評価の様式(BARS など)を精緻にしても評価のばらつきが消えにくいのはなぜか。Landy & Farr 1980・Scullen ら 2000 に触れて述べよ。一問一答
Q5. この単位が扱った研究を、年の早い順に並べよ。(ア)Barrett & Depinet が McClelland 批判を論じる(イ)McClelland がコンピテンシーの起点を置く(ウ)Bartram が基準中心の検証を示す(エ)Landy & Farr が様式の精緻化の限界を総括する並べ替え
紙かメモアプリに今日の日付を書く。次に、自分が人を評価したり褒めたり気にしたりするときに使っている言葉——『主体性がある』『詰めが甘い』『気が利く』『視野が狭い』など——を、思いつくままいくつか書き出す。各語について、『つまり、どんな行動を見てそう言ったのか』を、具体的な一つの場面に言い換えて書く(例:主体性がある→前回、頼む前に段取りを組んでいた)。言い換えがすぐ出る言葉と、うまく降りられず詰まる言葉が分かれるはずだ。誰かを評価し直したり、本人に確かめたりする必要はなく、自分の使う言葉の記録だけで完結させる。最後に、具体的な行動にすぐ言い換えられた語の数と、詰まった語の数を書き添える。詰まった語こそ、解釈が人によってぶれる場所である。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- McClelland D.C. (1973) ‘Testing for competence rather than for intelligence’, American Psychologist 28(1):1-14 — doi.org
- Barrett G.V., Depinet R.L. (1991) ‘A reconsideration of testing for competence rather than for intelligence’, American Psychologist 46(10):1012-1024 — doi.org
- Bartram D. (2005) ‘The Great Eight Competencies: A Criterion-Centric Approach to Validation’, Journal of Applied Psychology 90(6):1185-1203 — doi.org
- Campion M.A., Fink A.A., Ruggeberg B.J., Carr L., Phillips G.M., Odman R.B. (2011) ‘Doing Competencies Well: Best Practices in Competency Modeling’, Personnel Psychology 64(1):225-262 — doi.org
- Landy F.J., Farr J.L. (1980) ‘Performance rating’, Psychological Bulletin 87(1):72-107 — doi.org
- Scullen S.E., Mount M.K., Goff M. (2000) ‘Understanding the latent structure of job performance ratings’, Journal of Applied Psychology 85(6):956-970 — doi.org