四半世紀ぶんの順位表が2022年に書き換わった。動いたのは選考ではなく、補正のかけ方である
何が仕事ぶりを言い当てるかについては、順位表がある。1998年に出て、四半世紀のあいだ研修資料に載り続けた表だ。2022年に、その表が書き換わった。書き換えたのは新しい選考方法ではない。数字にかける補正の手続きである。
前の単位で、市場の統計が誰を何件と数えているかを見た。ここからは、そうやって集めてきた不揃いな材料を、一つの判断に畳む段に入る。
持ち場を狭めておく。ここで扱うのは、採用の場で使われる材料が、仕事ぶりをどれだけ言い当てるかという推定値そのものと、その値が動いた理由だけである。学業の棚が扱った「制限時間つきの試験は速さを混ぜている」という論点には触れない。そして、以下に出てくる一般知能の検査の係数を、人の頭の良さの順位表として読まない。これは検査の点と評価の点の重なり具合であって、人の格付けではない。
1998年に出て、四半世紀ぶん引かれた表
1998年、*Psychological Bulletin* 124(2) に「85年ぶんの研究知見」と題した論文が出た。採用で使われる主な手続きについて、仕事ぶりとの相関を一覧にしたものである。ワークサンプル .54、一般知能の検査 .51、構造化面接 .51、職務知識テスト .48、誠実性テスト .41、アセスメントセンター .37、非構造化面接 .38、経験的キー式のバイオデータ .35、誠実性 .31、職務経験年数 .18、興味 .10。この並びが、そのまま順位として引かれ続けた。
2022年に動いたのは、選考のほうではない
2022年、*Journal of Applied Psychology* 107(11) に再推定が出た。要旨の言い方はこうである。「これまで用いられてきた5つのやり方には、いずれもしばしば大幅な過補正をもたらす重大な問題があり、したがって多くの選考手続きの妥当性は大幅に過大評価されてきたと結論する。……従来の要約で上位だった手続きの多くは順位としては上位のままだが、平均妥当性の推定値は .10 から .20 ポイント下がる。構造化面接が最上位の選考手続きとして浮上した」。
何が過補正なのか。採用の研究では、選ばれて入った人だけを追いかけるので、得点の散らばりが実際より狭くなる。これを見込んで値を戻す操作を範囲制限の補正という。問題は、その補正の大きさをどこから持ってくるかである。補正係数はふつう予測的妥当性の研究から作られるが、メタ分析に入っている研究の約80%は同時的妥当性の研究である。採用のときに測ったのではなく、すでに働いている人にあとから検査を受けさせた研究のほうが、圧倒的に多い。前者から作った大きな補正を後者に当てれば、値は膨らむ。
改訂後の値は、同じ著者らが2023年に *Industrial and Organizational Psychology* 16(3) の焦点論文へ再掲した表から引く。2022年の論文本体の表には到達できていないので、この経路であることは書いておく。構造化面接 .51→.42、職務知識テスト .48→.40、経験的キー式バイオデータ .35→.38、ワークサンプル .54→.33、一般知能 .51→.31、誠実性テスト .41→.31、アセスメントセンター .37→.29、誠実性(全般).31→.21、非構造化面接 .38→.19、職務経験年数 .18→.07、文脈化した誠実性 .25→.00。そして興味だけが .10→.24 と大きく上がった。
同じ論点をめぐって、正反対の向きがある
この話は、片方が正しくて片方が間違っている、という形をしていない。2023年、*Journal of Applied Psychology* 108(8) に、Oh・Le・Roth の3氏による反論(1300-1310ページ)と、Sackett らの応答(1311-1315ページ)が続けて載った。応答の逐語はこうである。「彼らは我々の論文を、同時的妥当性研究において一般に範囲制限の補正をするなと勧めるものと解した。しかし我々は、補正に必要な情報が手に入る場合には補正を支持すると強調している」。争点は「補正するかしないか」ではなく、メタ分析をするときに、必要な情報が原論文に書かれていないという状況をどう扱うかである。
もう一つ、正反対を向いた数字が流通している。2016年10月付の「100年ぶんの研究知見」と題したワーキングペーパーは、一般知能の妥当性を .65 としている。理由は、やはり範囲制限の補正である。ただし向きが逆で、新しい補正手続きによって「古い、精度の低い手続きが一般知能の妥当性を大幅に過小評価していたことが明らかになった」と書かれている。表紙にはこうある。「この作業論文は Schmidt and Hunter (1998) の更新版として用意された。世界中の実務家と研究者から繰り返し要望があったため、ResearchGate と SSRN で入手できるようにした。我々はこの論文の版を後日公刊するつもりである」。撤回されたのではない。査読誌に載らないまま、後日出すと書かれた状態が続いている。
時間・変化:人が畳むのと、式が畳むのと
順位表の話とは別に、畳み方そのものを比べた研究がある。2000年に *Psychological Assessment* 12(1) へ出たメタ分析は、人の総合判断と、決まった式による機械的な合算を突き合わせた。逐語で引く。「平均すると、機械的な予測の手法は臨床的な予測よりおよそ10%正確だった。分析の仕方によるが、機械的予測が臨床的予測を実質的に上回ったのは検討した研究の33%から47%である。臨床的予測が機械的予測と同程度に正確なことも多かったが、実質的に上回った研究はごくわずか(6%から16%)だった」。
ただし、これは人の健康と行動についての予測を集めたメタ分析であって、採用に限った研究ではない。そのまま選考の話に持ち込むのは早い。近いところでは、2016年に *Organizational Behavior and Human Decision Processes* 137 へ出た研究が、題そのもので「非構造化面接の情報は、いつ、なぜ採用判断を損なうことがあるか」と問うている。ここでは数値は出さない——標本と効果量の逐語を取れていないからである。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、係数を能力の順位として読むことである。.42 と .31 の差は、人の優劣ではなく、二つの点数の重なり具合の差でしかない。第二の妨げは、補正前か補正後かを書かずに数字だけを持ち歩くことだ。この単位に出てきた値は、1998年の表も2022年の再推定も2016年の未公刊版も、すべて補正後の値である。補正の手続きが違うだけで、.31 にも .51 にも .65 にもなる。
標本の偏りを断っておく。これらの推定は米国と欧州の職場で採られたものが大半で、日本の採用を対象にした査読研究はごく少ない。しかも大半は、すでにその仕事に就いている人に、あとから検査を受けさせて測っている。そして何より、もともと選択肢の多い人ほど、その方法を試せる、という逆向きを排除できない。複数の選考を受け比べられる状態そのものが、条件に左右される。
助けるのは、材料を先に決めることである。何を見るかを、見る前に一度だけ書き出しておく。あとから足した材料は、たいてい判断を変えるためではなく、すでに出ている結論を裏づけるために足される。
最初の一歩は5分。直近で何かを評価した場面を1つ思い出し、そのとき使った材料を列挙して、件数を数える。多いか少ないかは問わない。数えるだけでいい。
次の単位は 091「認知バイアスの管理」——材料をそろえても、それを読むときの目盛りのほうが動く。次の段では、客観の指標と主観の指標が逆を向く場面へ進む。
- 1998年に Psychological Bulletin 124(2) へ出た「85年ぶんの研究知見」の表では、ワークサンプル .54、一般知能の検査 .51、構造化面接 .51、職務知識テスト .48、非構造化面接 .38、興味 .10 と並んでいた。この並びが四半世紀のあいだ順位として引かれ続けた
- 2022年に Journal of Applied Psychology 107(11) へ出た再推定は、従来の5つの補正のやり方がしばしば大幅な過補正をもたらすため妥当性は大幅に過大評価されてきたと結論し、平均妥当性の推定値は .10 から .20 ポイント下がり、構造化面接が最上位の選考手続きとして浮上したと述べている
- 過補正が起きる理由は、範囲制限の補正係数がふつう予測的妥当性の研究から作られるのに対し、メタ分析に入っている研究の約80%は同時的妥当性の研究(すでに働いている人にあとから検査を受けさせた研究)だからである
- 2023年に Industrial and Organizational Psychology 16(3) の焦点論文へ再掲された対比表では、構造化面接 .51→.42、職務知識テスト .48→.40、ワークサンプル .54→.33、一般知能 .51→.31、非構造化面接 .38→.19、文脈化した誠実性 .25→.00、職務経験年数 .18→.07。大きく上がったのは興味の .10→.24 だけである(2022年の論文本体の表には到達しておらず、この再掲表から取った値である)
- この論争は査読誌の上で正規に行われている。2023年の Journal of Applied Psychology 108(8) に Oh・Le・Roth の反論(1300-1310)と Sackett らの応答(1311-1315)が続けて載り、応答は「補正に必要な情報が手に入る場合には補正を支持すると強調している」と述べている。争点は補正の有無ではなく、必要な情報が原論文にない状況の扱い方である
- 同じ範囲制限の補正をめぐって、正反対の向きの数字も流通している。2016年10月付のワーキングペーパーは一般知能の妥当性を .65 とし、古い手続きが大幅に過小評価していたと述べる。表紙には「ResearchGate と SSRN で入手できるようにした」「この論文の版を後日公刊するつもりである」とあり、撤回されたのではなく未公刊のままである
- 2000年に Psychological Assessment 12(1) へ出たメタ分析では、機械的な予測は臨床的な予測より平均でおよそ10%正確で、機械的予測が実質的に上回ったのは33%から47%の研究、臨床的予測が実質的に上回ったのは6%から16%だった。ただしこれは人の健康と行動についての予測を集めたもので、採用に限った研究ではない
| よくある誤解 | 実際のところ |
|---|---|
| 採用でいちばん結果を言い当てるのは一般知能の検査だと、研究で決着がついている | 決着していない。1998年の表では .51 だったが、2022年の再推定では .31 になり、構造化面接が最上位に入れ替わった。同じ範囲制限の補正をめぐって、2016年の未公刊のワーキングペーパーは逆向きに .65 としている。動いているのは選考の中身ではなく、補正の手続きである |
| 2022年の再推定で、それまでの数字は撤回された | 撤回ではなく再推定である。そして 2016年の .65 の版のほうも撤回されていない。査読誌に載らないまま、表紙に「後日公刊するつもりである」と書かれた状態で流通している。撤回・却下・未公刊は別々のことで、混ぜて語ると事実が変わる |
| 妥当性の係数が高い手続きほど、人を正しく格付けできるということだ | 係数は二つの点数の重なり具合であって、人の格付けの精度ではない。しかも同じ手続きの同じデータでも、補正の入れ方だけで .31 にも .51 にも .65 にもなる。数字を持ち歩くときは、補正前か補正後か、どの補正かを必ず添える必要がある |
順位表というのは、便利にできている。読む側は一列に並んだものを上から見るだけでよく、その列がどうやって作られたかを訊かなくていい。だから、四半世紀のあいだ、いちばん上にあるものが正しい答えとして配られてきた。書き換わったいまも、事情は同じである。新しい順位表が、また上から読まれるだけだ。皮肉なのは、この分野がこれだけ丁寧に検算をしているのに、その検算の中身——どの補正を、どの研究に、どこから持ってきた係数で当てたのか——が、いちばん引用されない部分だ、というところである。
Q1. 2022年の再推定で妥当性の値が下がった理由は、____ の補正のかけ方である。補正係数はふつう ____ 妥当性の研究から作られるが、メタ分析に入っている研究の約 ____ % は ____ 妥当性の研究だった。穴埋め
Q2. 2023年の焦点論文に再掲された対比表で、1998年から2022年にかけて大きく「上がった」項目はどれか。選択
Q3. 一般知能の妥当性を .65 とする2016年の「100年ぶんの研究知見」について、正しい記述はどれか。選択
Q4. この単位に出てきた一般知能の検査についての推定値を、値の小さい順に並べなさい。/(ア)1998年の表の値/(イ)2022年の再推定値/(ウ)2016年の未公刊ワーキングペーパーの値並べ替え
Q5. この論争が査読誌の上で進んだ順に並べなさい。/(ア)Journal of Applied Psychology 108(8) に Oh・Le・Roth の反論が載る/(イ)Journal of Applied Psychology 107(11) に過補正を指摘する再推定が載る/(ウ)Industrial and Organizational Psychology 16(3) に、1998年と2022年を並べた対比表を含む焦点論文が載る/(エ)同じ 108(8) に Sackett らの応答が載る並べ替え
直近で自分が何かを評価した場面、または自分が評価された場面を1つ思い出す。仕事の場面でなくてよい——習い事の発表、地域の活動の割り振り、家族で進路を相談したとき、何かの応募書類を自分で見直したときでもよい。その場面で実際に材料として使われたものを、思い出せるだけ書き出して数える。書き出すのは材料の名前だけにする(何を見たか、何を聞いたか、どの記録を参照したか)。人の評価や人柄の判定は書かない。数え終わったら、そのうち「見る前から見ると決めていた材料」が何件あったかを、内訳として書き添える。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Schmidt F.L., Hunter J.E. (1998) 'The Validity and Utility of Selection Methods in Personnel Psychology: Practical and Theoretical Implications of 85 Years of Research Findings', Psychological Bulletin 124(2):262-274 — doi.org
- Sackett P.R., Zhang C., Berry C.M., Lievens F. (2022) 'Revisiting meta-analytic estimates of validity in personnel selection: Addressing systematic overcorrection for restriction of range', Journal of Applied Psychology 107(11):2040-2068 — doi.org
- Sackett P.R., Zhang C., Berry C.M., Lievens F. (2023) 'Revisiting the design of selection systems in light of new findings regarding the validity of widely used predictors', Industrial and Organizational Psychology 16(3):283-300 — doi.org
- Oh I.-S., Le H., Roth P.L. (2023) 'Revisiting Sackett et al.'s (2022) rationale behind their recommendation against correcting for range restriction in concurrent validation studies', Journal of Applied Psychology 108(8):1300-1310 — doi.org
- Sackett P.R., Berry C.M., Lievens F., Zhang C. (2023) 'Correcting for range restriction in meta-analysis: A reply to Oh et al. (2023)', Journal of Applied Psychology 108(8):1311-1315 — doi.org
- Schmidt F.L., Oh I.-S., Shaffer J.A. (2016年10月) 'The Validity and Utility of Selection Methods in Personnel Psychology: Practical and Theoretical Implications of 100 Years of Research Findings', ワーキングペーパー(未公刊、2026年8月閲覧) — home.ubalt.edu
- Grove W.M., Zald D.H., Lebow B.S., Snitz B.E., Nelson C. (2000) 'Clinical versus mechanical prediction: A meta-analysis', Psychological Assessment 12(1):19-30 — pubmed.ncbi.nlm.nih.gov
- Kausel E.E., Culbertson S.S., Madrid H.P. (2016) 'Overconfidence in personnel selection: When and why unstructured interview information can hurt hiring decisions', Organizational Behavior and Human Decision Processes 137:27-44 — doi.org