落とした人のその後は、こちらのデータには最初から書かれていない
選考の良し悪しは、採った人のその後で語られる。落とした人のその後で語られることはない。データが無いからである。そしてデータが無いのは、落としたからである。
前の単位の終わりで、人が判断して落とす側に入ると書いた。ここがその段である。集める話から、絞る話に変わる。 ただし、絞るという言葉は、こちら側の手つきしか指していない。
この単位が扱うのは一点——選考で誰を落としているのかと、落とした人について何が分かるのかである。 どの候補者を採るべきかは扱わない。差別や格差に触れるところでは、何がどう測られたかだけを書き、是正の政策や制度の是非は論じない。
結果は、通した人についてしか生まれない
採用の話から少し離れたところに、この形をいちばん正確に書いた文がある。2018年に *The Quarterly Journal of Economics* 133(1):237-293 へ出た論文は、保釈の判断を扱っている。
> “We only observe crime outcomes for released defendants, not for those judges detained.”(我々は、釈放された被告についてしか犯罪の結果を観測しない。裁判官が勾留した被告については観測しない)
> “This makes it hard to evaluate counterfactual decision rules based on algorithmic predictions.”(このため、別の判断規則だったらどうなったかを評価することが難しくなる)
採用に置き換えると、こうなる。 通した人については、入社したか、どれくらい続いたか、どう評価されたかが記録に残る。落とした人については、何も残らない。 残らないのは記録の付け方が悪いからではなく、その人にその後が起きる場所を、こちら側が用意しなかったからである。
採用の助言が、採った人と、いま残っている人からしか書かれていないのは、この形のためである。
この形には名前が付いている
2017年のデータマイニングの国際会議に出た論文が、この問題に名前を与えている。
> “However, there are many domains where the data is selectively labeled in the sense that the observed outcomes are themselves a consequence of the existing choices of the human decision-makers.”(しかし、観測される結果そのものが人間の意思決定者の既存の選択の帰結である、という意味でデータが選択的にラベル付けされている領域は多い)
> “This selective labeling makes it harder to evaluate predictive models as the instances for which outcomes are observed do not represent a random sample of the population.”(この選択的なラベル付けは予測モデルの評価を難しくする。結果が観測される事例は、母集団の無作為標本を表していないからである)
同じ論文の導入部は、保釈の例でこう言い直している。
> “If a defendant is denied bail, then there is no opportunity for them to commit a crime or fail to show up for their court appearance, so we have no way to know what would have happened had they been released.”(保釈が認められなければ、その人が罪を犯す機会も、出廷しない機会も生じない。だから、釈放されていたら何が起きたかを知るすべがない)
手元の合格率も、入社後の評価も、この窓の内側で計算されている。 窓の外側は、精度が低いのではなく、値が存在しない。
15社の記録で測られたのは、判断に反して採った側だった
採用そのもので、この窓の内側をていねいに測った研究がある。2018年に *The Quarterly Journal of Economics* 133(2):765-800 へ出た論文である。
> “We study the introduction of job testing across 15 firms employing low-skilled service sector workers.”(低技能のサービス業の労働者を雇う15社で、職務テストの導入を研究する)
> “When faced with similar applicant pools, we find that managers who appear to hire against test recommendations end up with worse average hires.”(似た応募者プールに向き合ったとき、テストの推奨に反して採用したと見える管理職は、平均的により悪い採用に行き着く)
ここで測られているのは、採った人の在職期間である。 テストの推奨に従わずに採った人が、そのあとどうだったか。推奨に従って落とした人がどうだったかは、この設計でも測られていない。 窓は動かせない。動かせるのは、窓の内側で何を比べるかである。
同じ研究が、版によって題も語も違う
2008年に同じ季刊誌の 123(1):219-277 へ出た研究は、米国の小売の1,363の事業所を対象に、職務テストの導入を追っている。この論文には作業論文の版があり、題が違う。 掲載版は「職務テストは少数派の労働者に害を与えるか——小売事業所からの証拠」、作業論文版は「職務テストは少数派の労働者に害を与えるだろうか」である。
逐語は作業論文版(2004年9月)から引く。
> “We document that testing yielded more productive hires at this firm -- raising median tenure by 10-plus percent.”(この企業でテストはより生産的な採用をもたらし、在職期間の中央値を10%以上引き上げたことを記録する)
> “Consistent with prior research, minorities performed worse on the test. Yet, testing had no measurable impact on minority hiring, and productivity gains were uniformly large among minorities and non-minorities.”(先行研究と整合的に、少数派はテストで低い成績だった。しかしテストは少数派の採用に測定可能な影響を与えず、生産性の上昇は少数派でも非少数派でも一様に大きかった)
掲載版では表現が変わっている。 作業論文版の「公平と効率のトレードオフ」は掲載版で「平等と効率のトレードオフ」になり、在職期間の書き方も「中央値を10%以上」から「平均と中央値を10%かそれ以上」になる。同じ数字でも、どちらの版から引いたかを書かないと、後から確かめられない。
ここで制度の是非は論じない。書けるのは、何が測られ、どちらの版にどう書かれているかまでである。
査読を通るあいだに、推定値が動いた
2026年に *The Review of Economic Studies* 93(2):1200-1240 へ載った論文は、採用を「探索」の問題として扱う。掲載版そのものの本文には到達できなかったので、以下は掲載版に最も近い公開版(2024年11月)から引く。
> “This paper views hiring as a contextual bandit problem: to find the best workers over time, firms must balance ‘exploitation’ (selecting from groups with proven track records) with ‘exploration’ (selecting from under-represented groups to learn about quality).”(本稿は採用を文脈付きバンディット問題として見る。時間をかけて最良の働き手を見つけるには、実績のある集団から選ぶことと、質について学ぶために代表の少ない集団から選ぶことのあいだで均衡を取らねばならない)
> “we show that this approach improves the quality (as measured by eventual hiring rates) of candidates selected for an interview”(この方法が、面接に選ばれた候補者の質を——最終的な採用率で測って——改善することを示す)
成果指標は「最終的な採用率」である。 入社後の業績ではない。ここを言い換えると、原典より強い主張になる。
そして版の話がもう一つある。この論文には2020年の作業論文版があり、査読を経るあいだに主要な推定値が動いた。 面接に選ばれた人のうち最終的に採用される割合は、後の版では人が選んだ場合が10%、教師あり学習のモデルが32%、探索を含むモデルが27%と書かれている。作業論文版では、モデルが2本立てで示されており、この歩留まりの値も違っていた。 面接に選ばれる人の構成についての数値も、後の版では9.4%から24.3%へと書かれ、作業論文版とは一致しない。抄録からは一文が消えている。
同じデータ、同じ企業の同じ記録である。 動いたのは、モデルの組み方と、報告の仕方のほうである。「アルゴリズムを入れると採用がこれだけ良くなる」という形の数値は、査読の前と後で1.5倍から2倍動きうる。 だから引くときは、どちらの版から引いたかを書く。
どこに載っているかで、通った検査が違う
この単位で引いたものは、載っている場所が4種類に分かれる。査読誌、国際会議の会議録、査読前の作業論文、そして年刊のシリーズに収められた章である。
最後の1つについて断っておく。選考における人と環境の適合を扱った1999年の章は、査読誌の論文ではない。 招きに応じて書かれる年刊シリーズの1章である。しかも、6通りの経路をたどっても巻とページを確定できなかった。 流通している巻・ページの表記の裏が取れていないので、ここでは巻もページも書かない。
時間・変化:2004年の作業論文から、2026年の掲載号まで
順に置く。2004年、職務テストの効果を測った作業論文が出る。題は問いかけの形である。2008年、査読を経て掲載され、題が変わり、語も変わる。2017年、結果が選択的にしか観測されないという問題に名前が与えられる。2018年、保釈判断で同じ問題が定式化され、同じ年、15社の職務テストで判断に反した採用の平均が測られる。2020年、採用を探索として扱う作業論文が出る。2026年、その掲載版が季刊誌の号に載り、推定値は作業論文版と違っている。
22年で厚くなったのは、答えではなく、窓の輪郭のほうである。 何が測れて何が測れないかが、この期間にはっきりしていった。
今日の決定が、明日のデータを作る
もう一段ある。今日通した人の結果だけが記録に残り、その記録が次の基準の材料になる。 次の基準は、また同じ側の人だけを通す。輪の外に出た人の結果は、次の輪にも入らない。
これは誰かの怠慢ではない。選考をするかぎり、記録はこの形にしかならない。 分かるのは、その形の中で計算された数字を、外側まで通じる数字として読まないこと、それだけである。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、手元の合格者の成績が上がったことを、選考の精度が上がった証拠として読むことである。上がったのは窓の内側の平均であって、窓ごと動いたかどうかは、そこには映らない。
標本の偏りを断っておく。ここで引いた一次の対象は、米国の低技能サービス業15社、米国の小売1,363事業所、米国の保釈判断、そして企業の採用記録である。 日本の選考記録を対象に、落とした人のその後まで追った査読研究には行き着けなかった。
助けになるのは、落とした人について何が分かっているかを、実際に数えてみることである。たいていはゼロに近い。ゼロだと分かることが結果である。
最初の一歩は10分。過去の選考記録を1件選び、通した人について残っている項目と、落とした人について残っている項目を、それぞれ書き出して数を比べる。 記録に触れられないなら、公開されている選考基準を1件読み、そこに書かれている段のうち、落ちた人にその後の連絡が行くと書かれている段がいくつあるかを数えてもよい。
次の単位は、その落ちた人と、通った人の両方が、選考の途中で何を感じたかの話である。そこでも、測られているものは行動の手前で止まっている。
- 2018年に *The Quarterly Journal of Economics* 133(1):237-293 へ出た論文は、保釈の判断について「我々は釈放された被告についてしか犯罪の結果を観測せず、裁判官が勾留した被告については観測しない」と書く。採用でも同じで、落とした人のその後は記録に生まれない。
- 2017年のデータマイニングの国際会議に出た論文は、この形を「選択的ラベル」と呼び、観測される結果そのものが人間の意思決定者の選択の帰結であるとき、結果が観測される事例は母集団の無作為標本を表していない、と書いている。
- 2018年に *The Quarterly Journal of Economics* 133(2):765-800 へ出た論文の標本は、低技能のサービス業の労働者を雇う15社である。テストの推奨に反して採用したと見える管理職は、平均的により悪い採用に行き着いた。ここでも測られているのは採った人の側だけである。
- 2008年に同じ季刊誌の 123(1):219-277 へ出た研究は、米国の小売1,363事業所を対象としている。作業論文版と掲載版で題が違い、語も違う(公平と効率/平等と効率)。作業論文版の逐語は在職期間の中央値を10%以上引き上げたと書き、テストは少数派の採用に測定可能な影響を与えなかったと書く。
- 2026年に *The Review of Economic Studies* 93(2):1200-1240 へ載った論文の成果指標は「最終的な採用率」であって、入社後の業績ではない。面接に選ばれた人のうち最終的に採用される割合は、後の版で人が選んだ場合10%、教師あり学習のモデル32%、探索を含むモデル27%と書かれている。
- 同じ論文には2020年の作業論文版があり、査読を経るあいだに主要な推定値が動いた。歩留まりも構成の数値も版で違い、抄録からは一文が消えている。同じデータでも、査読の前と後で数値は1.5倍から2倍動きうる。どちらの版から引いたかを書かなければ確かめられない。
- 選考における人と環境の適合を扱った1999年の文献は、査読誌の論文ではなく年刊シリーズに収められた章である。6通りの経路をたどっても巻とページを確定できなかったため、この記事では巻もページも書いていない。
| よくある誤解 | 実際のところ |
|---|---|
| 選考の精度は、採った人のその後を追えば確かめられる | 採った人のその後は、通した人についてだけ観測される。落とした人にはその後が起きる場所が用意されていない。2017年の会議論文はこれを選択的ラベルと呼び、結果が観測される事例は母集団の無作為標本を表していないと書く。窓の内側の平均が上がったことと、窓ごと動いたかどうかは別である。 |
| アルゴリズムを使うと採用の質がこれだけ上がる、という数値は確定している | 採用を探索の問題として扱った論文には2020年の作業論文版と2026年の掲載版があり、査読を経るあいだに主要な推定値が動いた。歩留まりも構成の数値も版で違い、抄録からは一文が消えている。しかも成果指標は最終的な採用率であって、入社後の業績ではない。 |
| 同じ論文なら、どの版から引用しても内容は同じである | 米国の小売1,363事業所を対象にした研究は、作業論文版と掲載版で題が違い、公平と効率/平等と効率という語も違い、在職期間の書き方も違う。採用を探索として扱った論文では数値そのものが動いている。引くときはどちらの版かを書く必要がある。 |
気の利いた話にはならない。この段でいちばん充実しているデータは、通した人についてのデータであり、それは自分たちが通したからそこにある。落とした人の欄が空なのは、記録の不備ではなく、選考の定義そのものである。だから選考が上手くなったかどうかは、たぶん、手元の合格者の成績では分からない。分かるのは、空欄がどれだけ空欄のままかということのほうである。
Q1. 2017年の国際会議の論文は、観測される結果そのものが人間の意思決定者の選択の【 ① 】であるとき、データは選択的にラベル付けされていると述べ、結果が観測される事例は母集団の【 ② 】を表していない、と書いた。この形を扱った2018年の保釈判断の論文は、【 ③ 】された被告についてしか犯罪の結果を観測しない、と書いている。穴埋め
Q2. 低技能のサービス業15社で職務テストの導入を追った2018年の研究は、何を測ったか。そして、この設計でも測られていないものは何か。一問一答
Q3. 米国の小売1,363事業所を対象にした研究について、作業論文版と掲載版で違っているものを3つ挙げよ。一問一答
Q4. 採用を探索の問題として扱った論文の成果指標は何か。選択
Q5. 選考の記録が作られていく順に並べ替えよ。(A)その記録が次の基準の材料になる(B)応募が届く(C)人が判断して一部を落とす(D)通した人についてだけ、その後の結果が記録される並べ替え
過去の選考の記録を1件選ぶ。自分の組織のものでもよいし、触れられないなら公開されている選考基準や募集要項を1件選んでもよい。紙かメモアプリに、日付と、選んだ記録の名前(社外に出さないなら記号でよい)を書く。14日間、1日5分だけ手を動かす。左の列に『通した人について残っている項目』、右の列に『落とした人について残っている項目』を、思い出した順・見つけた順に1行ずつ足していく。項目とは、たとえば入社したかどうか、いつまで在職したか、評価がどうだったか、といった単位である。個人が特定できる情報は書かない。名前も、日付の細部も書かない。項目の名前だけを書く。14日目に、左と右の行数を数えて2つの数として書く。差の理由の分析は書かない。良し悪しの評価も書かない。数だけを残す。採用の実務に今すぐ関われない場合は、自分が過去に受けた選考を1つ思い出し、通ったあとに自分に届いた連絡と、落ちたあとに届いた連絡を、同じ2列で数えれば同じ形になる。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Kleinberg J., Lakkaraju H., Leskovec J., Ludwig J., Mullainathan S. (2018) 'Human Decisions and Machine Predictions', The Quarterly Journal of Economics 133(1):237-293 — doi.org
- Lakkaraju H., Kleinberg J., Leskovec J., Ludwig J., Mullainathan S. (2017) 'The Selective Labels Problem: Evaluating Algorithmic Predictions in the Presence of Unobservables', KDD '17: Proceedings of the 23rd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, pp.275-284 — doi.org
- Hoffman M., Kahn L.B., Li D. (2018) 'Discretion in Hiring', The Quarterly Journal of Economics 133(2):765-800 — doi.org
- Autor D.H., Scarborough D. (2008) 'Does Job Testing Harm Minority Workers? Evidence from Retail Establishments', The Quarterly Journal of Economics 123(1):219-277 — doi.org
- Li D., Raymond L., Bergman P. (2026) 'Hiring as Exploration', The Review of Economic Studies 93(2):1200-1240 — doi.org
- Werbel J.D., Gilliland S.W. (1999) 'Person-environment fit in the selection process', in Research in Personnel and Human Resources Management, JAI Press(年刊シリーズの章。巻・ページは未確定) — www.emerald.com