満足度と、直後に覚えた量の相関は .02 だった——「役に立つと思ったか」を聞くと .26 になる
研修のあとに配られる紙には、たいてい満足度の欄がある。1997年に34件の研究から集計された相関では、その満足度と、直後に覚えた量のあいだの相関係数は .02 だった。ゼロではなく、ゼロに近いだけである。
測るほうを見る
前の単位では、育てたという申告が数えやすく、育ちが数えにくいことを見た。ここではその上に、そもそも組織が学習の何を測っているのか、という問いを置く。
持ち場を狭めておく。個人の記憶をどう測るか、思い出す練習が記憶に何をするか、という話は学業の棚が扱った。ここで扱うのは、組織が研修や育成の効果を測るときに使う枠組みと、その枠組みの段と段のあいだがどこまで確かめられているか、だけである。測定ツールの推奨も、費用対効果の計算の仕方も書かない。
測りやすい段だけが測られる、というのはこの棚が何度も戻る話だが、その展開は棚の入口が引き受けている。ここは実務に徹する。
4つの段
研修の効果を測る枠組みとして、いちばん広く使われているのは4つの段である。反応、学習、行動、結果。参加者が満足したか。何を覚えたか。現場で行動が変わったか。組織の成果が動いたか。
この4段を提示した Kirkpatrick 1994 『Evaluating Training Programs』は書籍である。ただし、この枠組みが何を前提にしているかを検討した論文は、査読誌の側にある。
1989年に Personnel Psychology へ出た論文の要旨は、この枠組みをこう要約している——4つの段階は、上昇し、因果的に関連し、正に相関しあうものとして提案された。上へ行くほど大事で、下の段がよければ上の段もよくなる、という形である。
この論文は、その前提のうち、しばしば言葉にされないまま置かれている3つを取り出して検討した。集められたのは12件の研究と26個の相関。結論のひとつは、研修への反応は他の測定の代わりには使えない、である。
30年目にして前提を数えた、というのがこの論文の位置である。
段と段のあいだ
1997年、同じ雑誌に続きが出る。34件の研究から111個の相関を集めたメタ分析である。
この論文は、いちばん下の段を2つに割った。感情としての反応——楽しかったか、満足したか——と、有用性の判断——役に立つと思ったか——である。
数字はこうなった。感情としての反応と、直後に覚えた量の相関は .02(9個の相関)。有用性の判断と、直後に覚えた量の相関は .26(6個)。有用性の判断と、現場での行動の相関は .18(3個)。そして、直後に覚えた量と現場での行動の相関は .11(16個)である。
読み方を書いておく。これは相関係数であって効果量ではない。そして、この論文の結論は、満足度が無意味だということではない。同じ下の段でも、聞き方を変えると後の段との結びつきが変わる、ということである。実際、有用性の判断は、直後に覚えた量よりも現場での行動とよく結びついていた。
段は、下から順に積み上がってはいない。
何が測られているか
もうひとつ、測られ方そのものの偏りがある。
2003年に Journal of Applied Psychology へ出たメタ分析は、研修の効果を測った研究から397個の効果量を集め、4つの段のどれを測ったかで分類した。反応が15個(936人)、学習が234個(15,014人)、行動が122個(15,627人)、結果が26個(1,748人)である。
効果量そのものは、4つの段でほとんど変わらない。反応で0.60、学習で0.63、行動で0.62、結果で0.62。段が上がるほど効果が薄まる、という形にはなっていない。
面白いのは、数のほうである。研究の世界で、いちばん測られていないのが反応の段だった。いっぽう実務の世界では、いちばん測られているのが反応の段である。研修のあとに配られる紙のことを思い出せばよい。
つまり、実務がもっとも頼りにしている段について、研究の蓄積はもっとも薄い。この非対称は、どちらかが怠けているという話ではない。反応は現場では数秒で集まり、研究では効果量として扱いにくい。集めやすさと、扱いやすさが、逆を向いているだけである。
同じ人が、同じときに、両方を答える
上の段を測ろうとすると、別の問題が出る。
2014年に International Journal of Training and Development へ出た調査は、行動の段と結果の段の評価が必要だと実務家が長く認めてきたにもかかわらず、組織はそれらを頻繁には実施していない、というところから出発している。実施を左右していた要因として挙がったのは三つ——時間と人手という資源、管理職の支持、そして評価の方法についての専門性である。どれも研修の中身の話ではない。
外から行動を見るには、人手と時間と、見る側の訓練がいる。三つとも足りないとき、測定は一枚の紙のなかへ寄っていく。研修の良さを聞いた同じ紙で、そのあと行動が変わったかも本人に聞く。答えるのは同じ人で、答えるのは同じときである。
測りにくい段を測ったことにする、いちばん静かな方法がこれである。
モデルなのか、分類なのか
枠組みそのものへの検討も、査読誌にある。
1996年に Human Resource Development Quarterly へ出た論文は、この4段階が、あいだに入る変数を扱っていないと指摘し、これはモデルではなく分類ではないか、と問うた。同じ号には提唱者本人の反論も載っている。
2004年に Evaluation and Program Planning へ出た検討は、限界を3つに整理している。ひとつ、個人や状況の影響を考慮しない単純化。ふたつ、段が因果の連鎖をなしているという仮定——良い反応が学習を生み、学習が転移を生み、転移が組織の成果を生む、という仮定。みっつ、上の段ほど情報として有用だという仮定。そして著者は、こう書いている。研究はこうした因果の連鎖をおおむね確認できていない。
枠組みが悪いのではない。枠組みの見た目が、階段だということである。階段の絵は、上れることを前提にしている。
時間・変化:段が上がるほど、測られなくなる
1959年から1960年にかけて、4つの段が提示される。1989年、暗黙の3つの前提が取り出され、12件の研究と26個の相関で検討される。1997年、34件・111個の相関で段どうしの結びつきが集計される。1996年から2004年にかけて、これはモデルではなく分類ではないかという指摘が出る。2014年、上の2つの段は必要だと認められながら実施されていないことが、実務家への調査で確かめられる。
60年のあいだに、階段の絵は一度も描き替えられていない。増えたのは、段と段のあいだについての数字だけである。そして、その数字が出るたびに、あいだは思ったより薄いという方向に振れてきた。
枠組みは、検証によっては壊れない。使いやすいからである。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、測っていない段について、効果があると書いてしまうことである。測っていないなら、測っていないと書けばよい。空欄は、嘘をつかない。
第二の妨げは、聞き方の違いを無視することである。満足したかと、役に立つと思ったかは、同じ段に置かれているが、後の段との結びつきが .02 と .26 で違った。どちらを聞いたかを記録しておかないと、あとから区別できない。
標本の偏りも断っておく。ここまでの証拠は、欧米の大企業や軍・大学の研修を対象に採られたものが中心で、30人規模の組織を対象にした研究はほとんど見当たらない。研修の効果は、その研修を設計した側が測っていることが多い。行動が変わったかは自己申告で測られたものが大半で、外から観察した研究はその一部である。そして——学ぼうとする人ほど学ぶ機会を得やすい、という逆向きは、ここまでのどの研究でも排除できていない。研修に手を挙げた人が測られている、という向きが同じデータから同じくらい読める。
助けるのは、次に何かを受けたときに、そこで何が測られたかだけを1行で残しておくことである。自分の学びの量は測れないが、測られたものの種類は記録できる。
最初の一歩は3分。最後に受けた研修・勉強会・講座を1つ思い出し、そのとき測られたものが、満足したか/覚えたか/行動が変わったか、のどれだったかを記録する。
次の単位は 201「暗黙知の形式知化」——ここでは、測りやすい段が代理として居座ることを見た。その上に、そもそも言葉になっていないものを言葉にできるのか、という問いを置く。ここから棚は、個人の学びから、組織にたまる知識のほうへ移る。
- Alliger & Janak 1989(Personnel Psychology 42(2):331-342)は、カークパトリックの4段階が、上昇し・因果的に関連し・正に相関しあうものとして提案されたことを要約したうえで、しばしば言葉にされないまま置かれている3つの前提を取り出して検討した。集められたのは12件の研究と26個の相関で、結論のひとつは、研修への反応は他の測定の代わりには使えない、である
- Alliger ら 1997(Personnel Psychology 50(2):341-358)は34件の研究から111個の相関を集め、感情としての反応と直後に覚えた量の相関を .02(9個)、有用性の判断(役に立つと思ったか)と直後に覚えた量の相関を .26(6個)と報告した。同じ下の段でも、聞き方を変えると後の段との結びつきが変わる
- 同じメタ分析では、有用性の判断と現場での行動の相関が .18(3個)、直後に覚えた量と現場での行動の相関が .11(16個)だった。有用性の判断は、直後に覚えた量よりも現場での行動とよく結びついていた。いずれも相関係数であって効果量ではない
- Arthur ら 2003(Journal of Applied Psychology 88(2):234-245)は397個の効果量を4つの段に分類し、反応15個(936人)、学習234個(15,014人)、行動122個(15,627人)、結果26個(1,748人)と報告した。研究の世界でいちばん測られていないのが反応の段で、実務の世界でいちばん測られているのが反応の段である
- 同じメタ分析では、効果量そのものは4つの段でほとんど変わらなかった。反応0.60、学習0.63、行動0.62、結果0.62である。段が上がるほど効果が薄まるという形にはなっていない
- Kennedy ら 2014(International Journal of Training and Development 18(1):1-21)は、行動の段と結果の段の評価が必要だと実務家が長く認めてきたにもかかわらず、組織がそれらを頻繁には実施していないところから出発し、実施を左右する要因として、時間と人手という資源、管理職の支持、評価の方法についての専門性の3つを挙げた。どれも研修の中身の話ではない
- Holton 1996(Human Resource Development Quarterly 7(1):5-21)は、4段階があいだに入る変数を扱っておらず、モデルではなく分類ではないかと問うた。Bates 2004(Evaluation and Program Planning 27(3):341-347)は限界を3つ——単純化、段が因果の連鎖をなすという仮定、上の段ほど有用だという仮定——に整理し、研究はこうした因果の連鎖をおおむね確認できていないと書いている
| よくある誤解 | 実際のところ |
|---|---|
| 満足度は行動変容とほぼ無相関である、と研究で示されている | この一文は出典が付かない形で流通しているが、原典に当たれば数値ごと確かめられる。Alliger ら 1997 では、感情としての反応と直後に覚えた量の相関が .02 である。ただし同じ論文で、有用性の判断(役に立つと思ったか)と直後に覚えた量は .26、現場での行動とは .18 だった。無相関なのは、満足度という段そのものではなく、感情を聞いた場合の値である |
| 4つの段は下から順に積み上がるので、下の段がよければ上の段もよくなる | Alliger & Janak 1989 は、この因果の連鎖という前提を含む3つの暗黙の前提を検討し、反応は他の測定の代わりには使えないと結論した。Bates 2004 も、段が因果の連鎖をなすという仮定を限界の一つに挙げ、研究はこうした連鎖をおおむね確認できていないと書いている。Holton 1996 は、これはモデルではなく分類ではないかと問うている |
| 上の段ほど測りにくいので、上の段は効果が小さくなるはずだ | Arthur ら 2003 では、効果量は4つの段でほとんど変わらなかった(反応0.60、学習0.63、行動0.62、結果0.62)。変わったのは効果量の数のほうで、学習234個に対して結果は26個、反応は15個である。さらに Kennedy ら 2014 は、上の2つの段の評価が必要だと認められながら組織では頻繁に行われていないことを出発点に置き、資源・管理職の支持・評価の専門性の不足を要因に挙げている。上の段の数字は、少ないうえに、集めにくいところで集められている |
階段の絵には、たいへん優れた性質がある。上れそうに見えることだ。60年のあいだ、この4段は一度も描き替えられていない。描き替えられなかったのは、正しかったからではなく、便利だったからである。皮肉なのは、いちばん下の段——満足したか——について、研究の蓄積がいちばん薄いことだ。毎日いちばんたくさん集められている数字が、いちばん少なく研究されている。集めやすさと、確からしさは、別々のところに住んでいる。
Q1. Alliger ら 1997 のメタ分析では、感情としての反応と直後に覚えた量の相関は .02 だったが、有用性の判断(役に立つと思ったか)と直後に覚えた量の相関は( )だった。穴埋め
Q2. Arthur ら 2003 が4つの段ごとに集計した効果量について、段による差が出た点と出なかった点をそれぞれ答えよ。一問一答
Q3. Kennedy ら 2014 が、行動の段と結果の段の評価について報告したのはどれか。選択
Q4. Arthur ら 2003 が集めた397個の効果量を、その段について集められた個数が多い順に並べよ。(結果/反応/学習/行動)並べ替え
Q5. この枠組みをめぐって起きたことを、古い順に並べよ。(上の2つの段が必要だと認められながら実施されていないことが調べられる/34件・111個の相関で段どうしの結びつきが集計される/12件の研究と26個の相関で3つの暗黙の前提が検討される)並べ替え
最後に受けた研修・勉強会・講座・オンライン講義を1つ思い出し、そのときに測られたものが、満足したか/覚えたか/行動が変わったか、のどれだったかを記録する。複数あればすべてに印を付け、どれも測られなかった場合は、測られなかった、と記録する。内容の良し悪しや、講師の評価は書かない。確かめているのは、自分が何を学んだかではなく、そこで何が測られたか、という一点である。会社の研修でなくてよく、動画講座でも、自治体の講習でも、資格の講義でも、無料の勉強会でもよい。思い当たるものが無ければ、直近で読み終えた本や教材について、読み終えたあとに何が確かめられたかを同じ3つで記録すればよい。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Alliger G.M., Janak E.A. (1989) 'Kirkpatrick’s Levels of Training Criteria: Thirty Years Later', Personnel Psychology 42(2):331-342 — eric.ed.gov
- Alliger G.M., Tannenbaum S.I., Bennett W. Jr., Traver H., Shotland A. (1997) 'A Meta-Analysis of the Relations Among Training Criteria', Personnel Psychology 50(2):341-358 — apps.dtic.mil
- Arthur W. Jr., Bennett W. Jr., Edens P.S., Bell S.T. (2003) 'Effectiveness of Training in Organizations: A Meta-Analysis of Design and Evaluation Features', Journal of Applied Psychology 88(2):234-245 — www.psychologie.uni-mannheim.de
- Kennedy P.E., Chyung S.Y., Winiecki D.J., Brinkerhoff R.O. (2014) 'Training professionals’ usage and understanding of Kirkpatrick’s Level 3 and Level 4 evaluations', International Journal of Training and Development 18(1):1-21 — eric.ed.gov
- Holton E.F. III (1996) 'The Flawed Four-Level Evaluation Model', Human Resource Development Quarterly 7(1):5-21 — eric.ed.gov
- Bates R. (2004) 'A critical analysis of evaluation practice: the Kirkpatrick model and the principle of beneficence', Evaluation and Program Planning 27(3):341-347 — econpapers.repec.org