11パーセンタイル上昇、の11は、0.27を大きく見せるための単位だった
同じ結果を、0.27とも11とも書ける。前者は効果量、後者はパーセンタイル。数字としては後者のほうが大きく見えるので、資料に載るのはたいてい後者のほうである。
試験の前に手が冷たくなる。問題集を開く前に、開かない理由が10個くらい浮かぶ。こういう場面は、学びの話ではなく気持ちの話として片づけられやすい。研究の側では、これは測られる対象として扱われている——そして、測られたものは数字になり、数字は単位を替えながら運ばれていく。ここでは、その運ばれ方のほうを見る。読者自身の不安や体調にどう対処するかは、この棚の持ち場ではない。
値切り:11パーセンタイル、と書かれている一文
学習の設計資料には、こういう一文が載る。「SEL介入で学業成績が平均11パーセンタイル上昇。テスト不安低減効果も実証」。
出どころは、米国で2011年に Child Development へ出たメタ分析である。学校で全員を対象に行われた社会性と情動の学習の介入を集め、213件のプログラム・のべ27万34人(幼稚園から高校まで)を統合した。報告された平均効果量は、社会的・情動的な技能が0.57、自己や他者への態度が0.23、向社会的な行動が0.24、行動上の問題が0.22、情動面の苦痛が0.24、そして学業成績が0.27である。
論文は、この0.27についてこう書いている——平均効果量0.27は、パーセンタイルにすると11の差にあたる。つまり対照群の平均的な人は、そのプログラムに参加していたら達成度で11パーセンタイル上がっていたことになる。 11という数字は、ここから出ている。
パーセンタイルという単位
ここで区別しておきたい。パーセンタイルは順位の位置であって、パーセントではない。 「成績が11%上がる」ではないし、「11%の人に効く」でもない。効果量0.27を、順位の物差しに置き換えたときの見え方である。同じ結果が、0.27とも11とも書ける。大きく見えるほうが、資料には載る。
もうひとつ落ちているものがある。213件のうち、学業成績を測っていたのは35件である。 残りの178件は、この11という数字に関与していない。「SEL介入で学業成績が」という主語の広さと、実際に成績を測った研究の数は、一致していない。
誰が測ったかで、数字が動く
同じ領域で、評価の立場そのものを変数にした分析がある。英国で2016年に Cambridge Journal of Education へ出たメタ分析は、89件の研究を3つの軸で層別した。試験の段階(効力の検証か、実地での有効性か)、プログラムの開発者が評価にどう関わったか(主導・関与・独立)、そして生まれた国の中で実施されたか外へ出たか。
結果は、単純な物語にはならなかった。論文自身の言葉では、3つの軸すべてで差は出たが、想定した向きとは限らなかった。開発者が関われば必ず効果が大きく出る、という読みは、この分析からは取れない。取れるのは、誰が評価したかという条件が、効果量を動かす変数として実在するという一点である。
数量的な形で同じ問題を扱ったのが、米国で2016年に Educational Researcher へ出た分析だ。読み・算数・理科の12のレビューから645件の研究を集め、方法上の特徴と効果量の関係を調べている。結論はこうである——効果量は、出版された論文・小規模な試験・実験者が作った尺度で測った場合に、未公刊の文書・大規模な研究・独立した尺度で測った場合のおよそ2倍になる。 準実験のほうが無作為化実験より高い値が出ることも報告されている。
効果量は、介入の性質だけで決まっていない。 誰が測り、何で測り、どこに載ったかでも決まっている。
この2つを並べると、扱いの手順が出てくる。開発者が関わっていたら割り引く、という単純な操作は成り立たない——89件の分析がそれを支持しなかった。かわりに確かめるのは、成果を測った尺度が、その介入のために作られたものかどうかである。そこには2倍という見当がついている。
試験不安という構成概念
ここで、値切りの対象から実証のほうへ移る。試験のときに起きる不安は、研究上は測定可能な構成概念として扱われてきた。米国で1988年に Review of Educational Research へ出た統合は、562件の研究を集めている。当時の方法で計算された結論として、この論文は試験不安が成績を押し下げると書き、さらに、それまでの見方に反して、不安が下がったときには試験成績と評定平均の改善が一貫して伴っていたと報告した。
1988年の論文が因果の言葉を使っていること自体は、書き留めておく値打ちがある。相関を集めた統合が、そのまま原因の言葉で結論を書いた時代のものである。 いま同じ設計で書けば、もっと慎重な言い方になる。
感情の側の枠組みとしては、米国で1998年に Review of General Psychology へ出た整理がよく使われる。感情が生まれてから消えるまでの流れに沿って、手を入れられる地点は5つある——どの状況に身を置くか、その状況を作り変えるか、注意をどこへ向けるか、意味づけを変えるか、そして出てしまった反応を調整するか。前の4つは反応が立ち上がる前、最後の1つは立ち上がったあとにあたる。
この5つの区別が実務的なのは、世間で感情調整と呼ばれているものの大半が、最後の1つを指しているからである。表に出さない、我慢する、気にしないようにする。それは5つのうちの1つで、しかも反応が立ち上がったあとの地点にある。前の4つは、机の位置や、手をつける順番や、その課題を何のためにやっているかという言い方の中にある。
学業の場面に限って感情を整理した枠組みもある。2006年に Educational Psychology Review へ出た理論は、学びの場で生まれる感情が統制の評価(自分はこれをどうにかできそうか)と価値の評価(これは自分にとって意味があるか)から立ち上がるとし、結果を先取りする感情・結果を振り返る感情・作業中の感情に分けて扱う。
10分間書く、という処方
米国で2011年に Science へ出た研究は、4つの実験からなる。実験室の2つは参加者20人と47人、教室での無作為化実験は9年生51人と55人である。試験の直前に10分間、これから受ける試験についての考えや気持ちを書き出す群と、そうしない群を比べた。試験不安が高い層で、書いた群の成績は標準的な評定でB+、書かなかった群はB−、期末試験では書いた群が6%上回っている。
読みどころは効果の大きさではない。51人と55人の教室実験が、そのあと教室の手順として広く紹介されていったという経路のほうである。実験の対象は米国の9年生で、働きながら学んでいる大人ではない。大人でも同じことが起きるかは、別に確かめる必要がある。 ここでは手順として勧めない。
時間・変化:数字が単位を替えていく順番
順番は決まっている。まず効果量が計算される(0.27)。次に、伝わりやすくするためにパーセンタイルへ言い換えられる(11)。次に、パーセンタイルの「タイル」が落ちてパーセントになる。最後に、何件のうち何件が成績を測ったのかという但し書きが落ちる。残るのは「11%上がる」という一文である。
逆向きには動かない。単位が戻ることはまず起きない。 だから数字を見たときに確かめるのは、大きさではなく単位である。パーセンタイルなのか、パーセントなのか、効果量なのか、相関係数なのか。単位が書かれていない数字は、たいていどこかで単位を落としてきている。
この脱落は、誰かが嘘をついた結果ではない。どの段階も、前の段階の正しい言い換えである。嘘をつかずに数字を大きくする方法が、この分野にはいくつもある——というだけの話で、そのどれもが手続きとしては正当なのが厄介なところだ。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、単位の違う数字を並べて比べることである。0.27と11と6%は、この単位のなかで全部出てきたが、それぞれ別の物差しの上にある。並べれば大小は言えるが、それは物差しの目盛りの大小でしかない。
標本の偏りを断っておく。ここまでの証拠は、学校に通っている児童・生徒と、欧米の大学生を対象にしたものが大半である。実験室の課題と、実際の試験や仕事の課題は別物であり、効果は短い期間で測られたものが多い。そして——もともと学ぶ余裕のある人ほど、その学習法を試せる、という逆向きを排除できない。
助けるのは、感情に手を入れられる地点が複数あるという見取り図のほうである。反応が出てしまってから抑える地点は、5つのうちの最後の1つにすぎない。どの状況に身を置くか、何に注意を向けるか、という手前の地点は、机の上の話として扱える。
最初の一歩は5分。今日、取りかかるのを遅らせた場面を1件だけ思い出し、そのとき何をしていたかを1行書く。対処は書かない。 場面だけを書く。
次の単位は 063「計画立案力」——道具箱の隣の引き出しである。ここでは同じ結果が単位を替えて大きく見えることを見たが、あちらでは、いつも同じ向きに外れると言われてきた誤差が、文献群を替えると向きを変える。
- 米国・2011年に Child Development へ出たメタ分析は、学校で全員を対象に行われた社会性と情動の学習の介入213件・のべ27万34人を統合し、学業成績の平均効果量を0.27と報告した。論文はこれを11パーセンタイルの差と言い換えており、流通している「11パーセンタイル上昇」はここから来ている
- パーセンタイルは順位の位置であってパーセントではない。「成績が11%上がる」でも「11%の人に効く」でもなく、効果量0.27を順位の物差しに置き換えた見え方である。同じ結果が0.27とも11とも書けるが、資料に載るのは大きく見えるほうである
- 同じメタ分析で、213件のうち学業成績を測っていたのは35件である。残る178件はこの数字に関与していない。主語の広さと、実際に成績を測った研究の数は一致していない
- 英国・2016年に Cambridge Journal of Education へ出たメタ分析は89件の研究を、試験の段階・開発者の関与(主導/関与/独立)・実施国の3軸で層別した。3つの軸すべてで差は出たが、想定した向きとは限らなかったと報告しており、開発者が関われば必ず効果が大きく出るという単純な読みは取れない
- 米国・2016年に Educational Researcher へ出た分析は、読み・算数・理科の12のレビューから645件の研究を集め、効果量が、出版された論文・小規模な試験・実験者が作った尺度で測った場合に、未公刊の文書・大規模な研究・独立した尺度の場合のおよそ2倍になると報告した。準実験のほうが無作為化実験より高い値が出ることも示している
- 米国・1988年に Review of Educational Research へ出た統合は562件の研究を集め、試験不安が成績を押し下げると結論し、それまでの見方に反して、不安が下がったときには試験成績と評定平均の改善が一貫して伴っていたと報告した。相関を集めた統合が原因の言葉で結論を書いた時代のものである
- 米国・2011年に Science へ出た研究は、実験室2件(20人・47人)と教室での無作為化実験2件(9年生51人・55人)からなる。試験直前に10分書いた群では、試験不安が高い層の成績が標準的な評定でB+、書かなかった群はB−で、期末試験では6%上回った。51人と55人の教室実験が、そのあと教室の手順として広く紹介されていった
| よくある誤解 | 実際のところ |
|---|---|
| 社会性と情動の学習の介入で、成績は平均11%上がる | 11はパーセントではなくパーセンタイル、つまり順位の位置である。米国・2011年のメタ分析(213件・のべ27万34人)が報告した学業成績の平均効果量は0.27で、11パーセンタイルはその言い換えにすぎない。さらに、213件のうち学業成績を測っていたのは35件である。単位と、測った件数の両方が、運ばれるあいだに落ちている |
| 開発者が関わった評価は必ず効果を大きく出すので、そこだけ割り引けばよい | 英国・2016年に Cambridge Journal of Education へ出たメタ分析(89件)は、試験の段階・開発者の関与・実施国の3軸すべてで差が出たが、想定した向きとは限らなかったと報告している。単純な割引率は取れない。ただし米国・2016年に Educational Researcher へ出た分析(645件)は、実験者が作った尺度で測った場合の効果量が独立した尺度の場合のおよそ2倍になると示している。誰が測り、何で測ったかは、効果量を動かす条件として実在する |
| 試験前に不安を書き出せば成績が上がることは確かめられている | 米国・2011年に Science へ出た研究の教室実験は、9年生51人と55人を対象にしたものである。試験不安が高い層で、書いた群がB+、書かなかった群がB−という差だった。小規模な教室実験が2件、というのが証拠の量である。対象は米国の9年生で、働きながら学んでいる大人ではない。大人でも同じことが起きるかは、別に確かめる必要がある |
0.27という数字には、教材として不便な性質がある。小さく見える。そこでパーセンタイルに置き換えると11になり、置き換えただけで話が大きくなった。さらに運ばれるうちに「タイル」が落ちてパーセントになり、35件という但し書きも落ちた。皮肉なのは、この一連の作業を誰も嘘だと言えないことである。どの段階も、前の段階の正しい言い換えだからだ。嘘をつかずに数字を大きくする方法は、この分野にはいくつもある。
Q1. 米国・2011年のメタ分析は、社会性と情動の学習の介入 ____ 件・のべ27万34人を統合し、学業成績の平均効果量を ____ と報告した。論文はこれをパーセンタイルに言い換えて ____ の差としている。穴埋め
Q2. 同じメタ分析が集めた213件のうち、学業成績を測っていたのは ____ 件である。また、パーセンタイルは ____ の位置であって、パーセントではない。穴埋め
Q3. 米国・2016年に Educational Researcher へ出た645件の分析は、効果量がおよそ2倍になる条件を3つ挙げている。それは何と何と何か。一問一答
Q4. 米国・2011年に Science へ出た研究のうち、教室で行われた無作為化実験2件の参加者は誰が何人だったか。また、試験不安が高い層で報告された評定の差はどうだったか。一問一答
Q5. 本文がたどった、数字が単位を替えていく順番を古い順に並べよ。(パーセンタイルへ言い換えられる/何件のうち何件が成績を測ったのかという但し書きが落ちる/効果量が計算される/「タイル」が落ちてパーセントになる)並べ替え
紙かメモアプリを開く。今日、勉強や作業に取りかかるのを遅らせた場面を1件だけ選ぶ。3つのことを書く。ひとつめ、何時ごろで、そのとき何をしていたか。ふたつめ、取りかかる代わりに何をしたか。みっつめ、そのとき避けていた感じを1語だけ書く(面倒、退屈、気まずい、分からない、など。当てはまる語が無ければ『不明』と書く)。対処法は書かない。良し悪しの評価もしない。1件だけで終わりにする。学校に通っていない場合も、仕事の書類・資格の教材・語学の課題など、取りかかりを遅らせたもので同じように書ける。他人の行動については書かない。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Durlak J.A., Weissberg R.P., Dymnicki A.B., Taylor R.D., Schellinger K.B. (2011) 'The Impact of Enhancing Students’ Social and Emotional Learning: A Meta-Analysis of School-Based Universal Interventions', Child Development 82(1):405-432 — casel.s3.us-east-2.amazonaws.com
- Wigelsworth M., Lendrum A., Oldfield J., Scott A., ten Bokkel I., Tate K., Emery C. (2016) 'The impact of trial stage, developer involvement and international transferability on universal social and emotional learning programme outcomes: a meta-analysis', Cambridge Journal of Education 46(3):347-376 — eric.ed.gov
- Cheung A.C.K., Slavin R.E. (2016) 'How Methodological Features Affect Effect Sizes in Education', Educational Researcher 45(5):283-292 — bestevidence.org
- Hembree R. (1988) 'Correlates, Causes, Effects, and Treatment of Test Anxiety', Review of Educational Research 58(1):47-77 — journals.sagepub.com
- Ramirez G., Beilock S.L. (2011) 'Writing About Testing Worries Boosts Exam Performance in the Classroom', Science 331(6014):211-213 — pubmed.ncbi.nlm.nih.gov
- Gross J.J. (1998) 'The Emerging Field of Emotion Regulation: An Integrative Review', Review of General Psychology 2(3):271-299 — journals.sagepub.com
- Pekrun R. (2006) 'The Control-Value Theory of Achievement Emotions: Assumptions, Corollaries, and Implications for Educational Research and Practice', Educational Psychology Review 18(4):315-341 — link.springer.com