同じ1つのデータを29の研究チームに渡したら、20チームが有意だと言い、9チームが言わなかった
根拠を3つ挙げられる主張は、1つしか挙げられない主張より確からしい。そう思いたくなる。ところが3つの根拠が同じ1つの出どころに合流していると、数は3でも、独立した証拠は1つである。しかも合流しているかどうかは、数えているあいだは見えない。
数えるのではなく、独立しているかを見る
証拠という道具は、ある主張を支えている材料が、いくつあるかではなく、互いにどれだけ独立しているかを見るためのものである。
手元にある材料を数えるのは簡単だ。記事を3本読んだ。人から2回聞いた。研修でも同じことを言っていた。合計6件。ところがこの6件が、同じ1つの調査に合流していることは珍しくない。合流していれば、独立した証拠は1つである。数は増えるが、確からしさは増えない。
この単位では、材料の数え方を三段階で疑う。作られ方(同じ材料でも分析次第で結論が変わるか)、残り方(うまくいかなかった結果は残るか)、運ばれ方(引用の連鎖のどこで主張が固まるか)である。
同じデータから、29の結論
2018年に Advances in Methods and Practices in Psychological Science へ出た研究は、この問題をいちばん見やすい形で示した。ある競技における審判の判定に関する1つの問いを立て、まったく同じ1つのデータセットを29の研究チームに配る。分析の方法は各チームに任せる。
出てきた効果の大きさは、オッズ比で0.89から2.93まで散らばった。中央値は1.31である。20チーム(69%)が統計的に有意な正の効果を報告し、9チーム(31%)は有意な関係を見出さなかった。29の分析が使った共変量の組み合わせは21通りで、手法は単純な回帰から多水準モデル、ベイズ的な手法まで幅があった。
どのチームも不正はしていない。全チームが互いの分析を査読し、方法を公開している。それでもこうなる。分かるのは、データが結論を1つに決めるわけではないということだ。データと結論のあいだには、分析の設計という手続きが挟まっている。
分析の自由度
その手続きに、どれだけの余地があるのかを数えた研究がある。米国で2011年に Psychological Science へ出た論文で、研究者が使える四つのありふれた選択肢を取り上げた。似た指標を2つ測って良いほうを報告する。データを見てから観測を追加する。性別を統制した分析も試す。三つの条件のうち一つを落とす。
どれも不正ではない。論文にはそう書かなければ現れない、というだけである。四つを組み合わせると、本当は差の無いものから統計的に有意な結果が出る確率——偽陽性率——は、5%の基準で60.7%まで上がった。1%の厳しい基準にしても21.5%である。
同じ論文は、それを実演もした。20人の学部生に音楽を聴かせ、父親の年齢を統制した分析を行うと、ある曲を聴いた人は聴かなかった人より1年半ほど「若く」なった(F(1,17)=4.92、p=.040)。統制をやめると効果は消える(F(1,18)=1.01、p=.33)。生まれた年が音楽で変わらないことは、誰でも知っている。
100件の追試
作られ方の次は、残り方である。2015年に Science へ出た再現性プロジェクトは、心理学の主要な3誌に載った100件の研究を、元の材料を使い、検出力を高めた設計で追試した。
結果はこうだった。元の研究のうち97%は統計的に有意な結果を報告していた。追試で統計的に有意になったのは36%である。追試の効果の大きさは、元の研究の半分ほどだった。元の効果量が追試の95%信頼区間に入っていたのは47%、追試を担当したチームが主観的に再現したと判定したのは39%、元と追試を統合して有意なままだったのは68%だった。
ここで数字の読み方に注意がいる。36%というのは、追試100件のうち36件という意味であって、元の結果が64%間違っていたという意味ではない。追試も1回の測定であり、追試のほうが外れている場合もある。
同じ形の調査は別の場所でも行われている。2018年に Nature Human Behaviour へ出た研究は、2010年から2015年に Nature と Science へ載った社会科学の実験21件を追試し、13件(62%)で同じ向きの有意な効果を得た。効果の大きさは平均して元のおよそ50%だった。
書かれなかった論文
残り方には、もっと手前の段階がある。そもそも論文にならない結果である。
2014年に Science へ出た研究は、この問題を珍しい形で測った。米国の公的な助成を受けた調査実験の枠組みでは、実施された研究が全部記録に残っている。つまり、公表されたものと公表されなかったものの両方が分かる。221件を追った結果、統計的に強い結果は、帰無の結果に比べて、出版される確率が40パーセントポイント高く、論文として書かれる確率が60パーセントポイント高かった。
著者たちが特定したのは、どの段階で偏りが生まれるかである。査読で落とされているのではない。著者が、帰無の結果を書かないのだ。だから公表されている証拠の集まりは、実施された研究の集まりとは別のものである。何件見つかったかを数えても、見つからなかった研究が何件あるかは分からない。
値切り:複数の情報源に当たれば確かになる
ここで、この単位に割り当てられた値切りに入る。情報の確かめ方として最も広く勧められているのは、複数の情報源に当たれ、という助言である。3つの記事が同じことを言っていれば確からしい、という考え方だ。
この助言が壊れる仕組みを、実際の引用の網で追いかけた研究がある。2009年に BMJ へ出たもので、ある医学的な主張について、その主張に触れた242本の論文と675の引用をすべて追跡した。
分かったことはこうだった。一次データを持つ論文への引用214件のうち、主張を支持する論文が94%を受け取り、主張を弱めるか否定するデータを含む6本の論文が受け取ったのは6%だった。そして、この主張を支える引用経路のうち63%——13万9,391本——が、一次データを1つも報告していない1本の総説を通っていた。さらに、主張を支持する文章に付けられた引用のうち24%は、その内容にまったく触れていない論文に流れていた。
つまり、3つの記事が同じことを言っている状態は、3つの独立した証拠ではなく、1つの証拠が3回運ばれた状態でありうる。しかも運ばれるあいだに、もとの論文が言っていなかったことまで加わる。
複数の情報源に当たること自体は悪くない。悪いのは、当たった数を確からしさの目盛りとして使うことだ。証拠の道具がやるのは、数えることではなく、材料の出どころが合流していないかを1回だけ確かめることである。
時間・変化:主張が定説になるまで
主張は、証拠が増えて定説になるのではない。三つの段階を通って定説になる。
第一段階は、1本の研究が出る。ここでは、その研究の条件と限界が書かれている。
第二段階は、総説や解説が出る。ここで条件が削られる。字数の制約もあるし、条件付きの主張は引用しにくい。2009年の引用網の研究で、経路の63%が1本の総説を通っていたのはこの段階である。
第三段階は、条件の落ちた形が繰り返し引用される。この段階になると、元の論文を読まなくても引用できる。読まずに引用されたものは、もとの条件を取り戻さない。
この過程には数年から十数年かかる。だから、いま自分が常識として持っている主張の多くは第三段階のものである。悪意はどこにも要らない。字数と読みやすさだけで、ここまで進む。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、証拠の強さを、賛成している人の数で測ることである。人数は、独立性の指標ではない。同じ記事を読んだ100人は、証拠1件ぶんである。
第二の妨げは、この道具を人に向けることだ。相手の根拠の出どころを問い詰める使い方は、この単位が扱うものではない。ここでやるのは、自分が正しいと思っている主張の出どころを自分で数え直すことだけである。
標本の偏りも断っておく。ここまでの証拠は、心理学と社会科学と医学の、英語圏の学術界の内側で採られている。実験室で数分の課題として測られたものが、締切のある本物の判断にそのまま当てはまるとは限らない。29チームの実験も、100件の追試も、学術論文という特殊な材料を対象にしていて、仕事で回ってくる資料や、身近な人の話には、そのまま当てはまらない。日本語圏の追試はほとんど見当たらない。数字は方向だけ持ち帰るのが誠実である。
助けるのは、材料に一言だけ札を付けることだ。これは見出しで見た。これは人から聞いた。これは原典を読んだ。三種類に分けるだけで、合流している材料が見える。
最初の一歩は5分。自分が正しいと思っている主張を3つ書き、それぞれの根拠がこの三種類のどれかを記録する。原典を読んだが0でも構わない。0だと分かっている状態と、数えていない状態は違う。
次の単位は 184「構造化思考」——証拠が、材料が互いに独立しているかを見る道具なら、こちらは、物事をどう分けるかが答えそのものを動かすことを扱う道具である。引き出しは隣にあり、どちらから開けてもよい。
- Silberzahn et al. 2018(Advances in Methods and Practices in Psychological Science 1(3):337-356)は、まったく同じ1つのデータセットを29の研究チームに配り、同じ問いに答えさせた。効果の大きさはオッズ比で0.89から2.93まで散らばり(中央値1.31)、20チーム(69%)が有意な正の効果を報告し、9チーム(31%)は有意な関係を見出さなかった。共変量の組み合わせは21通りだった
- Simmons, Nelson & Simonsohn 2011(Psychological Science 22(11):1359-1366)は、研究者が使える四つのありふれた選択肢——似た指標を2つ測る/データを見てから観測を追加する/性別を統制する/三条件のうち一つを落とす——を組み合わせると、本当は差の無いものから有意な結果が出る確率が、5%の基準で60.7%、1%の基準でも21.5%に達することを示した
- 同じ論文の実演では、20人の学部生に音楽を聴かせ、父親の年齢を統制した分析でのみ、ある曲を聴いた人が1年半ほど「若く」なった(F(1,17)=4.92、p=.040)。統制をやめると効果は消えた(F(1,18)=1.01、p=.33)。生まれた年が音楽で変わらないことは誰でも知っている
- Open Science Collaboration 2015(Science 349(6251):aac4716)は心理学の主要3誌の100件を追試した。元の研究の97%が有意な結果を報告していたのに対し、追試で有意になったのは36%。追試の効果量は元のおよそ半分で、元の効果量が追試の95%信頼区間に入っていたのは47%、主観的に再現したと判定されたのは39%、統合して有意なままだったのは68%だった
- Camerer et al. 2018(Nature Human Behaviour 2(9):637-644)は、2010年から2015年に Nature と Science に載った社会科学の実験21件を追試し、13件(62%)で同じ向きの有意な効果を得た。追試の効果量は平均して元のおよそ50%だった
- Franco, Malhotra & Simonovits 2014(Science 345(6203):1502-1505)は、実施された研究が全数記録されている米国の公的助成の枠組みで221件を追い、統計的に強い結果は帰無の結果に比べて、出版される確率が40パーセントポイント、論文として書かれる確率が60パーセントポイント高いことを示した。偏りは査読ではなく、著者が帰無の結果を書かない段階で生まれていた
- Greenberg 2009(BMJ 339:b2680)は、ある医学的主張に触れた242本の論文と675の引用を追跡した。一次データを持つ論文への引用214件のうち94%が支持側に流れ、主張を弱めるデータを含む6本が受け取ったのは6%。主張を支える引用経路の63%(13万9,391本)が、一次データを1つも報告していない1本の総説を通っていた。支持する文章に付けられた引用の24%は、その内容に触れていない論文に流れていた
| よくある誤解 | 実際のところ |
|---|---|
| 複数の情報源に当たって同じことが書いてあれば、その主張は確からしい | Greenberg 2009 が追跡した242本・675引用の網では、主張を支える引用経路の63%が、一次データを1つも報告していない1本の総説を通っていた。一次データへの引用214件のうち94%が支持側に流れ、否定的なデータを含む6本には6%しか流れていない。3つの記事が同じことを言っている状態は、1つの証拠が3回運ばれた状態でありうる。当たった数は、確からしさの目盛りにはならない |
| データがあるなら、分析すれば結論は1つに定まる | Silberzahn et al. 2018 では、同じ1つのデータセットを渡された29チームのうち20チーム(69%)が有意な正の効果を報告し、9チーム(31%)は有意な関係を見出さなかった。オッズ比は0.89から2.93まで散らばっている。どのチームも不正はせず、互いの分析を査読している。データと結論のあいだには、分析の設計という手続きが挟まっている |
| 有意な結果が報告されているのだから、実際に効果があったのだろう | Simmons et al. 2011 は、ありふれた四つの分析上の選択肢を組み合わせるだけで、差の無いものから有意な結果が出る確率が60.7%(5%の基準)に達することを示した。加えて Franco et al. 2014 によれば、強い結果は帰無の結果より、論文として書かれる確率が60パーセントポイント高い。公表されている証拠の集まりは、実施された研究の集まりとは別のものである |
証拠を数えるという習慣には、たいへん心地よい性質がある。数は増えるし、増えた数は誰にでも見せられるし、しかも数えている限り、どれも読まなくて済む。皮肉なのは、数えるのをやめて出どころをたどると、たいてい数が減ることだ。6件が1件になり、その1件も総説だったりする。減った数のほうが、実は自分の持ち物である——増えていたのは、他人の持ち物の反射だった。
Q1. Silberzahn et al. 2018 の実験の設計と結果を、チーム数・オッズ比の範囲・有意だったチーム数を含めて説明せよ。あわせて、この結果から何が言えるかを1文で書け。一問一答
Q2. Greenberg 2009 が追跡した引用の網について、242本・675引用のほかに本文が挙げている3つの数字と、その意味を答えよ。一問一答
Q3. Simmons, Nelson & Simonsohn 2011 が示した偽陽性率について、正しいものはどれか。選択
Q4. Open Science Collaboration 2015 の再現性プロジェクトの数字として、正しい組み合わせはどれか。選択
Q5. Franco, Malhotra & Simonovits 2014 が特定した、出版バイアスが生まれる段階として正しいものはどれか。選択
自分が正しいと思っている主張を3つ、紙かメモアプリに書き出す。分野は何でもよい(食べ物、睡眠、道具の選び方、仕事のやり方、世の中の傾向など。医療や投資に関する判断はここでは選ばない)。次に、その3つそれぞれについて、なぜそう思っているかの出どころを1つだけ選んで札を付ける——(1)見出しやまとめ記事で見た、(2)人から聞いた、(3)原典(論文・公的統計・一次資料)を読んだ、の三択。迷ったら、いちばん最初に知ったときの出どころを選ぶ。3件とも(1)でも構わない。最後に、3つの主張の出どころが同じ場所に合流していないかを見て、合流していれば1行だけ書き添える。誰にも見せない。他人の根拠を問い詰めたり、誰かの主張を評価したりはしない。この課題は自分の手元だけで完結する。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Silberzahn R., Uhlmann E.L., Martin D.P. et al. (2018) 'Many Analysts, One Data Set: Making Transparent How Variations in Analytic Choices Affect Results', Advances in Methods and Practices in Psychological Science 1(3):337-356 — journals.sagepub.com
- Simmons J.P., Nelson L.D., Simonsohn U. (2011) 'False-Positive Psychology: Undisclosed Flexibility in Data Collection and Analysis Allows Presenting Anything as Significant', Psychological Science 22(11):1359-1366 — journals.sagepub.com
- Open Science Collaboration (2015) 'Estimating the reproducibility of psychological science', Science 349(6251):aac4716 — www.science.org
- Camerer C.F., Dreber A., Holzmeister F. et al. (2018) 'Evaluating the replicability of social science experiments in Nature and Science between 2010 and 2015', Nature Human Behaviour 2(9):637-644 — www.nature.com
- Franco A., Malhotra N., Simonovits G. (2014) 'Publication bias in the social sciences: Unlocking the file drawer', Science 345(6203):1502-1505 — www.science.org
- Greenberg S.A. (2009) 'How citation distortions create unfounded authority: analysis of a citation network', BMJ 339:b2680 — pmc.ncbi.nlm.nih.gov