「有意差が出れば意味がある」ではない——統計的に有意であることと実務的に重要であることは別物。p値は差の大きさも仮説の真偽も測らない
有意差が出たのだから、意味のある差だ——そう受け取りたくなる。だが統計的に有意であることと、実務的に重要であることは、まったくの別物だ。有意でも、どうでもいいほど小さな差のことがあり、重要な差が有意にならないこともある。米国統計学会は公式の声明で、p値は効果の大きさも仮説の真偽も測らず、統計的有意は広く誤用されると釘を刺した。有意差が出たは、意味があるの証明ではない。有意という一語に、判断を明け渡してはいけない。
差の意味を確かめる——「有意差が出れば意味がある」ではない。「有意」と「重要」は、別物だ
前の単位では、グラフの読み方——数字を映す図が、どう人を誤らせるかを扱った。ここでは、そのグラフに映った「差」が、そもそも確かな差なのか、意味のある差なのかを確かめる読み方を扱う。二つの数字が違って見えるとき、その違いをどう受け取るかの話だ。
用語をほどく。統計的検定とは、観察された差が、ただの偶然でも起こりうる程度のものか、それとも偶然では説明しにくいものかを見積もる道具だ。その見積もりの一つがp値で、ざっくり言えば「もし本当は差がないとしたら、いま見えているような差が、偶然でどれくらい出やすいか」を表す数だ(この定義自体、よく誤解される。あとで触れる)。p値がある基準より小さいとき、その差を統計的に有意と呼ぶ。よく聞くのは「有意差が出たのだから、意味のある差だ」という声である。
この単位が示すのは、その等号が成り立たない、ということだ。統計的に「有意」であることと、実務的に「重要」であることは、まったくの別物だ。有意でも、どうでもいいほど小さな差のことがある。逆に、重要な差が、有意にならないこともある。「有意差が出た」は、「意味がある」の証明ではない。順に見ていく。
まず、公式の声明が「有意≠重要」を釘刺している
この点については、個人の意見ではなく、専門家集団の公式な声明がある。Wasserstein と Lazar が2016年にまとめた米国統計学会(ASA)の声明は——これは一本の研究論文ではなく、統計の専門家集団が合意して出した、公式のコンセンサス声明だ——はっきりこう述べた。p値は、効果の大きさを測るものでも、仮説が正しい確率を測るものでもない。そして「統計的有意」は広く誤用されている、と。
ここが肝心だ。p値が小さいことは、「差が大きい」ことも「その仮説が本当だ」ことも意味しない。p値は、差の「意味」や「大きさ」については、何も語らない。にもかかわらず、「有意=重要」「有意=本物」という読み替えが、あまりに広く行われている——だからこそ、専門家集団がわざわざ声明を出して、釘を刺す必要があった。公式にそう言われている、という重みは、覚えておく値打ちがある。
なぜ、こんな取り違えが起きるのか。ひとつには、「有意」という日本語のせいもある。日常の言葉で「有意義」といえば「意味がある・価値がある」ことだ。だから「統計的に有意」と聞くと、つい「意味のある差なんだな」と受け取ってしまう。だが、統計でいう「有意」は、「意味がある」ではなく、「偶然だけでは説明しにくい」という、ごく限定された意味しか持たない。偶然では説明しにくいことと、その差が大きいこと、商いにとって効くことは、まったく別の話だ。言葉が同じ響きを持っているせいで、頭の中で勝手に橋が架かってしまう。この橋を、意識して外すこと——「有意」を耳にしたら、心の中で『これは偶然では説明しにくいと言っているだけで、意味があるとは言っていない』と、言い換えてみること。それだけで、すり替えの多くは防げる。
誤解は根深く、「有意な発見」の多くは当てにならない
p値をめぐる誤解は、一つや二つではない。Greenland たちが2016年に、p値・信頼区間・検出力について、人がよくやる誤解を、目録のように並べて解説した。それだけ多くの人が、それだけ多くの取り違えをしている、ということだ。
さらに深刻なのは、公表された「有意な発見」そのものの信頼性だ。Ioannidis が2005年に論じたのは、発表された研究知見の多くが、検出力の低さ、さまざまなバイアス、解析の自由度のために、じつは偽である、ということだった。「有意差が出た」という報告は、世の中にあふれているが、その相当部分は、後から確かめると再現しない。つまり、「有意」というラベルは、思っているほど、頑丈な保証ではない。ラベルを見て安心するのではなく、そのラベルがどんな条件で貼られたのかを見る必要がある。
この「偽の有意」が生まれる仕組みは、意外と身近だ。たとえば、たくさんの切り口でデータを眺めれば——曜日別、地域別、客層別、時間帯別——そのどこかには、偶然で差が出ている切り口が、必ず紛れ込む。二十の切り口を試せば、そのうち一つくらいは、本当は何もなくても「有意」に見えてしまう。そこだけを取り出して「有意な差を発見した」と言えば、いかにも本物らしく聞こえる。だが、それは、たくさん振ったサイコロの、たまたまの目を選んで見せているだけかもしれない。だから、有意という報告に出会ったら、「これは、いくつの切り口を試した末の、一つなのか」を思い浮かべるとよい。探せば探すほど、偶然の当たりは増える。一つの有意を、その裏で試された数から切り離して受け取ると、当てにならないものを、当てにしてしまう。
「有意」と「非有意」の境目は、崖ではなく坂
「有意か、非有意か」という線引きにも、落とし穴がある。Gelman と Stern が2006年に指摘したのは、「有意だった」ものと「有意でなかった」ものの差それ自体は、統計的に有意とは限らない、ということだ。基準の少し内側と少し外側は、実は地続きで、そこに崖はない。
たとえば、ある基準のわずかに内側に入ったものを「効果あり」、わずかに外側に落ちたものを「効果なし」と、白黒に分けてしまうと、ほとんど同じ二つを、正反対に扱うことになる。境目は、崖ではなく、なだらかな坂だ。しかも、その基準に届かせるために、解析のやり方をあれこれ試して調整する——いわゆる p-hacking——が広く行われていることを、Head たちが2015年に示した。だから2019年には、Amrhein たちが Nature に、多くの科学者が名を連ねたコメントを出し、「統計的有意」という言い方そのものを引退させよう、と呼びかけた(これも、一本の研究結果ではなく、多数の署名による意見表明だ)。線の内か外かで世界を二分するのをやめよう、という声である。
誤解のないように言い添えておく。これは、「検定なんて無意味だ」「p値は捨てろ」という話ではない。検定は、目の前の差が偶然の揺れで説明できてしまう程度なのかを見積もる、れっきとした道具だ。問題は、道具そのものではなく、その一つの出力を、たった一本の線で「効いた/効かない」に切り縮めて、そこで考えるのをやめてしまう使い方のほうにある。基準の内側に入ったからといって胸を張りすぎず、外側に落ちたからといって切り捨てすぎず、差の大きさや、確かめた回数や、実務での意味と、あわせて読む。専門家たちが求めているのは、検定の廃止ではなく、この「あわせて読む」姿勢のほうだ。道具は道具として使い、判断はこちらが引き受ける——それが、線引きに判断を明け渡さない、ということである。
時間・変化:検定の読み方が積み上げてきた向き
順に置く。2005年、Ioannidis が、発表された有意な知見の多くは偽だと論じる。2006年、Gelman と Stern が、有意と非有意の差自体は有意とは限らないと示す。2015年、Head たちが、p-hacking の広がりを示す。2016年、ASA(Wasserstein & Lazar)が公式声明でp値の誤用を戒め、同じ年、Greenland たちが誤解を目録にする。2019年、Amrhein たちが、多数署名で「統計的有意」の引退を呼びかけた。
この流れで確からしくなったのは、「有意差が出れば意味がある」ではない。確からしくなったのは、p値は差の大きさも仮説の真偽も測らず、有意という線引きは連続の中の便宜にすぎない——だから「有意」と「重要」は切り分けて読むべきだ、という向きのほうである。(なお、これは検定の性質についての一般論であって、個別のデータが有意かどうかを判定するものではない。医療やメンタルの検定に当てはめる話でもない。)二十年近くにわたる複数の研究と、専門家集団の公式声明とが、同じ方向を指しているのが分かる。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、「有意差が出た、だからこの施策は効いた」という早合点だ。有意は、偶然で説明しにくいことを示唆するだけで、差が大きいことも、商いにとって重要なことも、意味しない。もうひとつの妨げは、逆に「有意でなかったから、効果はゼロだ」と決めつけること——有意でないことは「差がある証拠が足りない」であって、「差がないことの証明」ではない。
助けになるのは、「有意か」を尋ねる前に、「どれだけの差なのか(大きさ)」と「その差は、自分の商いにとって意味があるほどの大きさか(重要性)」の二つを、先に見ることだ。有意という言葉に出会ったら、「で、差はどれくらい? それはうちにとって効くほどの差?」と問い返す。この問い返しが、有意というラベルを、意味の判断とすり替えさせないための歯止めになる。
最初の一歩は10分。自分の商いで、最近「差が出た/出なかった」と受け取った出来事を一つ選び、「その差は、どれくらいの大きさか」「その大きさは、自分の商いにとって意味があるか」「たまたまの揺れではないと、どこまで言えそうか」の三つを、一言ずつ書く。有意かどうかを判定する必要はない——差を、大きさと重要性で読み直すメモとして完結する。数字の個別の有意判定をする必要はない。この読み直しが、「有意」の一語に判断を明け渡さないための、最初の一歩だ。
次の単位——緑の段の締めでは、こうした数字の読みに、数字にならない声、すなわち定性の観察を、どう対等に組み合わせるかを扱う。
- この棚の読者は自分の商いの数字を自分で見て決める人で、緑の段3単位目として統計的検定とp値の読み方を扱う(個別データの有意判定はしない・医療やメンタルへの転用もしない)。俗説は有意差が出れば意味があるで、この単位は統計的に有意であることと実務的に重要であることがまったくの別物であることを示す
- 有意≠重要には公式の裏づけがある。Wasserstein & Lazar 2016がまとめた米国統計学会(ASA)の公式コンセンサス声明——一本の研究論文ではなく専門家集団が合意して出した声明——は、p値が効果の大きさを測るものでも仮説が正しい確率を測るものでもなく、統計的有意は広く誤用されると述べた。p値が小さいことは差が大きいことも仮説が本物であることも意味しない
- p値の誤解は根深い。Greenland ら 2016は、p値・信頼区間・検出力について人がよくやる誤解を目録のように並べた。それだけ多くの人が多くの取り違えをしているということで、有意というラベルは思うほど頑丈な保証ではない
- 公表された有意な発見の多くは当てにならない。Ioannidis 2005は、発表された研究知見の多くが検出力の低さ・バイアス・解析の自由度のためにじつは偽であることを論じた。有意差が出たという報告の相当部分は後から確かめると再現しない。ラベルを見て安心せず、どんな条件で貼られたラベルかを見る
- 有意と非有意の境目は崖ではなく坂だ。Gelman & Stern 2006は、有意だったものと有意でなかったものの差それ自体は有意とは限らないと指摘した。基準の内側を効果あり外側を効果なしと二分するとほとんど同じ二つを正反対に扱う。p-hackingは広く(Head ら 2015)、Amrhein ら 2019は多数署名のNatureコメントで統計的有意の引退を呼びかけた
- 確からしくなったのは有意差が出れば意味があるではなく、p値は差の大きさも仮説の真偽も測らず有意という線引きは連続の中の便宜にすぎない——だから有意と重要は切り分けて読むべきだ、という向きである。有意でないことは差がある証拠が足りないであって差がないことの証明ではない
- 最初の一歩は10分。最近差が出た/出なかったと受け取った出来事を一つ選び、その差はどれくらいの大きさか・その大きさは自分の商いにとって意味があるか・たまたまの揺れではないとどこまで言えそうかの三つを一言ずつ書く。有意かどうかを判定する必要はなく、差を大きさと重要性で読み直すメモとして完結する
| よくある誤解 | 実際のところ |
|---|---|
| 有意差が出たのだから、それは意味のある(重要な)差だ | 統計的に有意であることと実務的に重要であることは別物だ。有意でもどうでもいいほど小さな差のことがあり、重要な差が有意にならないこともある。Wasserstein & Lazar 2016がまとめた米国統計学会(ASA)の公式コンセンサス声明は、p値が効果の大きさを測るものでも仮説が正しい確率を測るものでもなく、統計的有意は広く誤用されると述べた。p値が小さいことは差が大きいことも仮説が本物であることも意味しない。有意は意味の証明ではない |
| 有意差が出たという報告なら、その発見は信頼できる本物だ | 有意というラベルは思うほど頑丈な保証ではない。Ioannidis 2005は、発表された研究知見の多くが検出力の低さ・さまざまなバイアス・解析の自由度のためにじつは偽であることを論じた。有意差が出たという報告の相当部分は後から確かめると再現しない。しかもp値には多くの誤解があり(Greenland ら 2016)、基準に届かせるため解析を調整するp-hackingも広く行われている(Head ら 2015)。ラベルを見て安心せず、どんな条件で貼られたラベルかを見る必要がある |
| 有意と非有意はきっぱり分かれるので、基準の内側なら効果あり、外側なら効果なしと二分してよい | 有意と非有意の境目は崖ではなく坂だ。Gelman & Stern 2006は、有意だったものと有意でなかったものの差それ自体が統計的に有意とは限らないことを指摘した。基準の少し内側と少し外側は地続きで、ほとんど同じ二つを正反対に扱うことになる。だからAmrhein ら 2019は多数の科学者が名を連ねたNatureのコメントで統計的有意という言い方の引退を呼びかけた。有意でないことは差がある証拠が足りないであって差がないことの証明ではない |
皮肉なのは、「有意差あり」という一言が、いちばん思考を止めやすいことだ。星印ひとつ、p の小さな数字ひとつが添えられているだけで、私たちは「確かめ終えた」と感じ、そこで問いを閉じてしまう。だが、その一言は、差の大きさについても、商いにとっての重さについても、何も語っていない。有意は、旅の終わりではなく、入口の一つにすぎない。差を読む力のほんとうの値打ちは、有意という星印を集めることではなく、星印の有無にかかわらず、この差はどれくらいの大きさで、自分にとってどれだけ効くのかを、自分の言葉で言えることにある。専門家集団がわざわざ声明を出してまで戒めたのは、この一点だ——有意を、意味とすり替えないこと。次は、そうした数字の読みに、数字にならない声をどう対等に組み合わせるかへ進む。
Q1. 『有意差が出れば意味がある』はなぜ値切られるのか。ASA声明(Wasserstein & Lazar 2016)の内容と、その声明の性格に触れて説明せよ。一問一答
Q2. Ioannidis 2005が論じた内容として正しいものはどれか。選択
Q3. Gelman & Stern 2006によれば、『有意だった』ものと『有意でなかった』ものの ____ それ自体は、統計的に ____ とは限らない。基準の内側と外側は ____ で、そこに崖はない。穴埋め
Q4. 『有意差が出た』という一語に判断を明け渡さないために、この単位は差をどんな観点で読み直せと勧めているか。三つの問いを挙げよ。一問一答
Q5. この単位が扱った検定の読み方の研究・声明を、年の早い順に並べよ。(ア)ASAが公式声明でp値の誤用を戒める(イ)Ioannidis が有意な知見の多くは偽だと論じる(ウ)Amrhein らが多数署名で有意の引退を呼びかける(エ)Gelman & Stern が有意と非有意の差自体は有意とは限らないと示す並べ替え
紙かメモアプリに今日の日付を書く。自分の商いで、最近『差が出た』あるいは『差が出なかった』と受け取った出来事を一つ選んで、何の差かを一言書く(たとえば、先月と今月の売上、施策の前後の来客、A案とB案の反応など)。次に、三つを一言ずつ書く。①大きさ——その差はどれくらいの大きさか。②重要性——その大きさは、自分の商いにとって意味があるほどか。③確かさ——たまたまの揺れではないと、どこまで言えそうか。有意かどうかを判定する必要はなく、統計の個別判定をする必要もない。差を、大きさと重要性で読み直すメモとして完結させる。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Wasserstein R.L., Lazar N.A. (2016) ‘The ASA Statement on p-Values: Context, Process, and Purpose’, The American Statistician 70(2):129-133 — doi.org
- Greenland S., Senn S.J., Rothman K.J., Carlin J.B., Poole C., Goodman S.N., Altman D.G. (2016) ‘Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations’, European Journal of Epidemiology 31(4):337-350 — doi.org
- Ioannidis J.P.A. (2005) ‘Why Most Published Research Findings Are False’, PLoS Medicine 2(8):e124 — doi.org
- Gelman A., Stern H. (2006) ‘The Difference Between “Significant” and “Not Significant” is not Itself Statistically Significant’, The American Statistician 60(4):328-331 — doi.org
- Head M.L., Holman L., Lanfear R., Kahn A.T., Jennions M.D. (2015) ‘The Extent and Consequences of P-Hacking in Science’, PLoS Biology 13(3):e1002106 — doi.org
- Amrhein V., Greenland S., McShane B. (2019) ‘Scientists rise up against statistical significance’, Nature 567:305-307 — doi.org