「A/Bで比べれば正解が出る」——だが強力な道具ほど、罠に囲まれている
A/Bテストで数字を比べれば、客観的に正解が決まる、と思われている。だが皮肉なことに、この道具を長く回してきた人ほど、強く警告を残している。勝ちと判定されたものの3〜4割は偽物で、覗き見は偽の勝ちを作り、目新しさの勝ちは長続きしない。道具の名前を知ることと、正しく使えることは、別である。
前の単位では、効果を素朴に測ると何を取り違えるのかを扱った。ここでは、二つの案を比べて磨くという道具——A/Bテストそのものに、どんな罠が仕込まれているのかを扱う。
A/Bテストとは、二つの案(AとB)を、来た人を無作為に振り分けてそれぞれに見せ、どちらの反応がよかったかを比べる実験のことだ。件名を二通り、ボタンの色を二通り、値付けの見せ方を二通り。数字で比べれば、客観的に正解が決まる——そう思われている。だが、この棚の背骨をここでも一度確かめておく。A/Bという道具が強力であることと、あなたがそれを正しく使えることは、別物である。 道具の名前を知っていることは、その道具に仕込まれた罠を避けられることを、少しも意味しない。この単位が言うことも三つに絞る——A/Bは何を測る道具なのか。どの罠が実際に確かめられているのか。その罠は、素朴に使うとどこで牙をむくか。 なお、効果測定の設計そのものは前の 358 が、かけた費用に対する回収は 366 が扱う。ここでは、A/Bという道具の限界だけを見る。
A/Bは強力な道具である——だからこそ、提唱者が最も警告している
この単位は、A/Bテストを否定しない。無作為に振り分けて比べるという考えは、前の単位で見た活動バイアスのような偏りを断ち切る、最も信頼できる測り方である。だからこそ、それを長く実務で回してきた人たちが、いちばん強く警告を残している。
オンラインでの統制実験を体系化した由緒として、**Kohavi・Tang・Xu が2020年に Cambridge University Press から出した *Trustworthy Online Controlled Experiments* という書籍**がある。信頼できるA/Bテストの実務書だ。彼らは同じ年より前、2017年に *Harvard Business Review* 誌(95(5))でも、オンライン実験の意外な力を説いている。だが彼らの本領は、力の礼賛ではなく、取り違えの警告のほうにある。そして統計の側からも、警告は積み上がってきた。**2023年に *The American Statistician* 誌 78(2):135-149 へ出た、Larsen・Stallrich・Sengupta・Deng・Kohavi・Stevens のレビューは、A/Bテストが新しい統計的課題を抱えていると総ざらいした。抄録にはこうある——“In this paper we review challenges that require new statistical methodologies to address them.”(本稿では、それらに対処するために新しい統計的手法を必要とする諸課題を概観する)。A/Bは、ボタンひとつで正解が出る箱ではない。** 正しく使うには、これから見る罠を、ひとつずつ避けなければならない。
有意差の3〜4割は、偽物だった
最初の罠は、いちばん怖い。「差が出た」と判定されたもののうち、かなりの割合が、本当は差のない偽物だということだ。偽陽性(偽発見)——本当は差がないのに、たまたま差が出たように見えてしまうこと——である。
**2022年に *Management Science* 誌 68(9):6762-6782 へ出た、Berman と Van den Bulte の研究は、実際に運用されたA/Bテストの集まりを調べ、この偽物の割合を推定した。題は「False Discovery in A/B Testing」。彼らの推定では、10%の有意水準で検定したとき、偽発見率——差ありと判定されたもののうち本当は差がなかったものの割合——は、おおむね28%から37%に及んだ。 つまり、現場で「勝った」と判定されたA/Bの、およそ3〜4割は、勝っていなかった。**
なぜこんなことが起きるのか。多くの改善案は、実際には効果がほとんどない。効果のない案をたくさん試せば、そのうちいくつかは、偶然、差が出たように見える。たくさん試すほど、偶然の勝者が紛れ込む。 「A/Bで勝った」という一言は、それだけでは、本物の勝ちと偶然の勝ちを区別していない。
覗き見が「勝ち」を作る
偽物の勝ちを、さらに増やしてしまう使い方がある。覗き見(peeking)だ。テストを走らせながら、結果を途中で何度も見て、差が出て「勝った」ように見えた瞬間に、そこで止める。これは、直感的には賢く見える。早く決まるなら、それに越したことはない、と。
2022年に国際会議 KDD の予稿集(KDD ’22)へ出た、Kohavi・Deng・Vermeer の「A/B Testing Intuition Busters」は、まさにこの種の直感の誤りを名指しした。走らせている途中の数字は、上下に揺れる。何度も覗いて、良く出た瞬間で止めれば、本当は差がなくても「勝った」という結論を、いくらでも作り出せる。 止めどきを結果に合わせて選ぶことは、偽陽性を大きく膨らませる。先の Larsen らのレビューも、この覗き見を、A/Bが抱える統計的課題の筆頭に挙げている。
ここで効いてくるのが、Twyman の法則——あまりに目立つ、あまりに良すぎる数字は、たいてい何かの間違いである、という経験則だ。桁外れの勝ちが出たら、まず祝う前に、測り方を疑う。この単位は、覗き見のやり方も、有意になるまで条件を探す手口も書かない。 書くのは、それらが存在すること、そして偽の勝ちを生む危険があること、までである。
短期の勝ちは、長続きしないことがある——目新しさ
仮に、偽物でない本物の差が出たとする。それでも、もう一つの落とし穴がある。その勝ちが、短期だけのものかもしれない、ということだ。
新しい見せ方は、それが新しいというだけで、一時的に反応を上げることがある。これを目新しさ(novelty)効果と呼ぶ。逆に、見慣れたものが無視されるようになる学習もある。2015年に国際会議 KDD の予稿集(KDD ’15, pp.1849-1858)へ出た、Hohnhold・O’Brien・Tang の研究は、長期を見ることの大切さを、大規模なオンライン実験で示した。短い窓で見た「勝ち」は、時間が経つと、目新しさが薄れ、あるいは利用者が慣れて、当初の差が縮んだり、消えたり、向きが変わったりする。 数日の勝ちを、恒久の勝ちと取り違えると、短期の数字に振り回されることになる。A/Bの窓の長さそのものが、結論を左右する。
あなたの母集団でしか言えない——外的妥当性と干渉
最後の罠は、A/Bの結果を、外へ持ち出すときに待っている。外的妥当性——その結果が、別の相手・別の場面でも通じるか——の限界である。A/Bが正しく測るのは、その実験に来た人たちの、その時期の、その文脈での差だけだ。あなたの母集団と違う相手には、同じ差が出るとはかぎらない。他人の売り場で勝った案を、そのまま自分の売り場に持ち込んでも、同じ勝ちにはならない。
さらに、実験の内側でも前提が崩れることがある。A/Bは普通、AとBが互いに影響し合わないことを前提にする。だが、2014年に国際会議 EC の予稿集(EC ’14, pp.567-582)へ出た、Blake と Coey の研究は、市場のような場では、この前提(干渉が無いこと——専門的には SUTVA と呼ばれる)が破れることを示した。試験群と対照群が同じ市場で客を取り合えば、片方への施策がもう片方にも影響する。彼らの分析では、この干渉を無視すると、ある施策の効果が約2倍も過大に見えた。AとBが互いに干渉していると、A/Bは、実際より大きな差を報告する。
時間・変化:2014年から2023年まで
順に置く。2014年、Blake と Coey が、市場での干渉(SUTVA違反)が効果を約2倍過大に見せうると示す。2015年、Hohnhold らが、短期の勝ちが長期には縮む・消えることを、目新しさと学習の観点から示す。2017年、Kohavi と Thomke が、オンライン実験の力を実務誌で説く(由緒)。2020年、Kohavi・Tang・Xu が、信頼できるA/Bテストの実務書をまとめる(由緒)。2022年、Berman と Van den Bulte が、勝ちの3〜4割が偽物でありうると推定し、Kohavi らが直感の誤りを名指しする。2023年、Larsen らが、A/Bの統計的課題を総ざらいする。
この10年で確からしくなったのは、「A/Bで比べれば正解が出る」という側ではない。 確からしくなったのは、A/Bは強力だが、偽陽性・覗き見・目新しさ・干渉・外的妥当性という罠に囲まれており、正しく使うには相応の慎重さが要る、という向きのほうである。道具が広まるほど、はっきりしてきたのは、その道具の限界のほうだった。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、「A/Bで決めた」という一言が持つ、客観の響きである。数字で比べたのだから公平だ、と感じてしまう。だが比べた数字が、偽陽性か、覗き見の産物か、目新しさの一時か、干渉で膨れたものか——そこを問わないかぎり、客観の響きは、ただの響きである。「A/Bで勝った」は、それだけでは、何も保証しない。
標本の偏りも断っておく。ここで引いた実証の多くは、大量のアクセスがある、大規模なオンラインの場で採られたものだ。一日の来客が数人・数十人の売り場では、そもそも統計的な差を出せるだけの標本が集まらない。 A/Bが回せないことは、劣っていることではない。数の壁の前で、A/Bはしばしば無力になる。回せないなら、無理に回した弱い数字を信じるより、回さないほうが正直なこともある。
助けになるのは、自分が過去に「A/Bで勝った」「試して良かったほうにした」と判断したものを一つ選び、その判断が、ここで見た罠のどれかで説明できてしまわないかを、自分の手元の記録だけで問い直すという一手である。標本はいくつだったか。途中で結果を見て止めなかったか。勝ちは、しばらく経っても続いたか。
最初の一歩は10分。過去に自分が二つの案を比べて片方に決めた出来事を一つ思い出し、そのとき見た数字と、比べた期間、対象のおおよその数を書き出す。そのうえで、「覗き見・小さすぎる標本・目新しさ・干渉」の四つの罠のうち、どれが当てはまりそうかに印を付ける。 どれも当てはまらないと言い切れれば、その判断は比較的頑丈だ。顧客を新しく無作為な二群に割り付ける必要はない。あくまで、済んだ判断を、自分の記録の上で見直すだけである。
次の単位は 360「媒体を使い分けるには?」——どの媒体でどう届けるか、そして「各媒体の効果」を切り分けるという前提が、そもそもどこで崩れるのかを扱う。
- オンラインでの統制実験を体系化した由緒として、Kohavi・Tang・Xu が2020年に Cambridge University Press から出した Trustworthy Online Controlled Experiments という書籍があり、同じ著者は2017年の Harvard Business Review 誌でもオンライン実験の力を説いた。だが彼らの本領は力の礼賛ではなく取り違えの警告にあり、A/Bはボタンひとつで正解が出る箱ではない
- 2022年に Management Science 誌 68(9):6762-6782 へ出た Berman と Van den Bulte は、実際に運用されたA/Bテストを調べ、10%の有意水準で偽発見率がおよそ28%から37%に及ぶと推定した。現場で勝ったと判定されたA/Bの、およそ3〜4割は勝っていなかった。効果のない案を多く試すほど偶然の勝者が紛れ込む
- 2022年に国際会議KDDの予稿集(KDD ’22)へ出た Kohavi・Deng・Vermeer のA/B Testing Intuition Bustersは、走らせている途中の数字を何度も覗いて良く出た瞬間で止める覗き見が、本当は差がなくても勝ったという結論を作り出すと名指しした。止めどきを結果に合わせると偽陽性が大きく膨らむ
- 2023年に The American Statistician 誌 78(2):135-149 へ出た Larsen・Stallrich・Sengupta・Deng・Kohavi・Stevens のレビューは、A/Bが新しい統計的手法を要する諸課題(覗き見・分散・干渉など)を抱えると総ざらいした。抄録は、In this paper we review challenges that require new statistical methodologies to address them. と述べる
- 2015年に国際会議KDDの予稿集(KDD ’15, pp.1849-1858)へ出た Hohnhold・O’Brien・Tang は、長期を見ることの大切さを大規模なオンライン実験で示した。新しい見せ方は目新しさだけで一時的に反応を上げることがあり、短い窓で見た勝ちは時間が経つと縮んだり消えたり向きが変わったりする
- 2014年に国際会議ECの予稿集(EC ’14, pp.567-582)へ出た Blake と Coey は、市場のような場ではAとBが互いに影響し合わない前提(干渉が無いこと、SUTVA)が破れることを示した。試験群と対照群が同じ市場で客を取り合うと干渉が起き、これを無視すると効果が約2倍も過大に見えた
- この単位の背骨は、A/Bという道具が強力であることと、あなたがそれを正しく使えることは別物だということである。A/Bは偽陽性・覗き見・目新しさ・干渉・外的妥当性という罠に囲まれ、A/Bで勝ったという一言はそれだけでは何も保証しない。Twyman の法則——良すぎる数字は疑う——が効いてくる
| よくある誤解 | 実際のところ |
|---|---|
| A/Bテストで数字を比べれば、客観的に正解が決まる | 2022年の Berman と Van den Bulte(Management Science 68(9):6762-6782)は、10%の有意水準で偽発見率がおよそ28〜37%に及ぶと推定した。現場で勝ったと判定されたA/Bの3〜4割は勝っておらず、A/Bで勝ったという一言は、それだけでは本物の勝ちと偶然の勝ちを区別していない |
| 良い結果が出たら、そこでテストを止めて採用すればよい | 2022年の Kohavi・Deng・Vermeer(KDD ’22)は、走らせている途中の数字を何度も覗いて良く出た瞬間で止める覗き見が、本当は差がなくても勝ったという結論を作り出すと名指しした。止めどきを結果に合わせると偽陽性が膨らむ。Twyman の法則——良すぎる数字は疑う——が効いてくる |
| A/Bで勝った案は、これからもずっと勝ち続ける | 2015年の Hohnhold・O’Brien・Tang(KDD ’15)は、新しい見せ方が目新しさだけで一時的に反応を上げることがあり、短い窓の勝ちは時間が経つと縮んだり消えたりすると示した。数日の勝ちを恒久の勝ちと取り違えると、短期の数字に振り回される |
| A/Bで出た結果は、どんな相手・どんな場面でも通じる | A/Bが正しく測るのはその実験に来た人の・その時期の・その文脈での差だけである。さらに2014年の Blake と Coey(EC ’14)は、試験群と対照群が同じ市場で客を取り合う干渉(SUTVAの破れ)を無視すると、効果が約2倍も過大に見えると示した。結果を外へ持ち出すときには外的妥当性の限界が待つ |
皮肉なのは、いちばん熱心にA/Bを回している売り出しほど、「これは数字で決めた」と胸を張りやすいことである。数字で比べたのだから公平だ、という響きは強い。だが比べた数字が、偽陽性か、覗き見の産物か、目新しさの一時か、干渉で膨れたものか——それを問わないかぎり、公平の響きは、ただの響きにすぎない。A/Bで勝ったように見えるのは、多くの場合、その勝ちが本物だったかを、しばらく経ってから誰も確かめ直さないからである。良すぎる数字は、祝う前に疑う。それだけが、この強力な道具を、道具のまま使い続ける方法である。
Q1. 2022年の Berman と Van den Bulte の推定では、10%の有意水準で検定したとき偽発見率はおよそ ____ %から ____ %に及び、現場で「勝った」と判定されたA/Bの、およそ ____ 割は勝っていなかった。穴埋め
Q2. A/Bテストの『覗き見(peeking)』とは何をすることで、なぜ偽の勝ちを作ってしまうのか。2022年の Kohavi らの指摘に触れて答えよ。一問一答
Q3. 2014年の Blake と Coey が、市場でのA/B実験について示したことはどれか。選択
Q4. 『目新しさ(novelty)効果』について、2015年の Hohnhold らの知見に沿う説明はどれか。選択
Q5. この単位が扱った研究・書籍を、年の早い順に並べよ。(ア)Berman と Van den Bulte が勝ちの3〜4割は偽物でありうると推定する(イ)Blake と Coey が市場の干渉で効果が約2倍過大になりうると示す(ウ)Larsen らがA/Bの統計的課題を総ざらいする(エ)Kohavi・Tang・Xu が信頼できるA/Bの実務書をまとめる並べ替え
紙かメモアプリに今日の日付を書く。次に、過去に自分が二つの案を比べて片方に決めた出来事——件名の比較、投稿の出し分け、セール文面の比べ方など——を一つ思い出し、そのとき見た数字と、比べた期間、対象のおおよその数を書き出す。続いて、四つの罠——(1)覗き見(途中で結果を見て良いところで止めなかったか)、(2)小さすぎる標本(差を出せるだけの数があったか)、(3)目新しさ(勝ちはしばらく経っても続いたか)、(4)干渉(AとBが同じ客を取り合っていなかったか)——のそれぞれについて、当てはまりそうか否かの印を付ける。すべて当てはまらないと言い切れれば、その判断は比較的頑丈だと一言添える。顧客を新しく無作為な二群に割り付ける必要はない。あくまで、済んだ判断を自分の記録の上で見直すだけにする。一人で全部を回している場合も、そのまま同じ形で書ける。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Kohavi R., Tang D., Xu Y. (2020) ‘Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing’, Cambridge University Press — www.cambridge.org
- Berman R., Van den Bulte C. (2022) ‘False Discovery in A/B Testing’, Management Science 68(9):6762-6782 — doi.org
- Kohavi R., Deng A., Vermeer L. (2022) ‘A/B Testing Intuition Busters: Common Misunderstandings in Online Controlled Experiments’, Proceedings of the 28th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD ’22) — doi.org
- Larsen N., Stallrich J., Sengupta S., Deng A., Kohavi R., Stevens N.T. (2023) ‘Statistical Challenges in Online Controlled Experiments: A Review of A/B Testing Methodology’, The American Statistician 78(2):135-149 — doi.org
- Hohnhold H., O’Brien D., Tang D. (2015) ‘Focusing on the Long-term: It’s Good for Users and Business’, Proceedings of the 21st ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD ’15), pp.1849-1858 — doi.org
- Blake T., Coey D. (2014) ‘Why marketplace experimentation is harder than it seems: the role of test-control interference’, Proceedings of the 15th ACM Conference on Economics and Computation (EC ’14), pp.567-582 — doi.org
- Kohavi R., Thomke S. (2017) ‘The Surprising Power of Online Experiments’, Harvard Business Review 95(5), Sept–Oct 2017 — hbr.org