「クリックを数えれば効果が分かる」——だが測れるものと、正しく測れるものは違う
クリックやコンバージョンを見れば、広告が効いたか分かる、と思いたくなる。だが皮肉なことに、広告を見た人はもともとよく買う人に偏っている。素朴に測ると効果は過大に見え、正しく測るには現実離れした規模が要り、近道は実験を再現できない。測れることと、正しく測れることは、別である。
前の単位では、今買う理由の作り方——希少性・限定を扱った。ここでは、打った仕掛けが本当に効いたのかを、どう測るのかを扱う。測り方の設計、その落とし穴の話である。
この棚が終わりに回収する背骨を、ここで一度だけ触れておく。クリックは数えられ、店頭の交わした一言は数えられない。だから効果測定は、測りやすい仕掛けを、勝手に優遇する。 数字が販促の良し悪しを決めるとき、実際に決めているのは、しばしば測り方のほうである。この単位が言うことも三つに絞る——何を測っていることになっているのか。どこまで正しく測れると確かめられているのか。素朴に測るとどこで間違うか。
先に用語をほどく。コンバージョンとは、購入・申込み・来店など、狙った行動が実際に起きることだ。アトリビューションとは、その行動に、どの広告・接点がどれだけ効いたかを割り当てる作業のことである。「広告の効果を測る」と言うとき、たいていこのアトリビューションを指している。そして、この割り当てが、思っているよりずっと難しい。ここが、この単位の全部である。なお、A/Bで二つを比べる方法そのものは次の 359 が、かけた費用に対する回収は 366 が扱う。ここでは、何をどう測るか、その設計と落とし穴に絞る。
「クリックを数えれば効果が分かる」の落とし穴——活動バイアス
いちばん素朴な測り方は、こうだ。広告を見せた人と、見せていない人で、その後の購入を比べる。あるいは、広告をクリックした人が、そのあと買った数を数える。見た人のほうがよく買っていれば、広告が効いた——そう読みたくなる。
ここに、大きな落とし穴がある。2011年に国際会議 WWW の予稿集(WWW ’11, pp.157-166)へ出た、Lewis・Rao・Reiley の研究は、これを正面から突いた。題は「Here, there, and everywhere」——相関したオンライン行動が、広告効果の過大推定につながる、というものだ。もともとネットでよく動く人は、広告にも当たりやすく、同時に、買い物もよくする。 つまり「広告を見た人」という集団は、最初から「よく買う人」に偏っている。広告のおかげで買ったのではなく、よく買う人が、広告にもよく当たっていただけかもしれない。この偏りを、活動バイアスと呼ぶ。
彼らが示したのは、素朴な観測データによる推定が、この活動バイアスのせいで広告効果を大きく過大に見せるということだった。見た人と見ていない人の間に出る差の多くは、最初からあった集団の違いであって、広告が作った差ではない。クリックの後に購入があったことは、クリックが購入を生んだことを意味しない。
この論争には長い歴史がある。広告がどう効くのかを整理した1999年の総説(Vakratsas と Ambler、Journal of Marketing 誌)以来、「効いたように見える数字の多くは、もともと買う人を数えているだけではないか」という疑いは、繰り返し立てられてきた。素朴なアトリビューションは、その疑いに答えられない。
効果は小さく、ノイズは大きい——だから実験でも測りにくい
では、無作為化した実験——対象をくじ引きのように二群に分け、片方だけに広告を当てて比べる、いちばん信頼できる測り方——を使えばいいのか。原理としては、そのとおりである。 だが、ここにもう一つの壁がある。
**2014年に *Quantitative Marketing and Economics* 誌 12(3):235-266 へ出た、Lewis と Reiley の研究は、大手ポータルサイトの利用者を対象に、オンライン広告が実店舗での売上に与える効果を、統制された実験で測った。彼らが直面したのは、効果そのものは小さく、売上のばらつき(ノイズ)は大きい、という現実だった。広告が売上を少し押し上げたとしても、その小さな押し上げは、日々の売上の大きなゆらぎに埋もれてしまう。小さな信号を、大きな雑音の中から取り出すには、桁違いに大きな標本が要る。** 数千人では足りず、数十万・数百万人規模でないと、効果があるともないとも言い切れない。
測ることが原理的に不可能だと言っているのではない。素朴に測ると誤り、正しく測るには現実離れした規模が要る、と言っている。 個人の商いや小さな売り場が、統計的に有意な広告効果を自前で測り切るのは、標本の壁の前で、たいてい無理がある。「効果が見えない」は、「効果がない」でも「測り方が下手」でもなく、「その規模では、そもそも見分けられない」なのかもしれない。
きちんと測れた稀な例では、多くが割に合っていなかった
それでも、大規模にきちんと測れた研究はある。そこで見えたものは、広告を打つ側にとって、決して甘くない。
**2021年に *Econometrica* 誌 89(4):1855-1879 へ出た、Shapiro・Hitsch・Tuchman の研究は、288のブランドのテレビ広告について、効果と採算を一般化できる形で推定した。結論は厳しいものだった——多くのブランドで、追加の一単位の出稿(限界的な出稿)は、投じた費用を回収できておらず、8割を超えるブランドで、その限界的な出稿のROIがマイナスだった。 ROIとは、投じた費用に対してどれだけ戻ってきたかの比のことだ。つまり、きちんと測ると、追加の広告の多くは、割に合っていなかった。**
これは、広告弾力性——広告費を増やすと売上がどれだけ増えるか——を多数の研究から束ねる試みの系譜に連なる(そうした広告弾力性のメタ分析は2011年にも行われている)。弾力性は総じて小さい。 広告を増やしても、売上はわずかしか増えない。「測れないから、たぶん効いている」という希望的観測は、きちんと測れた場面では、しばしば裏切られる。 ただし、この単位は個別の値上げや出稿の停止といった助言はしない。ここで言えるのは、測定の設計しだいで、同じ出稿が「効いた」にも「割に合わない」にも見える、ということまでである。
近道はRCTを再現できなかった——設計の選択が結果を左右する
大規模な無作為化実験はお金も手間もかかる。そこで、実験をせずに、観測データを統計や機械学習で調整して、実験と同じ答えを得ようという近道が、たくさん提案されてきた。マッチング(似た人どうしを比べる)、回帰による調整、機械学習を使った推定——これらは、実験の代わりになるのか。
**2023年に *Marketing Science* 誌 42(4):768-793 へ出た、Gordon・Moakler・Zettelmeyer の研究は、この問いを大規模に検証した。題は「Close Enough?(十分に近いか)」。答えは、多くの場面で、近づけなかった**である。非実験的な近道の推定は、無作為化実験(RCT)が出す答えを、安定して再現できなかった。近道は、活動バイアスのような偏りを、完全には拭えない。
そして、設計の細かい選択そのものが、測られる効果を動かす。 **2015年に *Quantitative Marketing and Economics* 誌 13(3):203-247 へ出た、Sahni の研究は、広告を見せる時間の間隔を変えるだけで、測定される効果が変わることを、オンラインの実験で示した。2018年に *Proceedings of the National Academy of Sciences* 誌 115(23):E5254-E5255 へ出た、Eckles・Gordon・Johnson のレターは、心理的に狙い撃ちした広告の効果を測るfield研究が、内的妥当性への深刻な脅威に直面する——つまり、測れたと思った効果が、実は測り方の副産物かもしれない——と指摘した。露出の間隔、対象の選び方、比較の作り方。どこを動かしても、数字が動く。** 測り方が結果を作っている、という通奏低音が、ここでいちばん濃くなる。
時間・変化:2011年から2023年まで
順に置く。2011年、Lewis・Rao・Reiley が、相関した行動が広告効果を過大推定させることを示す(活動バイアス)。2014年、Lewis と Reiley が、効果は小さくノイズは大きく、測るには桁違いの標本が要ると示す。2015年、Sahni が、露出の間隔で測定される効果が変わると示す。2018年、Eckles らが、狙い撃ち広告のfield研究は内的妥当性を脅かされると指摘する。2021年、Shapiro らが、288ブランドの多くで限界的な出稿は割に合っていないと示す。2023年、Gordon らが、非実験の近道はRCTを再現できないと結論する。
この10余年で確からしくなったのは、「広告の効果は簡単に測れる」という側ではない。 確からしくなったのは、素朴に測ると過大に見え、正しく測るには規模が要り、近道は実験を再現できない、という向きのほうである。測定の技術が進むほど、はっきりしてきたのは、測るのが難しい、ということそのものだった。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、数字が出ていることを、正しく測れていることと同じだと思ってしまうことである。管理画面には、クリック数もコンバージョン数も、きれいに並ぶ。だが並んでいる数字は、活動バイアスを拭ったものではない。測れることと、正しく測れることは、別である。
標本の偏りも断っておく。ここで引いた実証の多くは、大規模なオンライン広告や、テレビ広告のような、大量配信の場面で採られたものだ。手渡しのチラシ、店頭の声かけ、常連への一言——数えにくい仕掛けは、そもそもこの種の研究の視野に入っていない。 通奏低音のとおり、測りやすい販促だけが、上手く見える。数えにくい販促が効いていないのではなく、数えられていないだけかもしれない。
助けになるのは、自分が「これは効いた」と判断した過去の告知を一つ選び、その判断が、活動バイアスで説明できてしまわないかを、自分の手元の記録だけで問い直すという一手である。効いたと思った相手は、そもそも、もともとよく反応する層ではなかったか。届いた先と、買った先は、本当に広告のおかげで結ばれたのか。
最初の一歩は10分。過去に「効いた」と感じた自分の告知を一つ選び、そのとき見た数字(クリック・反応・購入など)を書き出す。次に、その数字が「広告がなくても、その人たちはどのみち買っていた」という説明でも成り立たないかを、一行で書いてみる。成り立ってしまうなら、その数字は効果の証明にはなっていない。 誰かに聞く必要も、新しく試す必要もない。「反証を思いつけない」と書けたら、それも一つの収穫だ。
次の単位は 359「A/Bテストで磨くには?」——二つを比べて磨くという道具そのものに、どんな罠が仕込まれているのかを扱う。
- 2021年に Econometrica 誌 89(4):1855-1879 へ出た Shapiro・Hitsch・Tuchman は、288ブランドのテレビ広告を一般化できる形で推定し、8割を超えるブランドで限界的な出稿のROIがマイナス、広告弾力性は総じて小さいと示した。きちんと測ると追加の広告の多くは割に合っていなかった
- 2011年に国際会議WWWの予稿集(WWW ’11, pp.157-166)へ出た Lewis・Rao・Reiley は、相関したオンライン行動が広告効果を過大推定させると示した。もともとよく動く人は広告にも当たりやすく買い物もよくするため、広告を見た人という集団は最初からよく買う人に偏っている(活動バイアス)
- 2014年に Quantitative Marketing and Economics 誌 12(3):235-266 へ出た Lewis と Reiley は、大手ポータル利用者を対象にオンライン広告の実店舗売上への効果を統制実験で測り、効果は小さくノイズは大きいため、見分けるには数十万から数百万人規模の桁違いの標本が要ると示した
- 2015年に Quantitative Marketing and Economics 誌 13(3):203-247 へ出た Sahni は、広告を見せる時間の間隔を変えるだけで測定される効果が変わることをオンライン実験で示した。設計の細かい選択そのものが、測られる効果を動かす
- 2018年に Proceedings of the National Academy of Sciences 誌 115(23):E5254-E5255 へ出た Eckles・Gordon・Johnson のレターは、心理的に狙い撃ちした広告の効果を測るfield研究が内的妥当性への深刻な脅威に直面すると指摘した。測れたと思った効果が測り方の副産物でありうる
- 2023年に Marketing Science 誌 42(4):768-793 へ出た Gordon・Moakler・Zettelmeyer は、マッチング・回帰・機械学習といった非実験的な近道が、無作為化実験(RCT)の出す答えを安定して再現できないと大規模に検証した。近道は活動バイアスのような偏りを拭い切れない
- この単位の背骨は、通奏低音②——測れた販促しか映さない、である。クリックは数えられ店頭の一言は数えられないため、効果測定は測りやすい仕掛けを優遇する。素朴に測ると過大に見え、正しく測るには規模が要り、近道は実験を再現できない。測れることと正しく測れることは別である
| よくある誤解 | 実際のところ |
|---|---|
| クリック数やコンバージョン数を見れば、広告が効いたかどうかが分かる | 2011年の Lewis・Rao・Reiley(WWW ’11)は、相関したオンライン行動が広告効果を過大推定させると示した。広告を見た人はもともとよく買う人に偏っており(活動バイアス)、クリックの後に購入があったことは、クリックが購入を生んだことを意味しない。管理画面の数字は、この偏りを拭ったものではない |
| 実験さえすれば、広告の効果は簡単にはっきり測れる | 2014年の Lewis と Reiley(Quantitative Marketing and Economics 12(3))は、効果は小さくノイズは大きいため、統計的に見分けるには数十万から数百万人規模の桁違いの標本が要ると示した。効果が見えないことは、効果がないことでも測り方が下手なことでもなく、その規模では見分けられないことでありうる |
| マッチングや機械学習でデータを調整すれば、実験をしなくても同じ答えが出る | 2023年の Gordon・Moakler・Zettelmeyer(Marketing Science 42(4):768-793)は、非実験的な近道が無作為化実験(RCT)の答えを安定して再現できないと大規模に検証した。近道は活動バイアスのような偏りを拭い切れず、設計の選択(露出の間隔・対象の選び方)でも数字は動く |
| 測れないだけで、広告費はかければたぶん回収できている | 2021年の Shapiro・Hitsch・Tuchman(Econometrica 89(4):1855-1879)は、288ブランドの多くで限界的な出稿のROIがマイナスで、広告弾力性は総じて小さいと示した。きちんと測れた稀な場面では、追加の広告の多くは割に合っていなかった |
皮肉なのは、いちばん熱心に数字を見ている売り出しほど、「効いている」と言い切りやすいことである。管理画面はいつでも何かの数字を返してくる。だが返ってくる数字は、活動バイアスを拭ったものでも、桁違いの標本で裏づけたものでもない。効果が測れているように見えるのは、その数字が、広告のおかげだったのか、それとも最初からよく買う人を数えていただけなのかを、誰も確かめないからである。測りやすい仕掛けが上手く見えるこの棚で、いちばん静かに効いていた販促は、たいてい数えられていない。
Q1. 「広告を見た人のほうがよく買っていた」という数字が、広告の効果の証明にならないことがあるのはなぜか。2011年の Lewis・Rao・Reiley が指摘した『活動バイアス』に触れて答えよ。一問一答
Q2. 2014年の Lewis と Reiley によれば、広告の効果は ____ く、売上のノイズは ____ いため、統計的に見分けるには ____ 規模の標本が要る。穴埋め
Q3. 2023年の Gordon・Moakler・Zettelmeyer が、マッチングや機械学習といった非実験的な近道について大規模に検証して示したことはどれか。選択
Q4. 2021年の Shapiro・Hitsch・Tuchman が288ブランドのテレビ広告について示したことはどれか。選択
Q5. この単位が扱った研究を、年の早い順に並べよ。(ア)Shapiro らが288ブランドの多くで限界出稿が赤字と示す(イ)Lewis・Rao・Reiley が活動バイアスによる過大推定を示す(ウ)Gordon らが非実験の近道はRCTを再現できないと結論する(エ)Lewis と Reiley が効果は小・ノイズは大で桁違いの標本が要ると示す並べ替え
紙かメモアプリに今日の日付を書く。次に、過去に自分が『これは効いた』と感じた告知や広告を一つ選び、そのとき見た数字(クリック数・反応数・購入数・来店数など、手元に残っているもの)を書き出す。続いて、その数字に対して一行で反証を書く——『広告がなくても、その人たちはどのみち買っていた(来ていた)のではないか』という説明でも、その数字が成り立ってしまわないか。成り立ってしまうなら、その数字は効果の証明にはなっていない、と一言添える。反証をどうしても思いつけなければ『反証を思いつけない』と書く。顧客に聞いたり、新しく広告を試したりする必要はない。あくまで自分の手元に残っている記録だけで完結させる。一人で全部を回している場合も、そのまま同じ形で書ける。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Shapiro B.T., Hitsch G.J., Tuchman A.E. (2021) ‘TV Advertising Effectiveness and Profitability: Generalizable Results From 288 Brands’, Econometrica 89(4):1855-1879 — doi.org
- Lewis R.A., Reiley D.H. (2014) ‘Online ads and offline sales: measuring the effect of retail advertising via a controlled experiment on Yahoo!’, Quantitative Marketing and Economics 12(3):235-266 — doi.org
- Sahni N.S. (2015) ‘Effect of temporal spacing between advertising exposures: Evidence from online field experiments’, Quantitative Marketing and Economics 13(3):203-247 — doi.org
- Eckles D., Gordon B.R., Johnson G.A. (2018) ‘Field studies of psychologically targeted ads face threats to internal validity’, Proceedings of the National Academy of Sciences 115(23):E5254-E5255 — doi.org
- Gordon B.R., Moakler R., Zettelmeyer F. (2023) ‘Close Enough? A Large-Scale Exploration of Non-Experimental Approaches to Advertising Measurement’, Marketing Science 42(4):768-793 — doi.org
- Lewis R.A., Rao J.M., Reiley D.H. (2011) ‘Here, there, and everywhere: correlated online behaviors can lead to overestimates of the effects of advertising’, Proceedings of the 20th International Conference on World Wide Web (WWW ’11), pp.157-166 — doi.org