1,450件の実験を数えたら、平均という言い方が使えなくなった
小さく作って、測って、学ぶ。手順としては申し分ない。ところが実際に大量の実験を数えた記録を見ると、狙った指標を改善したのは3分の1で、効果の分布は端のほうが極端に厚かった。平均を出しても、その数字はどの1件も表していない。
前の単位では、日々の小さな改善が続く条件を扱った。ここでは、その改善が効いたかどうかをどう確かめるのかを扱う。
この単位が扱うのは一点——小さく作って測って学ぶ、という言い方が、何を確かめられて、何を確かめられないかである。事業を始めるべきかどうかも、どこに金を投じるべきかも扱わない。
「確かめた」と言えるのは、比べられる形にして出したときだけである
言葉の中身を先に確かめておく。作って、測って、学ぶ——という三拍子は、それだけでは手順の名前にすぎない。測って学べるのは、比べる相手があるときだけである。
いちばん厳密な形が、同じ時期に、二通りを、無作為に分けた相手へ同時に出して、決めておいた指標の上で差を見るやり方である。オンラインの画面ではこれが安く回せるので、大量に実測が積み上がっている。この単位は、その実測の側から見る。 手法の名前ではなく、実際に何が出たかを見るということである。
「失敗原因の42%は市場ニーズのない製品」を、いま探しに行くと
この分野でいちばんよく引かれる数字から入る。「新しい事業がうまくいかなかった原因の42%は、誰も欲しがっていないものを作ったことだった」——研修の資料にも、事業計画の説明にも、繰り返し出てくる。
出どころは、ある調査会社が自社の情報基盤を使ってまとめた報告である(査読誌ではない。自社調査である)。2026年8月に現行版(2026年3月5日更新)を見たとき、そこに「市場ニーズが無い 42%」という項目は無かった。 現行版で最も多いとされているのは別の項目名で、数値も違う。母集団の記述はこうである——“Using the CB Insights platform, we identified 431 VC-backed startups that publicly shut down since 2023, excluding companies that had a prior exit.” 2023年以降に公に事業を畳んだ、ベンチャー資本の出資を受けた企業431社。過去に売却や上場を経ている企業は除く。
「42%」のほうは、2014年に公表され2019年前後まで更新されていた旧い版の数字である。 旧版の母集団は、すでに失敗した企業が自ら公開した事後の説明文101件を読んで分類したものだった。
ここには三つのことが重なっている。 ひとつ、査読の手続きを通っていない自社調査であること。ふたつ、事後の死因報告であること——生き延びた側が同じ理由をどれくらい抱えていたかは、この集計の中に無い。みっつ、版が変わると項目名も数値も母集団も入れ替わること。
だからこの数字は、「よくある落とし穴の一覧」としては読めるが、「原因の分布」としては読めない。 比較する相手がいないからである。
大多数の試みは、狙った指標を動かさない
では、比べる相手のあるほうの記録は何を言っているのか。Kohavi R. ら が2013年に KDD の会議録に出した報告(会議録である。査読の手続きはあるが、査読誌ではない)は、大規模な検索事業の実験基盤での実務を書いている。“… the use of controlled experiments has grown exponentially over time, with over 200 concurrent experiments now running on any given day.” どの日をとっても200を超える実験が並行して走っている、という規模である。
そのうえで、こう書いている——“Only one third of the ideas tested … improved the metric(s) they were designed to improve.” 試されたアイデアのうち、狙った指標を改善したのは3分の1だけだった。
同じ資料は、他社の数値も引いている。これは二次引用なので、そう断って書く。 ある検索事業では実験の約10%が事業上の変更につながったとされ、ある配信事業は自分たちが試すことの90%は間違いだと考えている、と紹介されている。この2つは、Kohavi ら が引いている数字であって、この報告が測ったものではない。
この3分の1という数字の読み方には、注意が要る。 これは「3分の2が無駄だった」という話ではない。動かなかったことが分かる、というのが実験の産物である。 ただし——思いついたことの多くは、思ったほうへ動かない、という前提のほうは、ここで実測されている。
効果の分布には、厚い裾がある——だから平均で語れない
もっと踏み込んだ実測がある。**Azevedo E.M., Deng A., Montiel Olea J.L., Rao J.M. & Weyl E.G. が2020年に *Journal of Political Economy* 128(12) に出した論文である(査読誌**)。同じ検索事業の実験基盤のデータを、分布の形の側から調べている。
対象の記述はこうである——“We have detailed data on the universe of experiments that [the platform] ran from January 2013 to June 2016.” 2013年1月から2016年6月までに走った実験を、まるごと手元に持っている、ということである。 そのうえで、その論文の表1が対象としているのは1,450件である。この件数は引用ではなく、表の見出しに記された対象の数として読む。
そして分布の形について——“The summary statistics suggest that the distribution of measured effects is fat tailed. Many experiments have very small measured deltas, while a handful show substantial gains.” 測られた効果の分布は裾が厚い。多くの実験は測られた差がとても小さく、一握りが大きな利得を示す。 要旨は、この裾の厚さについて “find extremely fat tails” と書いている。
この形が意味するのは、平均が代表値にならない、ということである。 「実験1件あたりの平均改善率」を出しても、その数字はどの1件も表していない。ほとんどはゼロの近くにあり、全体を作っているのは端のほうの数件である。
論文はここから、厚い裾のもとでは、少数の大きな実験より、多くの着想を小さめの標本で試すほうが望ましくなる、という向きの結論を出している——“when this distribution is very fat tailed, a ‘lean’ experimentation strategy consisting of trying more ideas, each with possibly smaller sample sizes, is preferred.” ただしこれは、裾の厚さがそれだけあるという条件つきの結論である。 手当たり次第に試せばよい、という一般的な処方ではない。
途中で覗くと、出てきた数字の意味が変わる
もうひとつ、実務でいちばん起きやすい崩れ方がある。**Johari R., Koomen P., Pekelis L. & Walsh D. が2022年に *Operations Research* 70(3):1806-1821 に出した論文(査読誌)は、こう書いている——“A/B tests are typically analyzed via frequentist p-values and confidence intervals, but these inferences are wholly unreliable if users endogenously choose sample sizes by continuously monitoring their tests.**”
途中の様子を見ながら、良さそうなところで止める。 その止め方をすると、ふつうの検定の数字は全く信頼できなくなる、と書かれている。論文が提案しているのは、いつ見ても成り立つ形の推測——“always valid p-values and confidence intervals that let users try to take advantage of data as fast as it becomes available, providing valid statistical inference whenever they make their decision.”
偽陽性が何倍になるかという数値は、ここには書かない。 原典から逐語で取れていないからである。書けるのは、途中で覗くやり方をすると、ふつうのやり方で出した数字は使えなくなる、というところまでである。
手引きは手引きであって、効果の証拠ではない
同じ著者たちが2009年に *Data Mining and Knowledge Discovery* 18(1):140-181 に出した論文(査読誌)は、この分野でいちばんよく引かれる実務の手引きである。“Controlled experiments embody the best scientific design for establishing a causal relationship between changes and their influence on user-observable behavior.” と書く一方、効き目については “Our experience indicates that significant learning and return-on-investment (ROI) are seen when development teams listen to their customers” と書いている。私たちの経験によれば、である。 手引きとしては優れているが、効果の証拠を背負わせる文ではない。
比較の対象があった実測を1つだけ挙げておく。**Thomke S.H. が1998年に *Management Science* 44(6):743-762 に出した論文(査読誌)は、集積回路の設計プロジェクトを比べている。試作を何度も回せる方式のほうが、そうでない方式より、人月で2.2倍上回った。そして差の43%超が、確かめ方の違いに帰せられるとされている。標本は集積回路の設計である。** 単位は人月であって、「開発期間が2.2倍速い」ではない。
時間・変化:数字が「原因の分布」に変わっていく順番
順番はだいたい決まっている。まずすでに畳んだ側の説明文が集められる。次に、それが分類される。次に、分類の割合が「原因」と呼ばれる。次に、母集団の記述が落ちる——101件だったのか431社だったのか、事後の説明文だったのか。最後に、割合だけが残る。
逆向きにはまず動かない。版が更新されて項目名も数値も入れ替わっても、古い割合のほうが引かれつづける。 更新は静かに起きるので、引く側がそれに気づく理由がない。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、確かめたことと、確かめた気になったことの区別がつかなくなることである。出したあとで数字が動いた、というだけでは比べたことにならない。同じ時期に別の何かが動いていた可能性を、そのやり方では外せない。
標本の偏りを断っておく。ここまでの実測は、オンラインの画面という、比べるのが極端に安い場所から採られている。1日に200を超える実験を並行できる基盤、1,450件を数えられる記録——そういう基盤を持っている場所の話である。 手元の仕事の多くは、同じ条件を二通り同時に用意できない。そして証拠の多くは米国の大企業に寄っており、日本の業務を対象にした査読研究はごく少ない。さらに——成功した組織のデータだけが残る、という逆向きを排除できない。 実験基盤の記録が公表されるのは、その基盤を維持できている場所からであり、途中でやめた確かめ方は数に入っていない。
助けるのは、確かめずに正しいと思って進めていることを、1つ書き出してみるという一手である。確かめなくてよい。確かめるとしたら何を見ればよいか、を1行添えるだけで、比べる相手の有無がはっきりする。
最初の一歩は10分。今日、確かめずに前提にしたことを1つ書き、その隣に「これを確かめるなら、何を見るか」を1行書く。誰かに訊きに行かない。
次の単位は 223「BCP・業務継続力」——流れが止まったとき、影響はどこまで、誰のところに出るのか。
- よく引かれる「失敗原因の42%は市場ニーズのない製品」は、調査会社の自社調査であって査読誌ではない。2026年8月に見た現行版(2026年3月5日更新)にその項目は無く、母集団は2023年以降に公に事業を畳んだベンチャー資本出資の431社に変わっていた
- 42%の旧版の母集団は、すでに失敗した企業が自ら公開した事後の説明文101件を読んで分類したものである。生き延びた側との比較が無いので、よくある落とし穴の一覧としては読めても、原因の分布としては読めない
- Kohavi R. ら の2013年の報告(KDD の会議録。査読の手続きはあるが査読誌ではない)は、ある検索事業で試されたアイデアのうち狙った指標を改善したのは3分の1だけだった、と書いている。どの日をとっても200を超える実験が並行して走っている規模である
- 同じ報告が引いている他社の数値(ある検索事業で約10%、ある配信事業は自分たちが試すことの90%は間違いだと考えている)は二次引用であり、この報告が測ったものではない
- Azevedo E.M. ら の2020年の論文(Journal of Political Economy 128(12)、査読誌)は、2013年1月から2016年6月までの1,450件を分析し、測られた効果の分布は裾が厚く、多くは差がとても小さく一握りが大きな利得を示す、と報告している。平均は代表値にならない
- Johari R. ら の2022年の論文(Operations Research 70(3):1806-1821、査読誌)は、途中で見ながら標本の大きさを決めると通常のp値と信頼区間は全く信頼できない、と書いている。偽陽性が何倍になるかの数値は、この単位では原典から逐語で取れていないので書かない
- Thomke S.H. の1998年の論文(Management Science 44(6):743-762、査読誌)は、集積回路の設計で、試作を何度も回せる方式が人月で2.2倍上回り、差の43%超が確かめ方の違いに帰せられると報告している。単位は人月であって開発期間ではない
| よくある誤解 | 実際のところ |
|---|---|
| 新しい事業がうまくいかない原因の42%は、市場ニーズのない製品を作ったことである | 出どころは調査会社の自社調査であって査読誌ではない。2026年8月に現行版(2026年3月5日更新)を見たとき、その項目は無く、母集団は2023年以降に公に事業を畳んだベンチャー資本出資の431社に変わっていた。42%のほうは2014年に公表された旧版の数字で、母集団はすでに失敗した企業が自ら公開した事後の説明文101件である。生き延びた側との比較が無いので、原因の分布としては読めない |
| 小さく試すことを繰り返せば、平均して少しずつ良くなっていく | Azevedo E.M. ら の2020年の論文(Journal of Political Economy 128(12)、査読誌)は、ある検索事業の実験基盤で2013年1月から2016年6月までの1,450件を分析し、測られた効果の分布は裾が厚く、多くの実験は測られた差がとても小さく、一握りが大きな利得を示す、と書いている。平均は代表値にならない |
| 途中経過を見ながら、差がはっきりした時点で止めれば早く確かめられる | Johari R. ら の2022年の論文(Operations Research 70(3):1806-1821、査読誌)は、検定を継続的に監視して標本の大きさを内から決めるなら、通常のp値と信頼区間による推測は全く信頼できない、と書いている。そのため、いつ判断しても妥当な推測を与える形が別に提案されている |
小さく試して確かめる、という言い方には、確かめるという動詞が入っている。実測を数えた側が報告しているのは、狙った指標を動かしたのは3分の1で、効果の分布は端のほうが極端に厚く、途中で覗けば数字の意味が変わる、ということだった。皮肉なのは、この確かめ方をいちばん熱心にすすめる資料の根拠になっている割合が、すでに畳んだ企業が自分で書いた事後の説明文を分類したもので、しかも版が変わって項目名ごと入れ替わっていたことである。
Q1. Azevedo E.M. ら の2020年の論文(Journal of Political Economy 128(12))は、ある検索事業の実験基盤で2013年1月から2016年6月までの ____ 件を分析し、測られた効果の分布は ____ が厚く、多くの実験は差がとても小さく、____ が大きな利得を示す、と書いている。穴埋め
Q2. Kohavi R. ら が2013年に ____ の会議録に出した報告は、試されたアイデアのうち狙った指標を改善したのは ____ だけだった、と書いている。会議録であり、査読の手続きはあるが ____ ではない。穴埋め
Q3. 「失敗原因の42%は市場ニーズのない製品」という数字について、本文が挙げた3つの問題を書きなさい。一問一答
Q4. Johari R. ら の2022年の論文(Operations Research 70(3))が書いていることを1文で述べ、この単位が「書かない」としている数値は何かを添えなさい。一問一答
Q5. 本文が示した「42%」という数字の来歴を、古いほうから順に並べなさい。(ア)2023年以降に公に事業を畳んだ431社という母集団に入れ替わった(イ)2014年に公表され、すでに失敗した企業が自ら公開した事後の説明文101件を分類したものだった(ウ)2019年前後まで更新されつづけた(エ)2026年8月に見たとき、最も多い項目の名前も数値も別のものになっていた並べ替え
今日の自分の仕事のなかで、確かめないまま正しいと思って前に進めたことを1つ選んで書く。手順の順番でも、この形式のほうが読みやすいはずだ、という思い込みでも、この作業には毎回これくらいかかる、という見積もりでもよい。書いたら、その隣に1行だけ添える——これを確かめるとしたら、何を見ればよいか。実際に確かめなくてよい。確かめられるかどうかも問わない。見る先が思いつかない場合は、思いつかないと書けばよい。それも記録である。誰にも訊きに行かず、他の人のやり方を観察もしない。組織に属していない場合や一人で全部を回している場合も、この課題はそのまま成立する——いま自分が続けている作業や調べもののなかから、同じように1つ選べばよい。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Azevedo E.M., Deng A., Montiel Olea J.L., Rao J.M., Weyl E.G. (2020) 'A/B Testing with Fat Tails', Journal of Political Economy 128(12):4614-4672, doi:10.1086/710607 — www.journals.uchicago.edu
- Kohavi R., Deng A., Frasca B., Walker T., Xu Y., Pohlmann N. (2013) 'Online controlled experiments at large scale', Proceedings of the 19th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD '13), pp.1168-1176, doi:10.1145/2487575.2488217(会議録。査読誌ではない) — doi.org
- Kohavi R., Longbotham R., Sommerfield D., Henne R.M. (2009) 'Controlled experiments on the web: survey and practical guide', Data Mining and Knowledge Discovery 18(1):140-181, doi:10.1007/s10618-008-0114-1 — doi.org
- Johari R., Koomen P., Pekelis L., Walsh D. (2022) 'Always Valid Inference: Continuous Monitoring of A/B Tests', Operations Research 70(3):1806-1821, doi:10.1287/opre.2021.2135 — doi.org
- Thomke S.H. (1998) 'Managing Experimentation in the Design of New Products', Management Science 44(6):743-762, doi:10.1287/mnsc.44.6.743 — doi.org
- CB Insights (2026) 'Why Startups Fail: Top 9 Reasons', CB Insights(2026年3月5日更新・2026年8月閲覧。査読誌ではない) — www.cbinsights.com