「星1つで売上5〜9%」は本物だった。落ちていたのは「系列店ではゼロに近い」のほうである
評判はいまや星の数の形をしていて、いちばんよく引かれるのが「星1つで売上5〜9%」である。皮肉なことに、その数字を出した論文の同じ一文の後半には、この効果は独立店によって駆動されており系列に属する店では評点は売上に影響しない、と書いてある。しかも出どころは査読誌ではなく、ある大学のワーキングペーパーだった。
前の単位では、何を差し出すと言うのかを扱った。ここでは、その言葉が外でどう受け取られているのか——評判の側を扱う。
評判は、いまや数字の形をしている。 星が四つか、四つ半か。そして、その星について、いちばんよく引かれる数字がこれである——星が1つ上がると売上が5〜9%増える。 この数字は本物である。落ちているのは、その先に書いてあったほうである。
5〜9%は本物だった。落ちているのは条件のほう
出どころは、ある大学のワーキングペーパーである(2011年公開・2016年改訂)。査読誌の論文ではない。 ここは先に言っておく。中身はしっかりしていて、あるレビューサイトの評点と、州の歳入当局が持っている飲食店の売上のデータを突き合わせ、サイトが平均点を四捨五入して表示することを利用して、その境目の前後を比べるという設計になっている。
その論文が挙げる三つの発見は、こうである。①星1つの上昇は5〜9%の売上増につながる。②この効果は独立店によって駆動されており、系列に属する店では評点は売上に影響しない。③系列店は、このサイトの浸透とともに市場占有率を落としてきた。(原文はサイトの社名を挙げて書かれているため、ここでは日本語に移して引く。)
(1)だけが引かれ、(2)が落ちる。 本文にはもっと素っ気なく書かれている。
> “the impact is statistically insignificant and close to zero for chains.”(系列店については、影響は統計的に有意でなく、ゼロに近い)
なぜ独立店だけに効くのか。 論文の説明は単純である。系列に属する店については、客はすでに別の経路で情報を持っている。 評点が足しているのは、もともと情報が無かった相手についての情報である。評判の数字が効くのは、それ以外に手がかりが無いときだけだった。
平均点は、何と一致しているのか
もっと手前の問いがある。その平均点は、そもそも品質と一致しているのか。
**2015年に *Journal of Consumer Research* 42巻6号へ出た論文が、これを正面から測った。120の製品分類にまたがる1,272の製品**について、利用者の平均評点と、独立の検査機関が付けた客観的な品質の点数を突き合わせている。抄録の書き出しがこうである。
> “This research documents a substantial disconnect between the objective quality information that online user ratings actually convey and the extent to which consumers trust them as indicators of objective quality.”(この研究は、オンラインの利用者評点が実際に伝えている客観的な品質の情報と、消費者がそれを客観的品質の指標としてどれだけ信頼しているかとのあいだの、相当な断絶を記録している)
四つの発見が並ぶ。 平均評点は、①検査機関の点数と収束しない ②しばしば標本が不十分な数に基づいていて、情報量が限られる ③中古市場での再販価格を予測しない ④検査機関の点数を統制しても、高価な製品と上位銘柄のほうが高い。
そして、それでも消費者は平均点を重く見る。
> “They also fail to moderate their reliance on the average user rating as a function of sample size sufficiency.”(消費者は、標本の大きさが十分かどうかに応じて、平均評点への依存を加減することもしない)
論文はこの状態を、“illusion of validity”(妥当性の錯覚)と呼んでいる。
分布が、Jの字をしている
平均点が品質と一致しない理由の一つは、そもそも平均を取ってよい形の分布になっていないことである。
**2009年に *Communications of the ACM* 52巻10号へ出た報告は、ある大規模な販売サイトの2005年2月から7月のデータで、書籍・映像・動画の三分類の評点の分布を調べた。四つ星以上の割合は、それぞれ78%・73%・72%。 分布の形は、五つ星が山になり、一つ星が小さな山になり、そのあいだがほとんど無い——Jの字**である。
この報告の指摘が効く。
> “The average is statistically meaningful only when it is based on a unimodal distribution, or when it is based on a symmetric bimodal distribution.”(平均が統計的に意味を持つのは、単峰の分布に基づくときか、対称な二峰の分布に基づくときだけである)
> “since product review systems have an asymmetric bimodal (J-shaped) distribution, the average is a poor proxy of product quality”(レビューの仕組みは非対称な二峰、すなわちJ字の分布を持つので、平均は製品の品質の代理としては貧弱である)
**この形をどう扱うかは、古くからの論点である。2003年に *Management Science* 49巻10号へ出た総説は、オンラインの評判の仕組みが伝統的な口コミの網とどこが違うかを整理したもので、効果推定ではなく、設計・評価・利用にまつわる論点の概観である。この分野は、指標の意味を確かめる前に、指標が広まった。**
なぜJの字になるのか。 報告が挙げるのは書く人の偏りである。強く良かった人と、強く悪かった人だけが書く。 ふつうだった人は書かない。平均点は、製品の性質ではなく、書いた人の選ばれ方を映している。
時間・変化:一つ星のほうが、五つ星より効いていた
**2006年に *Journal of Marketing Research* 43巻3号へ出た研究は、二つの販売サイトのあいだで書籍の相対的な**売上を比べたものである。四つの発見のうち、二つがここで効く。
> “(1) reviews are overwhelmingly positive at both sites”(レビューはどちらのサイトでも圧倒的に好意的である)
> “(3) for most samples in the study, the impact of one-star reviews is greater than the impact of five-star reviews”(この研究のほとんどの標本で、一つ星のレビューの影響は五つ星のレビューの影響より大きい)
星の数を平均するという操作は、この非対称を消してしまう。 一つ星が二つと五つ星が二つある店と、三つ星が四つある店は、平均では同じである。受け取られ方は、同じではない。
同じ研究は、利用者がまとめの数字だけに頼らず、本文を読んでいるという証拠も挙げている。平均点は、読者がいちばん見ている場所ではないかもしれない。
作られたレビューには、経済学がある
もう一段ある。評点は、書かれるだけでなく、作られる。
**2016年に *Management Science* 62巻12号へ出た研究は、あるレビューサイトが自ら「疑わしい」として濾過したレビューを手がかりに、偽レビューの経済的な誘因を調べた。四つの発見が並ぶ。①飲食店のレビューのおよそ16%が濾過されている(濾過されたものは、他より極端に良いか極端に悪い)②評判が弱いとき——レビューが少ないとき、最近悪い評価を受けたとき——ほど偽レビューを出しやすい ③系列店は、このサイトから受ける恩恵が小さく、偽レビューを出しにくい ④競争が激しくなると、好意的でない偽レビューを受け取りやすくなる。**
**2014年に *American Economic Review* 104巻8号へ出た研究は、別の角度から同じことを見ている。片方は宿泊した客だけが書けるサイト、もう片方は誰でも書けるサイト。 同じ宿について二つのサイトのレビューを比べると、偽レビューを出す誘因が高いと考えられる宿の隣にある宿は、誰でも書けるサイトのほうで、より否定的なレビューを受けていた。**
誘因の大きさで、レビューの分布が動く。 評点は、店の質だけでなく、その店が置かれている競争の状況も映している。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、平均点を、品質の代わりとして読むことである。1,272の製品で測ると、検査機関の点数とは収束せず、再販価格も予測しなかった。それでも人は重く見る。妥当性の錯覚と呼ばれている。
もう一つ。「星が1つ上がると5〜9%」を、自分に当てはまる数字として読むこと。 その効果は独立店で見つかり、系列店ではゼロに近かった。自分がどちらに近いか——客が他に手がかりを持っているかどうか——で、効き方は変わる。
助けるのは、平均ではなく分布を見るという一手である。四つ星が二十件なのか、五つ星十件と一つ星十件なのか。同じ平均でも、起きていることが違う。 そして件数が少ないときは、平均そのものが動きやすい。
標本の偏りを断っておく。ここで引いた研究は、北米の飲食・宿泊・書籍・消費財を対象にしている。 企業間の取引や、専門的な役務の評判が、同じように動くかは確かめられていない。
最初の一歩は5分。自分に関わる評点を1つ選び、平均ではなく、星ごとの件数を書き写す。 自分の商いに評点が無ければ、自分がよく買っている商品の評点で行えばよい。 五つ星と一つ星の件数を並べて書くと、平均が何を隠していたかが手元で見える。
次の単位は 245「需要創出・認知拡大力」——受け取られ方の話から、そもそも知ってもらう話へ進む。そして広告の効果は、測ること自体が桁違いに難しいという結果になる。
- 「星1つで売上5〜9%」の出どころは、ある大学のワーキングペーパー(2011年公開・2016年改訂)であり、査読誌の論文ではない。あるレビューサイトの評点と州の歳入当局が持つ飲食店の売上を突き合わせ、サイトが平均点を四捨五入して表示することを利用した設計になっている。
- 同じ論文の同じ一文の後半に、この効果は独立店によって駆動されており系列に属する店では評点は売上に影響しない、と書かれている。本文では、系列店については影響は統計的に有意でなくゼロに近い、と言い直されている。
- 2015年のJournal of Consumer Research 42巻6号は、120分類・1,272製品で、利用者の平均評点が検査機関の品質の点数と収束せず、しばしば不十分な標本に基づき、再販価格を予測せず、検査機関の点数を統制しても高価な製品と上位銘柄で高く出ることを示した。
- 同じ研究によれば、消費者は品質の推測や購買意図を形づくるとき、価格や評点の件数といった他の手がかりに比べて平均評点を重く見る。しかも標本の大きさが十分かどうかに応じて依存を加減することもしない。原典はこれを妥当性の錯覚と呼んでいる。
- 2009年のCommunications of the ACM 52巻10号は、ある大規模販売サイトの2005年2月から7月のデータで、四つ星以上の割合が書籍78%・映像73%・動画72%であり、分布が非対称な二峰すなわちJ字であることを示した。平均が意味を持つのは単峰か対称な二峰のときだけであり、J字では平均は品質の代理として貧弱である。
- 2006年のJournal of Marketing Research 43巻3号は、レビューがどちらのサイトでも圧倒的に好意的であること、そして研究のほとんどの標本で一つ星のレビューの影響が五つ星のレビューの影響より大きいことを報告した。平均という操作は、この非対称を消してしまう。
- 2016年のManagement Science 62巻12号は、あるレビューサイトが疑わしいとして濾過した飲食店のレビューがおよそ16%にのぼり、評判が弱い店ほど偽レビューを出しやすく、系列店は出しにくく、競争が激しくなると好意的でない偽レビューを受け取りやすくなることを示した。
| よくある誤解 | 実際のところ |
|---|---|
| 星が1つ上がると、売上が5〜9%増える | その推定は本物だが、同じ一文の後半に、この効果は独立店によって駆動されており系列に属する店では評点は売上に影響しない、と書かれている。本文では、系列店については影響は統計的に有意でなくゼロに近い、と言い直されている。評点が足しているのは、もともと情報が無かった相手についての情報である。しかもこの論文は査読誌ではなく、大学のワーキングペーパーである。 |
| レビューの平均点は、その商品の品質を表している | 120分類・1,272製品で測ると、利用者の平均評点は独立の検査機関の点数と収束せず、しばしば不十分な数の標本に基づき、中古市場の再販価格を予測せず、検査機関の点数を統制しても高価な製品と上位銘柄のほうが高く出た。それでも消費者は平均点を重く見て、標本の大きさに応じて依存を加減することもしない。原典はこれを妥当性の錯覚と呼んでいる。 |
| 平均点が同じなら、受け取られ方も同じである | レビューの分布は非対称な二峰、すなわちJの字をしている。ある大規模販売サイトの2005年のデータでは、四つ星以上の割合は書籍78%・映像73%・動画72%だった。平均が統計的に意味を持つのは単峰か対称な二峰の分布のときだけであり、J字の分布では平均は品質の代理として貧弱である。さらに、ほとんどの標本で一つ星の影響は五つ星の影響より大きかった。 |
星の数が便利なのは、品質を表しているからではなく、一つの数に潰れているからである。潰れているから比べられ、比べられるから並べられ、並べられるから信じられる。三十年ぶんの研究が確かめたのは、その数が、書いた人の選ばれ方と、書く誘因の強さを、かなり正確に映しているということだった。
Q1. 「星1つで売上5〜9%」の原典は、その同じ一文の後半で、この効果は ____ 店によって駆動されており、____ に属する店では評点は売上に影響しないと書いている。本文では、後者について影響は統計的に ____ でなく ____ に近いと言い直されている。穴埋め
Q2. 120分類・1,272製品で利用者の平均評点を調べた研究が報告したのは、次のうちどれか。選択
Q3. レビューの分布がJの字をしていると、平均を使うことにどんな問題が生じるか。原典の言い方に沿って1文で書け。一問一答
Q4. 偽レビューの経済的な誘因を調べた研究は、どんな店ほど偽レビューを出しやすいと報告したか。1文で書け。一問一答
Q5. 二つの販売サイトで書籍の相対売上を調べた研究によれば、レビューはどちらのサイトでも圧倒的に ____ であり、研究のほとんどの標本で ____ つ星のレビューの影響のほうが ____ つ星のレビューの影響より ____ かった。穴埋め
紙かメモアプリを開く。評点が付いているものを1つ選ぶ(自分の商いに評点が付いていればそれでよいし、無ければ自分がよく買っている商品や、よく行く店の評点でよい)。表示されている平均点を書く。次に、星5から星1までの件数を、そのまま五つ書き写す。件数が表示されていない場合は「表示されていない」と書く。最後に、五つ星の件数と一つ星の件数を並べて見て、その平均点が何を隠していたかを1行で書く。誰にも見せない。書き込みもしない。読むだけで完結させる。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Luca M. (2011, rev. 2016) 'Reviews, Reputation, and Revenue: The Case of Yelp.com', Harvard Business School Working Paper 12-016(ワーキングペーパー。査読誌ではない。2026年8月に本文PDFを取得して確認) — www.hbs.edu
- de Langhe B., Fernbach P.M., Lichtenstein D.R. (2015) 'Navigating by the Stars: Investigating the Actual and Perceived Validity of Online User Ratings', Journal of Consumer Research 42(6):817-833 — doi.org
- Hu N., Zhang J., Pavlou P.A. (2009) 'Overcoming the J-shaped distribution of product reviews', Communications of the ACM 52(10):144-147 — doi.org
- Chevalier J.A., Mayzlin D. (2006) 'The Effect of Word of Mouth on Sales: Online Book Reviews', Journal of Marketing Research 43(3):345-354 — doi.org
- Luca M., Zervas G. (2016) 'Fake It Till You Make It: Reputation, Competition, and Yelp Review Fraud', Management Science 62(12):3412-3427 — doi.org
- Mayzlin D., Dover Y., Chevalier J. (2014) 'Promotional Reviews: An Empirical Investigation of Online Review Manipulation', American Economic Review 104(8):2421-2455 — doi.org
- Dellarocas C. (2003) 'The Digitization of Word of Mouth: Promise and Challenges of Online Feedback Mechanisms', Management Science 49(10):1407-1424 — doi.org