解約は予測できる。ただし「危険度がいちばん高い相手に手を打つのが最適か」を調べた研究は、無かった
画面には危険度の点数があり、赤くなった相手に連絡する。皮肉なことに、解約の危険がもっとも高い顧客を特定する予測モデルについては膨大な文献があるのに、それらの個人を対象にすることが本当に最適かどうかを調べた研究は無い、と2018年の論文は書き出している。そして二つの現場実験の答えは、必ずしも最善ではない、だった。
前の単位では、使い続けてもらうという話を扱った。ここでは、離れそうな相手を見つけて手を打つ——継続を保証しようとする段を扱う。
画面には点数がある。 健全さの点数、危険度の点数。赤くなった相手に連絡する。 ここでは、その点数が何をどこまで当てているのかを見る。結論から言うと、当たる。当たるが、当てた相手に手を打つのが正しいとは限らない。
手法を競わせた大会があった
**2006年に *Journal of Marketing Research* 43巻2号へ出た論文は、変わった作りをしている。公開されたデータを誰でも取ってこられるようにして、研究者と実務家の双方にモデルを作らせ、二つの検証用データベースで予測を提出させた——大会である。**
そこから出た発見が三つ。一つ目。
> “First, methods do matter. The differences observed in predictive accuracy across submissions could change the profitability of a churn management campaign by hundreds of thousands of dollars.”(第一に、方法は重要である。提出物のあいだで観測された予測精度の違いは、解約管理の施策の収益性を数十万ドル動かしうる)
二つ目。 モデルには持続力があり、推定に使ったデータの三か月後に作られたデータベースで予測しても、性能はほとんど落ちなかった。
三つ目。 研究者たちは、推定の技法、変数の選び方、変数の数、各段階に割いた時間といった変数で特徴づけられる、多様な「進め方」を使っており、その進め方のあいだに重要な性能の違いがあった。
精度の差が、顧客の側からではなく、モデルを作る手続きの側から出ている。 これがこの単位の一つ目の値切りである。
同じデータである。 顧客も、期間も、変数として使える材料も同じ。それでも出てくる予測は別々で、その差が施策の収益性を数十万ドル動かす。 ということは、「うちの解約予測は精度が◯%です」という報告を聞いたとき、その%が答えているのは顧客のことではなく、作った人の手続きのことでもある。
そしてこの点は、外から見えない。 出てくるのは点数だけである。推定の技法も、投入した変数の数も、どれだけ時間をかけたかも、画面には出てこない。
「持続力がある」の四年後に、「持続力は低い」が出た
**2010年に *Journal of Interactive Marketing* 24巻3号へ出た論文は、まさにその持続力を主題にしている。持続力を「推定期間のあとの複数の期における予測性能」と定義し**、二つの業種——ある通信事業と、ある保険の市場——の顧客データで、四つの方法を比べた。
結論の一文が、四年前と食い違う。
> “However, for all methods the staying power is rather low, as the predictive performance deteriorates considerably within a few periods after the estimation period.”(しかしすべての方法について持続力はかなり低く、予測性能は推定期間の数期後にはかなり劣化する)
なぜか。 論文は二つ挙げている。推定される係数が時間とともに変わること。そして、有意になる変数が期によって違うこと。
「同じモデルを使い続けられる期間」は、業種とデータによって違う。 2006年の大会では三か月後でもほとんど落ちなかった。2010年の二業種では数期で劣化した。どちらも査読を通っている。 結論は、モデルは定期的に作り直すべきだ、というところに落ちる。
この棚の通奏低音の二つ目が、ここでも顔を出す。 「解約予測モデルの精度」という同じ言葉で、測っている期間も、業種も、劣化の定義も、別のものを数えている。
精度は上げられる。ただし上げ方は、統計の側にある
**2006年に同じ *Journal of Marketing Research* 43巻2号へ出たもう一本は、分類木を束ねて平均する手法を解約予測に応用し、予測の精度が有意に改善したと報告している。そして、大規模なデータから稀な事象を予測するときには、標本を釣り合わせる取り方を使うべきだが、それには適切な偏りの補正が要る**とも書いている。
精度は上げられる。上げ方は、顧客の理解ではなく、統計の手続きの側にある。
この区別は、実務では見えにくい。 精度が上がったと聞けば、顧客のことが分かってきたように聞こえる。実際に起きているのは、稀な事象を扱うときの標本の取り方と、その偏りの補正が、うまくいったということである。 二つは別のことである。
そして2012年には、そもそも精度で評価するのをやめようという提案も出ている。 *European Journal of Operational Research* 218巻1号は、通信部門の解約予測を利益を軸にしたデータ採掘の問題として見直すことを提案した。当たった件数ではなく、施策の利益で評価する。 評価軸そのものを動かす提案が、この時期に現れている。
危険度の高い相手に手を打つのが、正しいとは限らない
ここまでは「どれだけ当たるか」の話である。この単位でいちばん重要なのは、その次の問いのほうである——当てた相手に手を打つのが、正しいのか。
**2018年に *Journal of Marketing Research* 55巻1号へ出た論文**が、そこを実験で調べた。抄録の書き出しがこうである。
> “While there is a vast literature on developing churn prediction models that identify customers at the highest risk of churning, no research has investigated whether it is indeed optimal to target those individuals.”(解約の危険がもっとも高い顧客を特定する予測モデルの開発については膨大な文献があるが、それらの個人を対象にすることが本当に最適かどうかを調べた研究は無い)
二つの現場実験と機械学習を組み合わせて確かめた結果が、これである。
> “customers identified as having the highest risk of churning are not necessarily the best targets for proactive churn programs.”(解約の危険がもっとも高いと特定された顧客が、先手を打つ解約防止の施策の対象として必ずしも最善ではない)
そして、その理由がこう書かれている。
> “retention programs are sometimes futile not because firms offer the wrong incentives but because they do not apply the right targeting rules.”(維持のための施策がときに無駄なのは、企業が誤った誘因を提示しているからではなく、正しい対象の選び方を適用していないからである)
打ち手が悪いのではなく、当てる先が違う。 論文の推奨は明快である——危険度ではなく、働きかけへの反応の違いで対象を選べ。 その選び方のほうが、危険度で選ぶ標準的なやり方より、実証的に有意に効果が高かった。
時間・変化:総説が「もう一度整理する」段階に戻っている
**2017年に *Customer Needs and Solutions* 5巻1・2合併号へ出た総説は、顧客維持の管理について、論点を整理し直し、今後の方向を示すという形をとっている。予測モデルの精度をさらに上げる、という形ではない。**
この分野の順番を並べると、こうなる。 **2006年に大会が開かれて手法の差が測られ、同じ年に精度を上げる統計手法が出て、2010年に持続力の低さが報告され、2012年に *European Journal of Operational Research* 218巻1号で利益を軸にした解約予測の見直しが提案され、2017年に総説が論点の整理に戻り、2018年に「当てた相手に打つのが正しいとは限らない」が出た。**
十二年かけて動いたのは、精度ではなく、問いのほうである。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、点数が赤くなった相手から順に連絡することである。それが最善だと確かめた研究は無い、と2018年の論文が書いている。 そして二つの現場実験で、そうではなかった。
もう一つ。モデルを一度作って使い続けること。 係数は時間とともに変わり、有意になる変数も期によって変わる。「去年当たっていた点数」は、今年も当たるとは限らない。
この単位では、顧客を実験の対象にする課題は作らない。 誰に連絡するかを変えて反応を見る、という形の課題は書かない。書けるのは、自分がいまどういう順番で連絡しているかを確かめることまでである。
助けるのは、「危険そうな順」と「働きかけが効きそうな順」は別の並びだ、と知っておくことである。この二つが同じだと思い込んでいるあいだ、施策は危険度の高い順に配られ続ける。
標本の偏りを断っておく。ここで引いた研究は、契約が続く形の商い——通信・保険・購読——を対象にしたものが中心である。 一回きりの取引や、来店が中心の商いでは、そもそも「解約」という事象が定義できない。定義できないところに、解約率という数字だけを持ち込まないこと。
最初の一歩は5分。自分が「この相手は離れそうだ」と感じたときに、実際にどういう順番で動いているかを、記憶ではなく手元の記録から三件たどる。 順番の基準が書けなければ「基準は無い」と書く。基準が無いこと自体は悪くない。無い基準を、点数があるから有ると思い込むことのほうが厄介である。
次の単位は 252「顧客期待値管理力」——離れる離れないの手前にある、期待という言葉。そこで、期待を測る方法そのものに向けられた批判を見る。
- 2006年のJournal of Marketing Research 43巻2号は、公開データを誰でも取得できるようにして研究者と実務家にモデルを作らせ、二つの検証用データベースで予測を提出させる大会形式の研究である。方法は重要であり、提出物のあいだの予測精度の違いは解約管理の施策の収益性を数十万ドル動かしうる、と報告した。
- 同じ研究は、モデルには持続力があり、推定に使ったデータの三か月後に作られたデータベースで予測しても性能はほとんど落ちないとも報告している。さらに、推定の技法・変数の選び方・変数の数・各段階に割いた時間といった進め方の違いが、性能の重要な差につながっていた。
- 2010年のJournal of Interactive Marketing 24巻3号は、持続力を推定期間のあとの複数の期における予測性能と定義し、通信と保険の二業種で四つの方法を比べた。すべての方法について持続力はかなり低く、予測性能は推定期間の数期後にはかなり劣化する。
- その理由として、推定される係数が時間とともに変わることと、有意になる変数が期によって違うことが挙げられている。結論は、解約モデルを定期的に作り直すべきだ、というものである。
- 2006年の同誌のもう一本は、分類木を束ねて平均する手法を解約予測に応用して予測精度を有意に改善した。大規模なデータから稀な事象を予測するときは標本を釣り合わせる取り方を使うべきだが、それには適切な偏りの補正が要るとも述べている。
- 2018年のJournal of Marketing Research 55巻1号は、解約の危険がもっとも高い顧客を対象にすることが最適かを調べた研究が無いと指摘し、二つの現場実験と機械学習で、危険がもっとも高い顧客が先手を打つ施策の対象として必ずしも最善ではないことを示した。
- 同じ論文は、維持の施策がときに無駄なのは誤った誘因を提示しているからではなく、正しい対象の選び方を適用していないからだと述べ、危険度ではなく働きかけへの反応の違いで対象を選ぶほうが、実証的に有意に効果が高いと報告している。
| よくある誤解 | 実際のところ |
|---|---|
| 解約の危険度が高い顧客から順に手を打てば、維持の施策は効く | 2018年のJournal of Marketing Research 55巻1号は、解約の危険がもっとも高い顧客を対象にすることが本当に最適かを調べた研究が無いと指摘し、二つの現場実験と機械学習で確かめた。結果は、危険がもっとも高いと特定された顧客が、先手を打つ施策の対象として必ずしも最善ではない、である。施策が無駄になるのは誤った誘因を提示しているからではなく、正しい対象の選び方を適用していないからだと述べている。 |
| 予測モデルの精度は、顧客のデータの質で決まる | 2006年のJournal of Marketing Researchの大会形式の研究は、同じ公開データから作られた提出物のあいだで観測された予測精度の違いが、解約管理の施策の収益性を数十万ドル動かしうると報告した。違いは、推定の技法・変数の選び方・変数の数・各段階に割いた時間といった、モデルを作る手続きの側の変数から出ていた。 |
| 一度うまく当たるモデルができれば、しばらくはそのまま使える | 2006年の大会では、推定データの三か月後に作られたデータベースでも性能はほとんど落ちなかった。しかし2010年のJournal of Interactive Marketing 24巻3号は、二つの業種で四つの方法を比べ、すべての方法について持続力はかなり低く、予測性能は推定期間の数期後にはかなり劣化すると報告した。理由は、係数が時間とともに変わることと、有意になる変数が期によって違うことである。 |
危険度の点数が安心なのは、外れないからではなく、外れたことが分からないからである。連絡した相手が残れば施策のおかげになり、去れば手遅れだったことになる。連絡しなかった相手がどうなったかは、どの画面にも出てこない。
Q1. 2018年の論文が「調べた研究が無い」と指摘したのは、どんな問いか。1文で書け。一問一答
Q2. 2018年の二つの現場実験の結果として報告されたのはどれか。選択
Q3. 2006年の大会形式の研究では、提出物のあいだの予測精度の違いが、解約管理の施策の ____ を ____ 万ドル動かしうると報告された。その違いは、推定の ____ や、変数の選び方や数、各段階に割いた ____ から出ていた。穴埋め
Q4. 2010年に二業種で持続力を調べた研究の結論と、その理由二つを書け。一問一答
Q5. 分類木を ____ て平均する手法を解約予測に応用した研究は、予測精度が ____ に改善したと報告した。ただし、大規模なデータから ____ な事象を予測する際には標本を釣り合わせる取り方が推奨されるが、それには適切な ____ の補正が必要である。穴埋め
紙かメモアプリを開く。自分が「この相手は離れそうだ」と感じたことのある件を、手元の記録(やりとりの履歴、日誌、送信済みの控え、伝票)から三件たどる。相手の実名や特定できる情報は書かない。各件について、そう感じたきっかけを一語で、そのあと自分が最初に取った行動を一語で書く。次に、三件を並べて、動く順番に共通の基準があるかどうかを一言で書く。基準が書けなければ「基準は無い」と書く。誰にも尋ねない。新たに相手を調べに行かない。いま組織に属していない場合は、続いていた関係が途切れそうだと感じたときの記録で行えばよい。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Neslin S.A., Gupta S., Kamakura W., Lu J., Mason C.H. (2006) 'Defection Detection: Measuring and Understanding the Predictive Accuracy of Customer Churn Models', Journal of Marketing Research 43(2):204-211 — doi.org
- Ascarza E. (2018) 'Retention Futility: Targeting High-Risk Customers Might be Ineffective', Journal of Marketing Research 55(1):80-98 — doi.org
- Risselada H., Verhoef P.C., Bijmolt T.H.A. (2010) 'Staying Power of Churn Prediction Models', Journal of Interactive Marketing 24(3):198-208 — doi.org
- Lemmens A., Croux C. (2006) 'Bagging and Boosting Classification Trees to Predict Churn', Journal of Marketing Research 43(2):276-286 — doi.org
- Verbeke W., Dejaeger K., Martens D., Hur J., Baesens B. (2012) 'New insights into churn prediction in the telecommunication sector: A profit driven data mining approach', European Journal of Operational Research 218(1):211-229 — doi.org
- Ascarza E., Neslin S.A., Netzer O., Anderson Z., Fader P.S., Gupta S. (2017) 'In Pursuit of Enhanced Customer Retention Management: Review, Key Issues, and Future Directions', Customer Needs and Solutions 5(1-2):65-81 — doi.org