「AIで需要は当たる」の実測は、単純な目安に勝てた人が7.5%だった
需要予測の話は、たいてい「機械学習を入れれば当たる」から始まる。皮肉なことに、同じデータで手法を競わせた公開の実測では、機械学習が上位を占めた回ですら、いちばん強い単純な目安を上回れた参加チームはわずか7.5%だった。残りは、素朴な計算に負けたのである。
この棚は、誰に向けて書かれているか
想定している読者は、購買部門の人に限らない。いま、モノやサービスを仕入れて、切らさずに回している人、あるいはこれから回す人である。
一人で発注も在庫も見ている店主かもしれないし、製造の小さなチームで兼務している人かもしれない。飲食や小売の現場で棚を埋めている人、受託で他社の調達を担う人、非営利で物資を回す人もいる。だからこの棚は「購買担当は」「SCM(供給網の管理)は」で主語を立てない。 決裁権があるとも、値段を交渉できる立場だとも、複数の会社から選んで買えるとも、システムを入れる権限があるとも想定しない。製造か小売かサービスか、法人向けか個人向けかで読者を分けない。仕入れの規模で優劣を付けない。今回が初めての人もいる。
そして、使える手は人によって大きく違う。商圏、単価、在庫を置く場所、取引先との力関係、繁忙期、業界の商習慣。これらは本人の能力とは別の次元で、取れる選択肢を決めている。この棚は、切らしてしまうことを、本人の熱意や工夫の不足として描かない。
一つだけ、先に断っておく。仕入先は「相手」であって「管理対象」ではない。 供給は相手のある営みで、こちらにとっての最適が、相手にとっての最適とはかぎらない。この棚は、買い叩く話には寄せない。
だからこの棚は、16の問いそれぞれについて言うことを3つに絞る——その問いは何を指しているのか。どこまで効くと確かめられているのか。その範囲の外で何が起きるか。これをやれば切らさない、の棚にはしない。 読者の像を書くのは、この単位だけである。
この棚の地図——四つの段を、下から積む
この棚は並列に並んだ道具箱ではない。下の段が上の段を支える、積み上げの構造である。まず需給と在庫の土台を置き、その上に仕入先との関係を積み、さらに網の可視化と調整を積み、最後に統制と強靭化を載せる。
①青 305〜308|需給と在庫の基礎——需要を見積もる、在庫の量を決める、切らさない、余らせない。②緑 309〜312|仕入先との関係——選ぶ、協働する、費用を見る、分散する。③橙 313〜316|網の可視化と調整——見えるようにする、遅れに気づく、危うさを測る、需給を合わせる。④桃 317〜320|統制と強靭化——不正を防ぐ、責任を持つ、発注と検収を回す、途絶に耐える。
下の段が危ういまま上を積むと、上の段はぐらつく。 土台のこの段——需要と在庫——から始める。
「需要予測はAIで当たる」の出どころを追う
需要予測とは、過去の販売実績から、これから必要になる量を見積もることである。この話には、たいてい一つの売り文句が付いてくる——機械学習(データから規則を見つける計算手法)を入れれば予測は当たる、という形である。そこでこの単位は、手法を並べる前に、その売り文句を実測で確かめた場があることから始める。
その場がM競技である。同じ時系列データを大勢に配り、多数の予測手法を同じ土俵で競わせる公開の実測で、1980年代から続いている。誰が何の手法を使ったかが記録され、優劣が同じ物差しで並ぶ。手法を売る側の宣伝ではなく、同じデータの上で結果が出る——だから、売り文句を突き合わせる場として使える。
同じデータで競わせると、単純な方法が強かった
**米国とギリシャの研究者が2018年に *PLOS ONE* 13巻3号へ出した論文が、この点を正面から測っている。M3競技で使われた月次1,045系列を対象に、よく使われる機械学習の手法と、伝統的な統計手法8種を突き合わせた。結論はこうだ——“the former are dominated across both accuracy measures used and for all forecasting horizons examined.”(機械学習のほうが、用いた二つの精度指標でも、調べたすべての予測期間でも、統計手法に劣った)。そして——“their computational requirements are considerably greater than those of statistical methods.”**(計算に要する資源は統計手法よりかなり大きい)。
これは突発ではない。2000年に報告されたM3競技の結論そのものが、複雑で高度な手法が、単純な手法より正確とはかぎらないというものだった。単純さが複雑さに劣らない、という系譜のうえに、2018年の比較は載っている。
同じ年のM4競技(*International Journal of Forecasting* 34巻4号)では、上位を占めたのは単一の手法ではなく、複数の手法を混ぜた「組み合わせ」だった。当たったのは、賢い一手ではなく、混ぜ方だったのである。
機械学習が勝った回ですら、大半は単純な目安に負けた
ところが2020年のM5競技(同誌2022年掲載)では、機械学習の手法(勾配ブースティング木)が上位を占めた。「やはり機械学習だ」と読みたくなる。だが数字を見ると別の絵が出る。参加チームのうち、素朴な目安を上回れたのは48.4%、季節を考えた素朴な目安を上回れたのは35.8%、そしてこの競技でいちばん強かった単純な指数平滑の目安(ES bu)を上回れたのは、わずか7.5%だった。論文はこう書く——“the majority of the teams being outperformed by more than 13% by ES bu.”(大半のチームは、その単純な目安に13%以上の差をつけられて負けた)。
機械学習を使える層が大勢集まってなお、その多くが、単純な目安に負けた。 勝った上位5チームだけが20%を超える改善を出した。「機械学習を入れれば当たる」ではなく、「何と何を組み合わせ、どの目安と比べるか」を設計できた少数だけが、目安を超えた。
「当たる」は、何を誤差と数えるかで決まる
ここで、この棚が16回くり返す見方を、正面から書いておく。供給の「最適」は、何を費用と数え、何を数えないかの決めの産物である。
M5の勝敗も、どの誤差を「精度」と呼ぶかで動いた。予測の当たり外れは、誤差の測り方(何を誤差と数えるか)を決めて初めて順位になる。2006年に *International Journal of Forecasting* 22巻4号へ出た論文は、予測精度の指標そのものを選び直す議論で、測り方が違えば、同じ予測でも「良い」か「悪い」かが入れ替わることを扱っている。数式や機械学習の見た目の厳密さは、入力と指標の恣意性を隠す。
しかも、需要予測が最適化しているのは、目的関数に入れた費用だけである。切らしたときの費用も、急いで切り替えたときの費用も、無理を頼んで仕入先との関係を痛めた費用も、たいていは指標に入っていない。入っていない費用は、どんなに精度を上げても最適化されない。 需要予測でこの先ずっと問うべきは、手法名ではなく——何を必要量と数え、外したときの費用を何と数えたかである。
そしてもう一つ、この棚の最後(320)で回収する見方がある——止まらなかった供給網の話は、止まらなかった会社が書いている。 いまはこれだけ置いておく。
時間・変化:M競技が40年で示したもの
順番はこうである。2000年、M3競技の報告は、複雑な手法が単純な手法に勝てないという系譜を確かめた。2018年、M4競技で上位を占めたのは組み合わせで、純粋な機械学習は伸びなかった。同じ年、統計手法が機械学習を上回るという直接の比較も出た。2022年に報告されたM5で、ようやく機械学習が上位に立ったが、参加者の大半は単純な目安に負けたままだった。20年で、手法は派手になった。当たりやすさは、比べる目安と混ぜ方しだいという結論は、ほとんど動いていない。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、手法名を成果の保証と取り違えることである。機械学習と聞くと当たる気がするが、M競技が繰り返し示したのは、単純な目安を超えるのは容易でないということだった。
標本の偏りを断っておく。ここまでの数字は、公開コンペに集まった時系列と、それに参加できた人たちのものである。 あなたの商品の需要が、同じ振る舞いをするとはかぎらない。M競技の系列は主に定期的な販売データで、単発の受注や、初めて扱う品目、季節の読めない新商品は、この土俵に乗りにくい。
助けるのは、当てにいく前に「外したときに何が起きるか」を書くという一手である。切らしたときの費用も、余らせたときの費用も、たいてい予測の精度指標には入っていない。この非対称を書いておくと、精度を1%上げる工夫より、外れる向きを片側に寄せる工夫のほうが効く場面が見えてくる。 どの手法を選ぶかは、そのあとの話である。
最初の一歩は5分。いま自分が「だいたい何個くらい」と見積もっている品目を3つ書き出し、それぞれ「何を根拠にその数にしたか」を1行で添える。 そして、外したときに困るのはどちらか(切らすほうか、余らせるほうか)を一言だけ書く。 当てることではなく、外し方の非対称に気づくことが、今日の収穫である。
次の単位は 306「在庫を最適化するには?」——見積もった需要をもとに、一度にどれだけ持つのかという、量の決め方へ進む。
- この棚の読者は、モノやサービスを仕入れて切らさず回している人、あるいはこれから回す人である。購買部門に限らず、一人で発注も在庫も見る店主、製造小規模チームの兼務者、飲食・小売の現場、受託で他社の調達を担う人、非営利で物資を回す人を含む。決裁権・価格交渉力・複数社購買・システム導入権限を前提にせず、切らすことを本人の熱意や工夫の不足として描かない。仕入先は相手であって管理対象ではなく、買い叩く話には寄せない。16の問いそれぞれについて言うことは3つ——何を指すのか、どこまで効くと確かめられているのか、その範囲の外で何が起きるか
- この棚は並列の道具箱ではなく、下の段が上の段を支える積み上げである。①青305〜308 需給と在庫の基礎、②緑309〜312 仕入先との関係、③橙313〜316 網の可視化と調整、④桃317〜320 統制と強靭化。下の段が危ういまま上を積むと上の段はぐらつくため、土台の需要と在庫の段から始める
- 供給の最適は、何を費用と数え、何を数えないかの決めの産物である。EOQも安全在庫もS&OPも、目的関数に入れた費用だけを最適化し、欠品費用・切替費用・関係の毀損はたいてい数えられていない。数式や機械学習の見た目の厳密さが、入力と指標の恣意性を隠す。これがこの棚が16回くり返す見方である
- M競技は、同じ時系列データを大勢に配り多数の予測手法を同じ土俵で競わせる公開の実測である。2018年にPLOS ONE 13巻3号へ出た論文は、M3競技の月次1,045系列で、よく使われる機械学習の手法が伝統的な統計手法8種に、二つの精度指標でも全予測期間でも劣ったと報告した。計算資源は統計手法よりかなり大きいとも書いている
- 2018年のM4競技で上位を占めたのは単一の手法ではなく複数手法の組み合わせだった。2020年のM5競技(2022年報告)では機械学習の手法が上位に立ったが、素朴な目安を上回れたのは参加チームの48.4%、季節を考えた素朴な目安では35.8%、いちばん強い単純な指数平滑の目安(ES bu)を上回れたのはわずか7.5%で、大半は13%以上の差で負けた。20%超の改善を出したのは上位5チームだけだった
- 予測の当たり外れは、どの誤差を精度と呼ぶかで順位が動く。2006年にInternational Journal of Forecasting 22巻4号へ出た論文は、予測精度の指標そのものを選び直す議論で、測り方が違えば同じ予測でも良いか悪いかが入れ替わることを扱っている。問うべきは手法名ではなく、何を必要量と数え、外したときの費用を何と数えたかである
- M競技の20年——2000年のM3で複雑な手法は単純な手法に勝てず、2018年のM4で組み合わせが上位、同年に統計手法が機械学習を上回る比較も出て、2022年報告のM5でようやく機械学習が上位に立ったが大半は単純な目安に負けたまま。手法は派手になったが、当たりやすさは混ぜ方と比べる目安しだいという結論はほとんど動いていない。標本は公開コンペの系列と参加者に限られ、単発の受注や新商品はこの土俵に乗りにくい
| よくある誤解 | 実際のところ |
|---|---|
| 機械学習やAIを入れれば、需要予測は当たるようになる | 同じデータで多数の手法を競わせるM競技の実測は、そう単純ではないと示している。2018年のPLOS ONEの論文はM3競技の月次1,045系列で機械学習が統計手法8種に二つの精度指標でも全予測期間でも劣ったと報告し、同年のM4では単一手法ではなく複数手法の組み合わせが上位を占めた。機械学習が上位に立った2022年報告のM5ですら、いちばん強い単純な指数平滑の目安を上回れた参加チームは7.5%で、大半は13%以上の差で負けた。当たったのは手法名ではなく、何と何を組み合わせ、どの目安と比べるかを設計できた少数だった |
| 機械学習が役に立たないなら、予測はどれも当てにならない | そうではない。M4では組み合わせが、M5では勾配ブースティング木という機械学習が上位に立ち、上位5チームは20%を超える改善を出している。効く場面はある。ただし効き目は、どの誤差を精度と呼ぶかという測り方に依存する。予測の当たり外れは誤差の測り方を決めて初めて順位になり、測り方が違えば同じ予測でも良し悪しが入れ替わる。標本も公開コンペの系列に限られ、単発の受注や新商品はこの土俵に乗りにくい |
切らさず回している人は、たいてい「もっと当てられれば」と思っている。だがこの土台の段でわかるのは、逆のことだ。当てる技術より先に要るのは、外したときに何を費用と数えるかを、先に決めておくことである。数字が当たらないのではない。何を数えると決めていないから、当たったかどうかさえ言えないのだ。この棚がこれから積み上げていくのは、当てる腕ではなく、数える前に「何を数えるか」を問う癖のほうである。
Q1. 2018年にPLOS ONEへ出た論文は、M3競技の月次 ____ 系列で、よく使われる機械学習の手法が伝統的な統計手法8種に、二つの精度指標でも全予測期間でも ____ と報告した。穴埋め
Q2. M5競技で、いちばん強い単純な指数平滑の目安(ES bu)を上回れた参加チームは ____ %にとどまり、大半はその目安に ____ %以上の差で負けた。穴埋め
Q3. M4競技(2018年)で上位を占めたのは何か。選択
Q4. この棚が16回くり返す見方を、供給の「最適」が何の産物であるかという形で書きなさい。M競技の勝敗と結びつけて説明すること。一問一答
Q5. この棚の四つの段を、土台から順に積み上がる順に並べなさい。並べ替え
紙かメモアプリを開く。いま自分が「だいたい何個くらい」と見積もって仕入れている、または用意している品目を3つ書き出す。それぞれに「何を根拠にその数にしたか」を1行で添える。次に、各品目について、外したときに困るのはどちらか——切らすほうか、余らせるほうか——を一言だけ書き、その理由を1行で記す。誰かに聞く必要も、実際の在庫を動かす必要もない。手元の記憶とメモだけで完結させる。一人で全部を回している場合も、そのまま同じ形で書けばよい。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Makridakis S., Spiliotis E., Assimakopoulos V. (2018) ‘Statistical and Machine Learning forecasting methods: Concerns and ways forward’, PLOS ONE 13(3):e0194889 — doi.org
- Makridakis S., Spiliotis E., Assimakopoulos V. (2018) ‘The M4 Competition: Results, findings, conclusion and way forward’, International Journal of Forecasting 34(4):802-808 — doi.org
- Makridakis S., Spiliotis E., Assimakopoulos V. (2022) ‘M5 accuracy competition: Results, findings, and conclusions’, International Journal of Forecasting 38(4):1346-1364 — doi.org
- Hyndman R.J., Koehler A.B. (2006) ‘Another look at measures of forecast accuracy’, International Journal of Forecasting 22(4):679-688 — doi.org
- Makridakis S., Hibon M. (2000) ‘The M3-Competition: results, conclusions and implications’, International Journal of Forecasting 16(4):451-476 — doi.org
- Petropoulos F. ほか (2022) ‘Forecasting: theory and practice’, International Journal of Forecasting 38(3):705-871 — doi.org
- Green K.C., Armstrong J.S. (2015) ‘Simple versus complex forecasting: The evidence’, Journal of Business Research 68(8):1678-1685 — doi.org