[論文レビュー] Demand Prediction Using Machine Learning Methods and Stacked Generalization
本論文は、同じ商品を異なる価格で販売する競合する売り手が存在するトルコのECプラットフォームにおける需要予測のためのスタッキング(スタッキング)アンサンブルモデルを提案する。勾配ブースティング、ランダムフォレスト、線形回帰、決定木といった複数の機械学習回帰モデルを組み合わせることで、モデルは優れた性能を達成し、最良の構成(GBT + RF + LR)ではRMSEが1.864にまで低下し、個々のモデルを上回り、少ない訓練データでも統計的に有意な結果を示した。
Supply and demand are two fundamental concepts of sellers and customers. Predicting demand accurately is critical for organizations in order to be able to make plans. In this paper, we propose a new approach for demand prediction on an e-commerce web site. The proposed model differs from earlier models in several ways. The business model used in the e-commerce web site, for which the model is implemented, includes many sellers that sell the same product at the same time at different prices where the company operates a market place model. The demand prediction for such a model should consider the price of the same product sold by competing sellers along the features of these sellers. In this study we first applied different regression algorithms for specific set of products of one department of a company that is one of the most popular online e-commerce companies in Turkey. Then we used stacked generalization or also known as stacking ensemble learning to predict demand. Finally, all the approaches are evaluated on a real world data set obtained from the e-commerce company. The experimental results show that some of the machine learning methods do produce almost as good results as the stacked generalization method.
研究の動機と目的
- 価格競争的な商品を提供するマーケットプレイス型eコマースモデルにおける需要予測の課題に対処すること。
- 個々の機械学習モデルと比較して、スタックド一般化が需要予測の精度を向上させる有効性を評価すること。
- 多様な回帰モデルを用いたアンサンブル学習が、少ない訓練データで予測誤差を低減できるかどうかを特定すること。
- 実世界のeコマース環境における需要予測の最適なベースラーナーとメタラーナーの組み合わせを同定すること。
提案手法
- 2段階の学習を用いたスタックド一般化(スタッキング)を採用:1段階目の回帰モデル(線形回帰、ランダムフォレスト、勾配ブースティング、決定木)を訓練データで学習させ、2段階目のメタラーナーがそれらの予測値を統合する。
- 1段階目のモデル最適化のため、訓練セットで10分割交差検証を実施し、検証セットを用いてメタラーナーを学習した。
- データを50%訓練、20%検証、30%テストに分割し、一貫性のある評価を確保するために20回のランダムな分割を実施した。
- RMSEを評価指標とし、モデル性能の差の統計的有意性を検出するためにANOVAおよびt検定を適用した。
- 2種類および3種類の1段階目モデルの組み合わせ(バイナリおよびトリプルコンビネーション)と、さまざまなメタラーナー(例:線形回帰、決定木)をテストし、最適な構成を同定した。
- n11.comから得た実世界のeコマースデータを用い、複数の売り手が同じ商品を異なる価格で販売する1つの部門に焦点を当てた。
実験結果
リサーチクエスチョン
- RQ1価格競争的な商品を提供するeコマースマーケットプレイスにおいて、スタックド一般化は個々の機械学習モデルと比較して需要予測の精度を向上させることができるか?
- RQ2線形回帰、ランダムフォレスト、勾配ブースティング、決定木といったベースラーナーのうち、どの組み合わせが需要予測で最小の予測誤差を達成するか?
- RQ3スタックドモデルは、単一モデルと比較して、少ない訓練データでも優れた性能を発揮するか?
- RQ4スタックドモデルの性能向上は、個々のモデルと比較して統計的に有意であるか?
主な発見
- 勾配ブースティング、ランダムフォレスト、線形回帰を1段階目のラーナーとして使用したスタックド一般化モデルが、テストセットで最も低いRMSE(1.864)を達成した。
- 勾配ブースティングとランダムフォレストのバイナリペアが、最も優れた単一のバイナリペアを形成し、RMSEは1.870であった。
- 2段階目のメタラーナーとして線形回帰を使用した場合、決定木やランダムフォレストといった他のメタラーナーを上回った。
- ANOVAの結果、5%の有意水準で帰無仮説が棄却され、モデル性能に統計的に有意な差があることが示された。
- t検定の結果、ランダムフォレスト(1段階目)と線形回帰(2段階目)の性能に統計的に有意な差がなかったため、アンサンブル手法の堅牢性が示された。
- 提案されたスタッキングモデルは、個々のモデルと同等の性能を達成したが、訓練データの20%の量で実現可能であり、データ効率性が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。