[論文レビュー] eCeLLM: Generalizing Large Language Models for E-commerce from Large-scale, High-quality Instruction Data
この論文では、10の多様なeコマースタスクをカバーする大規模で高品質なオープンソースの指示データセットであるECInstructに基づいて構築された、eコマース向けの指示微調整済み大規模言語モデルであるeCeLLMを紹介する。eCeLLMは、ドメイン内評価においてGPT-4およびタスク固有のモデルを著しく上回り、未学習の製品や指示を含むドメイン外シナリオに対しても強力な一般化性能を示し、最良のベースライン比で未学習製品で9.3%の向上を達成した。
With tremendous efforts on developing effective e-commerce models, conventional e-commerce models show limited success in generalist e-commerce modeling, and suffer from unsatisfactory performance on new users and new products - a typical out-of-domain generalization challenge. Meanwhile, large language models (LLMs) demonstrate outstanding performance in generalist modeling and out-of-domain generalizability in many fields. Toward fully unleashing their power for e-commerce, in this paper, we construct ECInstruct, the first open-sourced, large-scale, and high-quality benchmark instruction dataset for e-commerce. Leveraging ECInstruct, we develop eCeLLM, a series of e-commerce LLMs, by instruction-tuning general-purpose LLMs. Our comprehensive experiments and evaluation demonstrate that eCeLLM models substantially outperform baseline models, including the most advanced GPT-4, and the state-of-the-art task-specific models in in-domain evaluation. Moreover, eCeLLM exhibits excellent generalizability to out-of-domain settings, including unseen products and unseen instructions, highlighting its superiority as a generalist e-commerce model. Both the ECInstruct dataset and the eCeLLM models show great potential in empowering versatile and effective LLMs for e-commerce. ECInstruct and eCeLLM models are publicly accessible through https://ninglab.github.io/eCeLLM.
研究の動機と目的
- 新しいユーザーおよび新しい製品に対して、タスク固有のeコマースモデルの汎用的モデリングおよびドメイン外一般化における限界を克服すること。
- 多様なeコマース応用分野における大規模言語モデル(LLM)の活用のギャップを埋めるために、高品質で大規模な指示データセットを構築すること。
- 多様なタスクに優れた性能を発揮し、未学習データに対しても効果的に一般化できる汎用的eコマース基盤モデルを開発すること。
- 冷スタート問題を克服するために、新しい製品や新しい指示に対するゼロショットおよびフェイワショット一般化を可能にすること。
提案手法
- 4つのカテゴリにまたがる10の実世界のeコマースタスクをカバーする116,528件のサンプルを含む、オープンソースの指示データセットECInstructを構築。入力、指示、出力、およびオプションの選択肢を含む。
- 実際のユーザークエリや製品インタラクションから、高品質で多様かつ現実的なeコマース指示データを収集・キュレーションする。
- Llama 2 や Mistral を含む6つの汎用的LLMを、ECInstructを用いた指示微調整により微調整し、eCeLLMシリーズのモデルを構築する。
- ドメイン内(IND)およびドメイン外(OOD)のテストセットを含む評価プロトコルを設計。OODサンプルには未学習の製品や未学習の指示が含まれる。
- eCeLLMの評価を、フルトレーニング、フェイワショット、ゼロショットの複数の設定で実施。未学習の製品や未学習の指示へのドメイン外一般化を含む。
- 人的評価と自動評価を厳密に組み合わせ、製品説明生成、属性抽出、質問応答など、多様なeコマースタスクにおける性能を検証する。

実験結果
リサーチクエスチョン
- RQ1指示微調整済みLLMは、タスク固有のモデルやGPT-4と比較して、広範なeコマースタスクにおいて優れたパフォーマンスを達成できるか?
- RQ2eCeLLMは、微調整なしで、新しい製品や新しい指示を含むドメイン外設定にどの程度一般化できるか?
- RQ3ECInstructデータセットの規模と品質は、結果として得られるeCeLLMモデルの一般化性能およびパフォーマンスにどのように影響するか?
- RQ41つの汎用的LLMが、複数の専用eコマースモデルを代替でき、それらの性能を維持または上回るか?
- RQ5トレーニングデータの多様性および指示の品質は、eコマースLLMにおけるゼロショットおよびフェイワショット一般化にどのような影響を与えるか?
主な発見
- eCeLLMモデルは、全10タスクにおけるドメイン内評価で、最良のベースラインモデル比で平均10.7%のパフォーマンス向上を達成した。
- ドメイン内設定において、eCeLLMはGPT-4 Turboの全10タスクで上回り、強力な競合性能を示した。
- 未学習の製品を含むドメイン外設定では、eCeLLMは最良のベースラインモデル比で9.3%の向上を達成し、強力な一般化能力を示した。
- eCeLLMはゼロショットおよびフェイワショット設定でも高いパフォーマンスを維持しており、分布シフトやデータ不足に対しても頑健であることが示された。
- ECInstructデータセットは、新しい指示への有効なゼロショット転送を可能にし、汎用的モデリングにおけるその有用性を確認した。
- 高品質な指示データと指示微調整の組み合わせにより、eCeLLMは未学習のタスクや製品カテゴリに対しても効果的に一般化でき、eコマースにおけるコールドスタート問題を解決した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。