[论文解读] eCeLLM: Generalizing Large Language Models for E-commerce from Large-scale, High-quality Instruction Data
本文提出 eCeLLM,一系列基于 ECInstruct——一个大规模、高质量、开源的指令数据集——微调的电商领域指令调整大语言模型,涵盖10种不同的电商任务。eCeLLM 在域内评估中显著优于 GPT-4 和专用模型,并在域外场景(包括未见过的产品和指令)中展现出强大的泛化能力,未见过产品上的性能较最佳基线模型提升9.3%。
With tremendous efforts on developing effective e-commerce models, conventional e-commerce models show limited success in generalist e-commerce modeling, and suffer from unsatisfactory performance on new users and new products - a typical out-of-domain generalization challenge. Meanwhile, large language models (LLMs) demonstrate outstanding performance in generalist modeling and out-of-domain generalizability in many fields. Toward fully unleashing their power for e-commerce, in this paper, we construct ECInstruct, the first open-sourced, large-scale, and high-quality benchmark instruction dataset for e-commerce. Leveraging ECInstruct, we develop eCeLLM, a series of e-commerce LLMs, by instruction-tuning general-purpose LLMs. Our comprehensive experiments and evaluation demonstrate that eCeLLM models substantially outperform baseline models, including the most advanced GPT-4, and the state-of-the-art task-specific models in in-domain evaluation. Moreover, eCeLLM exhibits excellent generalizability to out-of-domain settings, including unseen products and unseen instructions, highlighting its superiority as a generalist e-commerce model. Both the ECInstruct dataset and the eCeLLM models show great potential in empowering versatile and effective LLMs for e-commerce. ECInstruct and eCeLLM models are publicly accessible through https://ninglab.github.io/eCeLLM.
研究动机与目标
- 为解决专用电商模型在通用建模与域外泛化方面的局限性,特别是针对新用户和新产品的场景。
- 通过构建高质量、大规模的指令数据集,弥合大语言模型在多样化电商应用中应用的差距。
- 开发一种在多种任务上表现优异且能有效泛化到未见数据的通用电商基础模型。
- 实现对新产品和新指令的零样本与少样本泛化,克服电商领域的冷启动挑战。
提出的方法
- 构建 ECInstruct,一个包含 116,528 个样本的开源指令数据集,涵盖 4 个类别中的 10 种真实电商任务,包含输入、指令、输出及可选选项。
- 从真实用户查询和产品交互中收集并整理高质量、多样化且真实的电商指令数据。
- 利用 ECInstruct 通过指令微调方法,对六种通用大语言模型(包括 Llama 2 和 Mistral)进行微调,构建 eCeLLM 系列模型。
- 设计评估协议,包含域内(IND)和域外(OOD)测试集,其中 OOD 样本包含未见过的产品和未见过的指令。
- 在多种设置下评估 eCeLLM:完整微调、少样本和零样本设置,包括对新产品的和新指令的域外泛化。
- 采用严格的自动评估与人工评估相结合的方式,验证 eCeLLM 在产品描述生成、属性抽取和问答等多种电商任务中的性能。

实验结果
研究问题
- RQ1与专用模型和 GPT-4 相比,指令微调的大语言模型是否能在广泛电商任务中实现更优性能?
- RQ2eCeLLM 在未见过的产品和指令等域外设置中,无需微调时的泛化能力如何?
- RQ3ECInstruct 数据集的规模与质量对 eCeLLM 模型泛化能力与性能的影响如何?
- RQ4单一通用大模型是否能替代多个专用电商模型,同时保持或超越其性能?
- RQ5训练数据多样性与指令质量对电商大模型在零样本与少样本设置下的泛化能力有何影响?
主要发现
- 在所有 10 项任务的域内评估中,eCeLLM 模型相较最佳基线模型平均提升 10.7% 的性能。
- 在域内设置下,eCeLLM 在全部 10 项任务上均优于 GPT-4 Turbo,展现出强劲的竞争力。
- 在包含未见过产品的域外设置中,eCeLLM 相较最佳基线模型实现 9.3% 的性能提升,凸显其强大的泛化能力。
- eCeLLM 在零样本与少样本设置中保持强劲性能,表现出对分布偏移与数据稀缺的鲁棒性。
- ECInstruct 数据集可有效支持对新指令的零样本迁移,证实其在通用建模中的实用性。
- 高质量指令数据与指令微调的结合,使 eCeLLM 能够有效泛化到未见任务与产品类别,有效解决电商领域的冷启动问题。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。