[论文解读] LLaMA-E: Empowering E-commerce Authoring with Object-Interleaved Instruction Following
LLaMA-E 是一系列针对电商创作任务定制的指令微调大型语言模型,利用多方面指令集,整合了买家、卖家和平台的特征。通过在精心筛选的 300 对指令数据集上从 GPT-3.5-turbo 进行蒸馏训练,LLaMA-E 在广告生成、产品标题重写、分类和问答等任务中,无论在零样本还是少样本设置下,均实现了最先进(SOTA)的性能表现,同时通过本地推理保护了数据隐私。
E-commerce authoring entails creating engaging, diverse, and targeted content to enhance preference elicitation and retrieval experience. While Large Language Models (LLMs) have revolutionized content generation, they often fall short in e-commerce applications due to their limited memorization of domain-specific features. This paper proposes LLaMA-E, the unified e-commerce authoring models that address the contextual preferences of customers, sellers, and platforms, the essential objects in e-commerce operation. We design the instruction set derived from tasks of ads generation, query-enhanced product title rewriting, product classification, purchase intent speculation, and general e-commerce Q&A. The instruction formulation ensures the interleaved cover of the presented and required object features, allowing the alignment of base models to parameterise e-commerce knowledge comprehensively. The proposed LLaMA-E models achieve state-of-the-art evaluation performance and exhibit the advantage in zero-shot practical applications. To our knowledge, this is the first LLM tailored to empower authoring applications with comprehensive scenario understanding by integrating features focused on participated objects.
研究动机与目标
- 为解决通用大语言模型在理解涉及多方利益相关者(买家、卖家、平台)的复杂个性化电商创作任务方面的局限性。
- 开发一种隐私保护、可本地部署的大语言模型解决方案,避免远程数据传输,保护敏感的客户信息。
- 通过整合广告生成、标题重写和意图预测等多样化电商创作任务中的特征,实现统一的多任务指令遵循。
- 通过领域专家精心构建的种子指令集,从 GPT-3.5-turbo 进行蒸馏,提升模型的泛化能力和性能。
- 为电商创作任务中的指令微调大语言模型建立基准,证明其在定量和定性评估中均优于通用大语言模型。
提出的方法
- 由领域专家手工筛选并构建了 300 对指令-输出对的种子指令集,涵盖五项核心电商创作任务:广告生成、增强查询的标题重写、产品分类、购买意图推测和问答。
- 使用 GPT-3.5-turbo-301 模型作为教师模型,通过自我指令提示生成扩展的训练数据,提升指令跟随数据集的规模和多样性。
- 使用标准的指令微调技术,在此扩展的指令数据集上对 LLaMA-E 模型进行微调,模型参数量分别为 7B、13B 和 30B。
- 指令集设计旨在交错融合买家、卖家和平台三类关键电商参与者的特征,以增强上下文理解与任务泛化能力。
- 评估包括自动指标(如 BLEU、ROUGE)和人工评估(可读性、覆盖度、吸引力),并通过未见过的指令测试零样本泛化能力。
- 通过本地训练和部署模型,避免将敏感客户数据传输至外部服务器,从而保障数据隐私。
实验结果
研究问题
- RQ1通过交错融合买家、卖家和平台的特征,统一的指令微调大语言模型是否能有效处理多样化的多方面电商创作任务?
- RQ2与通用大语言模型相比,使用领域特定的多方面指令进行指令微调,能否显著提升零样本泛化能力?
- RQ3从强大教师模型(GPT-3.5)蒸馏知识,能否在保护隐私的前提下显著提升电商创作任务的性能,同时实现本地化部署?
- RQ4LLaMA-E 模型在生成有说服力、准确且上下文相关的电商内容方面,与通用大语言模型(如 T5-base、LLaMA-13/30b)相比表现如何?
- RQ5在指令集中加入广告生成和说服性语言,对模型生成吸引人、可转化优化内容的能力有何影响?
主要发现
- LLaMA-E 模型在广告生成和标题重写任务的自动评估与人工评估中,均优于通用大语言模型(如 T5-base、GPT-Neo、LLaMA-13/30b)。
- 在零样本评估中,LLaMA-E 模型正确识别出 'Etsy Stats' 是平台提供的用于分析店铺表现的工具,而通用大语言模型则生成了通用或语义错误的回答。
- 人工评估显示,LLaMA-E 的输出在广告生成任务中更具吸引力和说服力,尤其得益于指令微调过程中学习到的说服性短语(如 '立即下单')。
- 尽管参数量更小且为本地部署,LLaMA-E 模型在人工评估中表现接近 GPT-3.5,展现出强大的泛化能力和鲁棒性。
- 指令集设计中交错融合买家、卖家和平台的特征,使模型能够有效泛化至未见过的指令和任务。
- 该模型通过支持本地推理,展现出强大的隐私合规性,避免将客户数据传输至远程服务器。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。