[论文解读] EcomGPT: Instruction-tuning Large Language Models with Chain-of-Task Tasks for E-commerce
本文提出了 EcomInstruct,一个基于链式任务(CoT)任务构建的 250 万条样本的电商指令微调数据集,其基础为产品信息和评论等原子电商数据类型。使用 EcomInstruct 对 BLOOMZ 进行微调,得到 EcomGPT,该模型在电商基准测试中实现了零样本跨数据集和跨任务泛化性能超越 ChatGPT,其优势源于 CoT 训练带来的语义理解增强。
Recently, instruction-following Large Language Models (LLMs) , represented by ChatGPT, have exhibited exceptional performance in general Natural Language Processing (NLP) tasks. However, the unique characteristics of E-commerce data pose significant challenges to general LLMs. An LLM tailored specifically for E-commerce scenarios, possessing robust cross-dataset/task generalization capabilities, is a pressing necessity. To solve this issue, in this work, we proposed the first e-commerce instruction dataset EcomInstruct, with a total of 2.5 million instruction data. EcomInstruct scales up the data size and task diversity by constructing atomic tasks with E-commerce basic data types, such as product information, user reviews. Atomic tasks are defined as intermediate tasks implicitly involved in solving a final task, which we also call Chain-of-Task tasks. We developed EcomGPT with different parameter scales by training the backbone model BLOOMZ with the EcomInstruct. Benefiting from the fundamental semantic understanding capabilities acquired from the Chain-of-Task tasks, EcomGPT exhibits excellent zero-shot generalization capabilities. Extensive experiments and human evaluations demonstrate that EcomGPT outperforms ChatGPT in term of cross-dataset/task generalization on E-commerce tasks.
研究动机与目标
- 为解决通用大语言模型在电商任务中泛化能力差的问题,其原因在于独特的句法结构和动态实体。
- 构建一个领域特定的指令微调数据集,以捕捉电商自然语言处理任务的复杂性与多样性。
- 设计并验证链式任务(CoT)任务作为源自核心电商数据类型的原子中间任务。
- 训练并评估 EcomGPT,一种专用大语言模型,实现在多种电商数据集和任务上的卓越零样本泛化能力。
- 证明基于 CoT 的指令微调能显著提升垂直领域中的跨数据集与跨任务泛化能力。
提出的方法
- 从两个来源构建 EcomInstruct:开源电商自然语言处理数据集,以及从基础电商数据类型(如产品属性、用户评论)派生出的原子 CoT 任务。
- 将链式任务(CoT)定义为中间、语义基础明确的子任务,其隐含支持最终电商任务的解决。
- 通过在 EcomInstruct 数据集上使用指令微调范式,对 BLOOMZ 主干模型进行微调,训练 EcomGPT。
- 采用保留验证(held-in evaluation)和消融研究,从数据集、任务和任务范式三个层面分离 CoT 数据的贡献。
- 结合自动指标(F1、Rouge)与人工评估,衡量在未见数据集和任务上的零样本泛化性能。
- 应用消融分析,评估移除与特定数据集、任务或任务范式相关的 CoT 数据的影响。
实验结果
研究问题
- RQ1基于电商数据类型派生的 CoT 任务进行指令微调,能否显著提升电商自然语言处理任务的零样本泛化能力?
- RQ2不同数据集来源的 CoT 数据包含,如何影响模型在未见数据集上的泛化能力?
- RQ3来自不同任务类型(如问答、命名实体识别、分类)的 CoT 任务,在多大程度上能增强对无关但语义相关的任务的泛化能力?
- RQ4任务范式层级(如分类与生成)是否影响 CoT 数据的可迁移性及其收益?
- RQ5在电商基准测试中,EcomGPT 与通用大语言模型(如 ChatGPT)相比,在跨数据集和跨任务泛化方面表现如何?
主要发现
- 在消融设置下,EcomGPT 在未见数据集上的平均 F1 达到 65.74%,优于 ChatGPT 的 64.41%,表明其在跨数据集和跨任务泛化方面表现更优。
- 消融研究显示,从 Ecom 数据集移除 CoT 数据会使平均 F1 下降 1.02%,表明 CoT 数据在泛化中起关键作用。
- 源自相同数据类型(如 Ecom 和 Youku 中的产品标题)的 CoT 任务表现出相互增益,而源自不同类型(如 CCKS 与 JDDC)的 CoT 任务则无此优势。
- 与问答(QA)相关的 CoT 任务在其他任务中展现出最强的泛化提升,表明 QA 是指令遵循模型中一种强大的抽象形式。
- 在任务范式层级上,来自分类任务的 CoT 任务对其他范式带来的增益大于其自身,表明其具有更高的可迁移性。
- 人工评估确认,EcomGPT 在处理复杂、富含实体的电商文本方面表现更优,例如能从结构化属性生成连贯的产品标题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。