[论文解读] SeqGPT: An Out-of-the-box Large Language Model for Open Domain Sequence Understanding
SeqGPT 是一个用于开放域自然语言理解任务的双语(英语/中文)开源自回归语言模型。它通过使用两种固定输入输出格式的原子任务进行微调,基于 GPT 生成的合成数据进行指令微调,并在 152 个多样化的 NLU 数据集上进一步微调,实现了在未见领域和任务上的强大零样本性能,包括事件抽取和实体类型识别。
Large language models (LLMs) have shown impressive ability for open-domain NLP tasks. However, LLMs are sometimes too footloose for natural language understanding (NLU) tasks which always have restricted output and input format. Their performances on NLU tasks are highly related to prompts or demonstrations and are shown to be poor at performing several representative NLU tasks, such as event extraction and entity typing. To this end, we present SeqGPT, a bilingual (i.e., English and Chinese) open-source autoregressive model specially enhanced for open-domain natural language understanding. We express all NLU tasks with two atomic tasks, which define fixed instructions to restrict the input and output format but still ``open'' for arbitrarily varied label sets. The model is first instruction-tuned with extremely fine-grained labeled data synthesized by ChatGPT and then further fine-tuned by 233 different atomic tasks from 152 datasets across various domains. The experimental results show that SeqGPT has decent classification and extraction ability, and is capable of performing language understanding tasks on unseen domains. We also conduct empirical studies on the scaling of data and model size as well as on the transfer across tasks. Our model is accessible at https://github.com/Alibaba-NLP/SeqGPT.
研究动机与目标
- 解决大型语言模型(LLMs)在自然语言理解(NLU)任务中因对结构化输出遵循不佳以及依赖提示工程而带来的局限性。
- 克服零样本和 few-shot LLM 在事件抽取和实体类型识别等任务中的性能不一致问题。
- 开发一种多功能、开源的模型,能够在极少提示工程的情况下泛化至多样化的 NLU 任务。
- 通过利用多样化、高质量的合成数据和真实世界 NLU 数据,提升在未见领域中的零样本和 few-shot 性能。
- 通过具有固定输入输出模板的原子任务设计,提供统一、标准化的 NLU 任务接口。
提出的方法
- 将所有 NLU 任务定义为两种原子任务,采用固定输入输出格式,以标准化模型行为,同时保留对任意标签集合的灵活性。
- 使用 GPT-3.5(ChatGPT)生成超过 80 万条高质量、多样化的合成 NLU 数据,为开放域场景创建逼真的标签和注释。
- 在涵盖 11 种 NLU 任务(包括命名实体识别、关系抽取、文本分类和机器阅读理解)的 152 个数据集上对基础 BLOOMZ 模型进行微调。
- 采用两阶段训练流程:首先在合成数据上进行指令微调以提升泛化能力,然后在真实世界数据集上进行微调以提高任务特定准确性。
- 在所有任务中使用一致的提示模板,以确保模型一致性并减少对任务特定提示工程的依赖。
- 利用双语(英语/中文)数据,支持单一统一模型中的多语言 NLU 能力。
实验结果
研究问题
- RQ1一个中等规模的语言模型是否能在无需任务特定提示工程的情况下,在多样化的开放域 NLU 任务中实现强大的零样本和 few-shot 性能?
- RQ2与标准微调相比,在多样化、高质量的合成数据上进行指令微调,如何提升 NLU 中的泛化能力和零样本迁移性能?
- RQ3模型规模和训练数据量的扩展在多任务和多领域 NLU 任务中能在多大程度上提升性能?
- RQ4具有固定输入输出模板的统一原子任务设计,是否能一致地引导语言模型在各种 NLU 任务中生成正确的结构化输出?
- RQ5该模型在知识迁移至未见领域和任务方面(尤其是在低资源设置下)的效率如何?
主要发现
- SeqGPT 在未见 NLU 任务(包括事件抽取和实体类型识别)中实现了强大的零样本性能,其在结构化输出遵循方面优于标准 LLM(如 GPT-3.5)。
- 该模型在涵盖 11 种 NLU 任务的 152 个多样化数据集上表现出稳健的零样本泛化能力,包括低资源和域外设置。
- 在 152 个数据集的 233 个原子任务上进行微调,显著提升了性能,相较于零样本或 few-shot 基线模型,尤其在分类和抽取任务中表现突出。
- 两阶段训练策略(先在合成数据上进行指令微调,再在真实数据上进行微调)带来了更好的泛化能力和更一致的输出格式。
- 实证分析表明,数据多样性比单纯的数据量更为关键,这支持了具有丰富标签多样性的合成数据的价值。
- SeqGPT 在 CAAI、TNEWS 和 WikiQA 等基准测试中取得了具有竞争力的结果,在零样本设置下性能与更大模型相当或更优,尤其在结构化输出任务中表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。