[论文解读] LINGUIST: Language Model Instruction Tuning to Generate Annotated Utterances for Intent Classification and Slot Tagging
Linguist 提出了一种新颖的指令微调方法,利用一个50亿参数的序列到序列语言模型,生成高质量、多语言的意图分类与槽位标注(IC+ST)数据。通过在灵活的自然语言指令提示上进行微调,该方法能够实现精确的槽位控制,生成带标注的语句,在10-shot新意图设置下,意图分类的召回率提升+1.9,槽位标注的F1提升+2.5,优于回译和示例外推基线方法。
We present LINGUIST, a method for generating annotated data for Intent Classification and Slot Tagging (IC+ST), via fine-tuning AlexaTM 5B, a 5-billion-parameter multilingual sequence-to-sequence (seq2seq) model, on a flexible instruction prompt. In a 10-shot novel intent setting for the SNIPS dataset, LINGUIST surpasses state-of-the-art approaches (Back-Translation and Example Extrapolation) by a wide margin, showing absolute improvement for the target intents of +1.9 points on IC Recall and +2.5 points on ST F1 Score. In the zero-shot cross-lingual setting of the mATIS++ dataset, LINGUIST out-performs a strong baseline of Machine Translation with Slot Alignment by +4.14 points absolute on ST F1 Score across 6 languages, while matching performance on IC. Finally, we verify our results on an internal large-scale multilingual dataset for conversational agent IC+ST and show significant improvements over a baseline which uses Back-Translation, Paraphrasing and Slot Catalog Resampling. To our knowledge, we are the first to demonstrate instruction fine-tuning of a large-scale seq2seq model to control the outputs of multilingual intent- and slot-labeled data generation.
研究动机与目标
- 为解决对话代理中新意图、新槽位和新语言的标注训练数据稀缺问题。
- 生成高质量、多语言且具有槽位控制能力的合成训练数据,用于意图分类与槽位标注(IC+ST)。
- 仅使用意图和槽位标签名称,无需先前示例,实现零样本和少样本数据生成。
- 通过生成具有受控槽位标注的对齐多语言语句,提升 IC+ST 中的跨语言性能。
- 展示在低资源环境下,对大规模序列到序列模型进行指令微调在结构化数据生成中的有效性。
提出的方法
- 在结构化指令提示上微调一个50亿参数的多语言序列到序列模型(AlexaTM 5B),该提示指定期望的输出格式,包括意图、槽位类型和值。
- 设计一个自然语言指令提示,包含输入语言、意图、带值的所需槽位以及示例语句,以引导生成。
- 使用微调后的模型生成针对新意图或零样本槽位类型的新型标注语句,仅使用标签名称,无需训练示例。
- 将生成的数据用于增强下游 IC+ST 模型的训练集,提升泛化能力和零样本性能。
- 利用模型在单个输出中生成语句及其对应槽位标注的能力,确保对齐性。
- 在 SNIPS、mATIS++ 和一个内部多语言数据集上,采用零样本和少样本设置进行评估,以验证方法的鲁棒性与可扩展性。
实验结果
研究问题
- RQ1指令微调的大规模语言模型能否在精确控制槽位类型和值的前提下,生成高质量、多语言的 IC+ST 数据?
- RQ2在少样本和零样本设置下,生成数据的性能与回译和示例外推等强基线相比如何?
- RQ3该模型能否在无任何训练示例的情况下,仅使用意图和槽位标签名称,泛化到新意图?
- RQ4该方法在跨语言设置下效果如何,特别是在 mATIS++ 中的多种语言之间?
- RQ5生成的合成数据是否能显著提升真实世界大规模多语言对话代理数据上下游 IC+ST 模型的性能?
主要发现
- 在 SNIPS 的 10-shot 新意图设置下,Linguist 相较于回译和示例外推基线,意图分类召回率提升 +1.9,槽位标注 F1 提升 +2.5。
- 在 mATIS++ 跨语言基准上,Linguist 在六种语言的槽位标注 F1 上相比强基线(机器翻译+槽位对齐)提升 +4.14,同时保持了相当的意图分类性能。
- 在零样本意图生成中,Linguist 在无任何训练示例的新 SNIPS 意图上实现了 80.0% 的意图分类召回率和 56.9% 的槽位标注 F1,展现出真正的零样本能力。
- 在内部大规模多语言数据集上,Linguist 显著优于基于回译、重述和槽位目录重采样的基线方法。
- 该方法是首个展示对大规模序列到序列模型进行指令微调,以生成具有受控结构的多语言、意图与槽位标注数据的方法。
- 该模型在单个输出中同时生成语句和对齐的槽位标注,确保了下游训练所需数据的高质量与一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。