[论文解读] Intent Detection with WikiHow
本文提出了一种新颖的预训练方法,用于意图检测,方法是利用多语言教学网站 wikiHow,将意图检测建模为基于步骤-目标对的多项选择任务。在该数据上微调预训练的 RoBERTa 和 XLM-RoBERTa 模型,在多个基准测试中取得了最先进性能,仅使用 100 个领域内样本即可达到 75% 以上的准确率,展示了在多种语言和领域中强大的零样本和少样本泛化能力。
Modern task-oriented dialog systems need to reliably understand users' intents. Intent detection is most challenging when moving to new domains or new languages, since there is little annotated data. To address this challenge, we present a suite of pretrained intent detection models. Our models are able to predict a broad range of intended goals from many actions because they are trained on wikiHow, a comprehensive instructional website. Our models achieve state-of-the-art results on the Snips dataset, the Schema-Guided Dialogue dataset, and all 3 languages of the Facebook multilingual dialog datasets. Our models also demonstrate strong zero- and few-shot performance, reaching over 75% accuracy using only 100 training examples in all datasets.
研究动机与目标
- 解决在标注数据有限的低资源领域和语言中进行意图检测的挑战。
- 开发一种预训练任务,以利用 wikiHow 广泛、多样且多语言的教学内容。
- 通过在大规模开放领域数据集上进行预训练,提升意图检测基准在少样本和零样本设置下的性能。
- 实现在仅需极少领域内微调的情况下,快速适应对话系统至新服务和新兴领域。
提出的方法
- 作者通过从 wikiHow 文章中提取步骤标题(作为话语)和文章标题(作为意图),构建了预训练数据集。
- 他们将预训练任务定义为四选一的多项选择分类任务,即模型需从四个候选中选出与给定步骤(话语)相对应的正确意图(目标)。
- 负样本从相关文章中采样,且词汇重叠度极低,以确保任务具有足够难度并避免出现平凡的负样本。
- 使用标准的基于 Transformer 的架构和分类头,在标准意图检测基准上对模型进行微调。
- 在多语言评估中,他们使用 XLM-RoBERTa 模型处理英语、西班牙语和泰语,并在 Snips、Schema-Guided Dialogue 和 Facebook 的多语言数据集上进行微调。
- 通过逐步减小领域内数据集规模,评估零样本和少样本性能,比较在 wikiHow 上预训练的模型与仅在领域内数据上微调的模型。
实验结果
研究问题
- RQ1在像 wikiHow 这样大规模、多样化且多语言的教学语料上进行预训练,是否能提升少样本和零样本意图检测的性能?
- RQ2在低资源设置下,所提出的 wikiHow 预训练任务与标准的领域内微调相比表现如何?
- RQ3在预训练了 wikiHow 的模型能否泛化到包含超过 10 万个可能意图的开放领域意图检测任务中?
- RQ4当前意图检测基准的主要失败模式是什么?我们的模型能否处理模糊表达或依赖专有名词的语句?
主要发现
- 所提出的模型在 Snips、Schema-Guided Dialogue 和 Facebook 多语言意图检测数据集上均取得了最先进结果。
- 在所有数据集上,模型仅使用 100 个领域内训练样本即可实现超过 75% 的准确率,展示了强大的少样本泛化能力。
- 在零样本设置下,模型在 Snips 和 SGD 上无需任何领域内训练数据即可达到超过 70% 的准确率。
- 在包含 5,000 个 wikiHow 步骤的保留测试集上,使用 100 个候选目标进行排序时,模型的平均倒数排名(MRR)为 0.462,正确目标排第一的准确率为 36%。
- 错误分析显示,大多数误分类源于表达模糊、标签错误,或需要外部知识的专有名词。
- 本研究表明,当前的基准如 Snips 和 FB-en 可能过于简单,未来研究应聚焦于开放领域、低资源的意图检测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。