Skip to main content
QUICK REVIEW

[论文解读] An Evaluation Dataset for Intent Classification and Out-of-Scope Prediction

Stefan Larson, Anish Mahendran|arXiv (Cornell University)|Sep 4, 2019
Topic Modeling被引用 4
一句话总结

本文提出一个新评估数据集,包含跨150个目标意图的23,700个查询,以及1,200个非目标意图查询,旨在评估任务导向对话系统中的意图分类与非目标意图检测能力。尽管在目标意图上的表现强劲(BERT准确率达96%),所有模型在非目标意图检测方面均表现不佳,最佳系统仅达到66%的召回率,凸显当前NLP基准在该方面存在显著差距。

ABSTRACT

Task-oriented dialog systems need to know when a query falls outside their range of supported intents, but current text classification corpora only define label sets that cover every example. We introduce a new dataset that includes queries that are out-of-scope---i.e., queries that do not fall into any of the system's supported intents. This poses a new challenge because models cannot assume that every query at inference time belongs to a system-supported intent class. Our dataset also covers 150 intent classes over 10 domains, capturing the breadth that a production task-oriented agent must handle. We evaluate a range of benchmark classifiers on our dataset along with several different out-of-scope identification schemes. We find that while the classifiers perform well on in-scope intent classification, they struggle to identify out-of-scope queries. Our dataset and evaluation fill an important gap in the field, offering a way of more rigorously and realistically benchmarking text classification in task-driven dialog systems.

研究动机与目标

  • 为解决任务导向对话系统中非目标意图查询检测缺乏真实评估的问题。
  • 创建一个大规模、多样化的数据集,包含目标意图与非目标意图查询,以反映真实用户行为。
  • 在包含模糊、离题查询的真实基准上,评估现有分类器与非目标意图检测方法。
  • 证明即使最先进的模型(如BERT)在目标意图分类上表现优异,但在非目标意图检测上仍表现欠佳。
  • 提供一个标准化、公开可用的数据集,以支持对话系统鲁棒性更严格、更真实的基准测试。

提出的方法

  • 通过众包方式,利用界定范围、改写和基于场景的任务,生成跨10个领域的150个意图类别的22,500个目标意图查询。
  • 额外收集了1,200个非目标意图查询,以代表系统能力范围外的真实用户输入。
  • 数据集包含短句、非结构化、自然语言查询,风格与虚拟助手的真实用户交互高度相似。
  • 在目标意图分类与非目标意图检测两个任务上,评估了一系列基准分类器(如FastText、SVM、CNN、MLP、BERT)。
  • 非目标意图检测采用二分类任务(目标意图 vs. 非目标意图),并进行了数据增强与类别平衡的消融实验。
  • 数据集已通过 https://github.com/clinc/oos-eval 公开发布,以支持可复现研究与未来基准测试。

实验结果

研究问题

  • RQ1当在本研究的新数据集上进行训练时,最先进分类器在目标意图分类上的表现如何?
  • RQ2现有模型在检测与目标意图在风格和主题上相似的非目标意图查询方面,能力达到何种程度?
  • RQ3非目标意图训练数据的可用性在多大程度上影响模型在非目标意图检测上的表现?
  • RQ4不同模型架构与数据增强策略下,非目标意图检测的性能表现如何变化?
  • RQ5现有基准数据集能否充分支持现实世界对话系统中非目标意图处理的评估?

主要发现

  • BERT在目标意图分类任务中表现最佳,即使在低数据量与类别不平衡设置下,准确率仍超过96%。
  • 所有模型在非目标意图检测任务上均表现出显著性能下降,最佳系统在非目标意图类别的召回率仅为66%。
  • 增加非目标意图训练样本数量可提升检测性能,但增益有限,表明模型在分布外泛化方面存在固有困难。
  • 使用维基百科句子进行数据增强可提升部分模型的非目标意图检测性能,但因计算资源限制,对其他模型不可行。
  • 该数据集揭示,当前基准未能捕捉现实世界非目标意图查询的挑战,而这类查询在实际中极为常见,且对系统鲁棒性至关重要。
  • 本研究揭示了当前NLP评估中的关键差距:模型在已知类别上表现优异,但在面对语义与风格与目标意图相似的未见非目标意图输入时,却表现失败。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。