Skip to main content
QUICK REVIEW

[论文解读] A Survey of Intent Classification and Slot-Filling Datasets for Task-Oriented Dialog

Stefan Larson, Kevin Leach|arXiv (Cornell University)|Jul 26, 2022
Speech and dialogue systems被引用 9
一句话总结

本文全面综述了40个公开可用的用于任务导向对话系统意图分类与槽位填充的数据集。它记录了数据集的特征,评估了其优缺点,并主张开发更多元化、更真实、更具鲁棒性的基准,以提升模型在当前高性能但受限的数据集(如ATIS和Snips)之外的泛化能力。

ABSTRACT

Interest in dialog systems has grown substantially in the past decade. By extension, so too has interest in developing and improving intent classification and slot-filling models, which are two components that are commonly used in task-oriented dialog systems. Moreover, good evaluation benchmarks are important in helping to compare and analyze systems that incorporate such models. Unfortunately, much of the literature in the field is limited to analysis of relatively few benchmark datasets. In an effort to promote more robust analyses of task-oriented dialog systems, we have conducted a survey of publicly available datasets for the tasks of intent classification and slot-filling. We catalog the important characteristics of each dataset, and offer discussion on the applicability, strengths, and weaknesses of each. Our goal is that this survey aids in increasing the accessibility of these datasets, which we hope will enable their use in future evaluations of intent classification and slot-filling models for task-oriented dialog systems.

研究动机与目标

  • 解决任务导向对话系统中意图分类与槽位填充数据集缺乏全面、易访问的概述的问题。
  • 整理并分析40个公开可用的数据集,涵盖意图分类、槽位填充及联合建模任务。
  • 识别当前基准的局限性,例如对干净、标准数据的过拟合,以及缺乏真实场景下的多意图或噪声语句。
  • 鼓励未来开发更具鲁棒性、多样性和泛化能力的评估数据集,以支持模型评估。
  • 支持研究人员和开发者在选择合适数据集以基准化意图分类与槽位填充模型时做出决策。

提出的方法

  • 系统性地收集并分类40个公开可用的意图分类、槽位填充及联合建模数据集。
  • 基于关键属性(如数据集规模、语言、数据来源、领域、意图与槽位数量、标注质量)对数据集进行评估。
  • 分析数据集的来源,包括人工标注、合成数据及多轮对话数据源。
  • 比较文献中使用的评估指标,包括准确率、F1值以及基于标记级别的精确率/召回率。
  • 识别挑战,如数据泄露、对标准基准的过拟合,以及对噪声或改写输入的鲁棒性不足。
  • 利用众包和自动化方法生成挑战性数据集,以测试模型在标准基准之外的鲁棒性。

实验结果

研究问题

  • RQ1在所调查的40个意图分类与槽位填充数据集中,其关键特征与差异是什么?
  • RQ2ATIS和Snips等当前基准在数据质量、多样性及真实用户交互代表性方面如何比较?
  • RQ3现有数据集在支持模型鲁棒性评估与泛化方面存在哪些主要局限?
  • RQ4在噪声、改写或分布外测试集上,基于标准数据集训练的模型失败的程度如何?
  • RQ5未来数据集的设计应遵循哪些原则,以提升模型的鲁棒性与现实世界适用性?

主要发现

  • 在ATIS和Snips等标准基准上的模型性能已接近完美,表明这些任务可能已过拟合而非真正解决。
  • 许多数据集(如Snips和ATIS)在多意图语句的表示上存在局限,常采用简单的拼接方法,无法反映自然用户行为。
  • 通过众包和自动化数据增强技术(如改写、噪声注入)生成的测试集揭示了在干净数据上训练的模型性能显著下降,表明其对真实世界输入的泛化能力差。
  • 现有数据集在语言、领域和语句复杂性方面缺乏多样性,限制了其在评估鲁棒性与分布外泛化能力方面的有效性。
  • 亟需新的评估框架,包含真实、带噪声或改写的测试集,以更准确评估模型的可靠性。
  • 当前数据集存在标注不一致问题,且缺乏标准化工具用于验证正确性,凸显了提升语料质量保障的迫切需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。