Skip to main content
QUICK REVIEW

[论文解读] Automatic Discovery of Novel Intents & Domains from Text Utterances

Nikhita Vedula, Rahul Gupta|arXiv (Cornell University)|May 22, 2020
Topic Modeling参考文献 45被引用 12
一句话总结

ADVIN 是一种新颖的三阶段框架,通过首先利用开放分类识别包含未见意图的语句,然后利用带有成对边缘损失的知识迁移组件对这些语句进行聚类以形成潜在意图类别,最后通过分层聚类将相关意图整合为新领域,从而在无标签文本中自动发现新颖意图和领域。该方法在基准数据和真实世界数据上显著优于基线模型,仅需极少监督即可实现最先进性能。

ABSTRACT

One of the primary tasks in Natural Language Understanding (NLU) is to recognize the intents as well as domains of users' spoken and written language utterances. Most existing research formulates this as a supervised classification problem with a closed-world assumption, i.e. the domains or intents to be identified are pre-defined or known beforehand. Real-world applications however increasingly encounter dynamic, rapidly evolving environments with newly emerging intents and domains, about which no information is known during model training. We propose a novel framework, ADVIN, to automatically discover novel domains and intents from large volumes of unlabeled data. We first employ an open classification model to identify all utterances potentially consisting of a novel intent. Next, we build a knowledge transfer component with a pairwise margin loss function. It learns discriminative deep features to group together utterances and discover multiple latent intent categories within them in an unsupervised manner. We finally hierarchically link mutually related intents into domains, forming an intent-domain taxonomy. ADVIN significantly outperforms baselines on three benchmark datasets, and real user utterances from a commercial voice-powered agent.

研究动机与目标

  • 为解决现有 NLU 系统中封闭世界意图和领域检测的局限性,即需要预定义标签且无法适应新兴用户请求。
  • 实现在大规模无标签对话数据中自动发现新颖意图和领域,且无需事先了解新类别。
  • 开发一种通用且可扩展的框架,适用于多样化领域,且不依赖于训练数据分布。
  • 通过成对约束引入有限人类监督,提升聚类质量。

提出的方法

  • ADVIN 使用基于 BERT 的开放分类方法检测可能包含新颖意图的语句,将其与已知类别区分开来。
  • 采用带有成对边缘损失函数的知识迁移组件,学习具有判别性的深度特征,以最大化不同意图之间的差异性并最小化同一意图内部的差异性。
  • 在语句对上应用对比学习,以无监督方式发现潜在意图聚类。
  • 利用分层聚类将语义相关的新型意图聚合成一致的领域,构建新颖的意图-领域分类体系。
  • 在聚类过程中通过必须链接(must-link)和不能链接(cannot-link)约束整合有限监督,以最小的人工输入提升聚类准确率。
  • 整个流程端到端可训练,设计为领域无关,且可扩展至真实世界动态 NLU 应用。

实验结果

研究问题

  • RQ1框架是否能在不了解这些意图的前提下,自动检测出包含新颖意图的语句?
  • RQ2基于对比学习的方法在无监督条件下,发现无标签数据中潜在意图聚类的效率如何?
  • RQ3分层聚类在多大程度上能将发现的意图整合为有意义且语义一致的领域?
  • RQ4通过成对约束引入的有限人类监督在多大程度上提升了所发现意图和领域的质量?
  • RQ5该框架是否能在多样化领域中实现泛化,并在基准数据和真实世界数据上均优于现有最先进方法?

主要发现

  • 在 SNIPS Set 1 上,ADVIN 的归一化互信息(NMI)得分为 0.82,在 ATIS Set 1 上为 0.74,显著优于无监督基线方法。
  • 在内部数据集上,ADVIN 发现了 45 个新颖意图类别(全监督方法为 56 个),纯度(purity)为 0.75,F1 得分为 0.65。
  • 在数据集中添加有限监督(3 组,每组包含 4 个 must-link 和 cannot-link 约束)后,F1 得分在各数据集上提升了 2%–8%,证明了最小人类反馈的有效性。
  • 在 2,500 个 FTOP 和 1,100 个内部语句对上的人工评估显示,'ADVIN (pair+hier)' 在 F1 得分上比所有基线方法至少高出 5%,且标注者间一致性高(Cohen’s κ = 0.78 和 0.9)。
  • ADVIN 构建的意图-领域分类体系在语义上比数据集原始标注更合理,后者是基于业务目标而非语义相似性。
  • 该框架在第二个内部数据集上成功发现了 82 个新颖意图类别,表明其在大规模真实对话数据上的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。