Skip to main content
QUICK REVIEW

[论文解读] Deep Unknown Intent Detection with Margin Loss

Ting-En Lin, Hua Xu|arXiv (Cornell University)|Jun 2, 2019
Anomaly Detection Techniques and Applications参考文献 20被引用 7
一句话总结

本文提出一种两阶段深度学习方法,用于对话系统中的未知意图检测,采用带有大边缘余弦损失(LMCL)的BiLSTM学习判别性意图特征,并利用局部离群点因子(LOF)进行新颖性检测。该方法在基线模型上实现一致性能提升,在SNIPS数据集上已知意图占比50%的设置下,宏F1得分提升16.2%。

ABSTRACT

Identifying the unknown (novel) user intents that have never appeared in the training set is a challenging task in the dialogue system. In this paper, we present a two-stage method for detecting unknown intents. We use bidirectional long short-term memory (BiLSTM) network with the margin loss as the feature extractor. With margin loss, we can learn discriminative deep features by forcing the network to maximize inter-class variance and to minimize intra-class variance. Then, we feed the feature vectors to the density-based novelty detection algorithm, local outlier factor (LOF), to detect unknown intents. Experiments on two benchmark datasets show that our method can yield consistent improvements compared with the baseline methods.

研究动机与目标

  • 解决对话系统中训练数据未包含的未知用户意图检测挑战。
  • 克服现有方法依赖域外数据或对抗生成的局限性,这些方法在离散文本空间中常失效。
  • 通过建模语义紧凑性和分离性,利用已知意图标签提升未知意图的检测能力。
  • 通过将标准Softmax损失替换为边缘损失,改进新颖性检测的特征表示,以增强类间分离性和类内紧凑性。
  • 构建一种鲁棒的端到端框架,适用于具有不同意图分布的真实世界对话数据集。

提出的方法

  • 使用双向LSTM(BiLSTM)作为特征提取器,将话语编码为密集向量表示。
  • 将标准Softmax损失替换为大边缘余弦损失(LMCL),以最大化嵌入空间中类间的角间距,并最小化类内方差。
  • 通过优化特征向量与类别中心之间的余弦相似度来应用LMCL,其中边缘超参数m=0.35,缩放因子s=30。
  • 将所得的判别性特征输入局部离群点因子(LOF)算法,实现基于密度的新颖性检测。
  • 使用宏F1得分作为评估指标,通过加权随机采样选择已知意图,以保持训练数据中的类别不平衡。
  • 使用早停策略训练BiLSTM-LMCL模型200个周期,采用预训练的GloVe词嵌入。

实验结果

研究问题

  • RQ1与标准Softmax损失相比,边缘损失是否能提升深度特征学习在未知意图检测中的性能?
  • RQ2BiLSTM结合LMCL与LOF的组合在多种对话数据集上检测未知意图的有效性如何?
  • RQ3该方法在已知意图比例变化(25%、50%、75%)下是否具有良好泛化能力?
  • RQ4在已知意图之间语义相似度较高的数据集(如ATIS)上,该方法表现如何?
  • RQ5所提方法是否能超越SOTA开放世界分类基线方法(如DOC和MSP)?

主要发现

  • 在SNIPS数据集上,当50%的类别作为已知意图时,所提方法相比DOC基线在宏F1得分上提升16.2%。
  • 在ATIS数据集上,随着已知意图数量的增加,性能显著下降,原因在于意图之间存在高度语义相似性(如flight与flight_no)。
  • 该方法优于LOF(Softmax)这一使用标准Softmax损失的变体,证明LMCL在学习紧凑且可分特征方面的优越性。
  • t-SNE可视化结果表明,与Softmax损失相比,LMCL生成的特征具有更强的类内紧凑性和类间分离性。
  • 在SNIPS数据集上,该方法在所有已知意图比例(25%、50%、75%)下均表现出一致的性能提升,表明对训练数据组成变化具有鲁棒性。
  • 即使未知意图与已知意图语义接近,该方法仍具有效性,得益于边缘损失带来的增强特征判别能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。