Skip to main content
QUICK REVIEW

[论文解读] A Bi-model based RNN Semantic Frame Parsing Model for Intent Detection and Slot Filling

Yu Wang, Yilin Shen|arXiv (Cornell University)|Dec 26, 2018
Topic Modeling参考文献 19被引用 12
一句话总结

本文提出了一种新颖的双模型RNN架构,通过使用两个相关联的双向LSTM联合建模意图检测与槽位填充,实现跨任务影响以提升性能。该方法在ATIS基准测试中达到最先进水平,意图准确率提升0.5%(达96.89%),槽位F1得分提升0.9%(达98.99%),优于现有联合模型及先前最先进方法。

ABSTRACT

Intent detection and slot filling are two main tasks for building a spoken language understanding(SLU) system. Multiple deep learning based models have demonstrated good results on these tasks . The most effective algorithms are based on the structures of sequence to sequence models (or "encoder-decoder" models), and generate the intents and semantic tags either using separate models or a joint model. Most of the previous studies, however, either treat the intent detection and slot filling as two separate parallel tasks, or use a sequence to sequence model to generate both semantic tags and intent. Most of these approaches use one (joint) NN based model (including encoder-decoder structure) to model two tasks, hence may not fully take advantage of the cross-impact between them. In this paper, new Bi-model based RNN semantic frame parsing network structures are designed to perform the intent detection and slot filling tasks jointly, by considering their cross-impact to each other using two correlated bidirectional LSTMs (BLSTM). Our Bi-model structure with a decoder achieves state-of-the-art result on the benchmark ATIS data, with about 0.5$\%$ intent accuracy improvement and 0.9 $\%$ slot filling improvement.

研究动机与目标

  • 为解决将意图检测与槽位填充视为独立任务,或使用单一联合模型可能无法充分挖掘其相互影响的局限性。
  • 设计一种双模型架构,通过两个相关联的双向LSTM显式建模意图检测与槽位填充之间的相互依赖性。
  • 在基准数据集(ATIS)和真实世界多领域数据集上评估所提模型,以证明其泛化能力与性能提升。
  • 比较在双模型结构中使用解码器与无解码器结构的性能差异。

提出的方法

  • 该模型采用两个独立的双向LSTM网络:一个用于意图检测,一个用于槽位填充,实现任务特定的表征学习,同时共享上下文信息。
  • 在其中一个双向LSTM分支中集成了解码器,以顺序生成槽位标签,支持可变长度输出并提升对齐效果。
  • 两个网络采用异步训练方式,通过交叉注意力或拼接机制使每个网络能够从另一个网络的隐藏表征中获益。
  • 架构采用共享编码器处理输入话语,随后通过任务特定的分类头实现意图分类与槽位标注。
  • 模型通过交叉熵损失(用于意图)和CRF或交叉熵损失(用于槽位标注)进行端到端联合训练,实现联合优化。
  • 双模型结构支持联合训练与推理,能够捕捉跨任务依赖关系,而无需强制引入单一编码器-解码器瓶颈。

实验结果

研究问题

  • RQ1是否一种显式建模意图检测与槽位填充之间相互影响的双模型RNN架构,能在基准SLU任务上超越现有单模型或联合模型方法?
  • RQ2在双模型结构中引入解码器是否能显著提升意图准确率与槽位F1得分,相较于无解码器的变体?
  • RQ3与基于注意力的BiRNN等最先进联合模型相比,所提出的双模型在真实世界多领域SLU数据上的表现如何?
  • RQ4性能提升幅度(如F1得分相对提升22.63%)在多大程度上能合理化模型复杂度的增加?
  • RQ5双模型方法是否比某些联合模型更具鲁棒性,避免在优化某一任务时损害另一任务的性能?

主要发现

  • 带有解码器的双模型在ATIS基准测试中达到最先进性能,意图准确率达到96.89%,槽位F1得分为98.99%,优于先前最先进模型。
  • 不带解码器的双模型也取得了强劲结果,意图准确率为96.65%,F1得分为98.76%,表明即使无解码器,显式建模跨任务依赖性仍能提升性能。
  • 在多领域数据集上,带有解码器的双模型在所有领域(电影、餐饮、家庭)中,意图准确率至少提升0.5个百分点,F1得分提升1至3个百分点。
  • 意图准确率的相对提升为35.7%(从14例误分类减少至9例),F1得分的相对提升为22.63%,表明尽管绝对提升较小,但实际增益显著。
  • 在ATIS和多领域数据上,带有解码器的模型始终优于无解码器的模型,证实序列到序列生成对槽位填充具有实际益处。
  • 双模型方法避免了某些联合模型中常见的性能下降问题,即在优化某一任务时损害另一任务的性能,通过提供独立但相关联的学习路径实现更稳健的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。