Skip to main content
QUICK REVIEW

[论文解读] Guiding attention in Sequence-to-sequence models for Dialogue Act prediction

Pierre Colombo, Émile Chapuis|arXiv (Cornell University)|Feb 20, 2020
Topic Modeling参考文献 25被引用 7
一句话总结

该论文提出一种具有分层编码器和新型引导注意力机制的序列到序列模型,用于对话行为(DA)预测,通过建模全局标签依赖关系,超越了先前方法。该方法在SwDA上达到85%的准确率,在MRDA上达到91.6%,在无需手工特征或CRF后处理的情况下,通过端到端训练结合束搜索和序列级微调,取得了新的最先进结果。

ABSTRACT

The task of predicting dialog acts (DA) based on conversational dialog is a key component in the development of conversational agents. Accurately predicting DAs requires a precise modeling of both the conversation and the global tag dependencies. We leverage seq2seq approaches widely adopted in Neural Machine Translation (NMT) to improve the modelling of tag sequentiality. Seq2seq models are known to learn complex global dependencies while currently proposed approaches using linear conditional random fields (CRF) only model local tag dependencies. In this work, we introduce a seq2seq model tailored for DA classification using: a hierarchical encoder, a novel guided attention mechanism and beam search applied to both training and inference. Compared to the state of the art our model does not require handcrafted features and is trained end-to-end. Furthermore, the proposed approach achieves an unmatched accuracy score of 85% on SwDA, and state-of-the-art accuracy score of 91.6% on MRDA.

研究动机与目标

  • 解决当前DA分类模型仅通过线性CRF捕捉局部依赖关系的局限性。
  • 通过受神经机器翻译启发的序列到序列框架,建模对话行为中的全局序列依赖关系。
  • 通过利用分层编码和新型引导注意力机制,提升DA分类准确率。
  • 通过端到端训练消除对手工特征的依赖。
  • 评估束搜索和序列级微调在提升预测性能方面的有效性。

提出的方法

  • 使用分层GRU编码器建模话语级和对话级表征。
  • 引入一种硬性引导注意力机制,通过预测标签位置约束注意力,使其聚焦于相关话语。
  • 在训练和推理过程中均应用束搜索,以探索多种解码路径。
  • 采用序列级损失函数对模型进行微调,以优化完整序列的准确率。
  • 端到端训练模型,无需任何手工特征或后处理CRF层。
  • 采用标准编码器-解码器架构,使用GRU单元和注意力机制,并针对DA序列生成进行适配。

实验结果

研究问题

  • RQ1序列到序列模型能否有效捕捉对话行为序列中的长距离依赖关系,超越局部标签转移?
  • RQ2与标准注意力相比,引导注意力在输入话语与预测对话行为之间的对齐效果如何提升?
  • RQ3在训练和推理过程中使用束搜索是否显著提升DA预测的序列级准确率?
  • RQ4与标准交叉熵训练相比,使用序列级损失的端到端训练能否在此序列标注任务中表现更优?
  • RQ5与依赖CRF后处理的最先进模型相比,所提模型表现如何?

主要发现

  • 所提出的序列到序列模型在SwDA上达到85%的准确率,比之前最先进方法(82.9%)高出2.1个百分点。
  • 在MRDA数据集上,模型准确率达到91.6%,与先前工作中报告的最佳结果持平或更优。
  • 硬性引导注意力机制在各类注意力变体中表现最佳,提升了标签对齐效果并减少了预测错误。
  • 通过序列级损失进行微调,SwDA准确率提升1.0%(从84.0%提升至85.0%),MRDA提升1.2%(从90.4%提升至91.6%)。
  • 训练过程中使用束搜索的性能优于仅在推理时使用束搜索,训练阶段最优束大小为2(SwDA)和5(MRDA)。
  • 该模型在无需手工特征或CRF后处理的情况下达到最先进结果,证明了结合引导注意力的端到端学习的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。