Skip to main content
QUICK REVIEW

[论文解读] Sequential Dialogue Context Modeling for Spoken Language Understanding

Ankur Bapna, Gökhan Tür|arXiv (Cornell University)|May 8, 2017
Topic Modeling被引用 6
一句话总结

本文提出顺序对话编码器网络(SDEN),一种循环神经网络架构,通过按时间顺序建模对话上下文以提升语音语言理解(SLU)性能。通过按顺序编码多轮对话历史,SDEN在使用重组的多领域对话进行训练以提升泛化能力时,相比仅使用前一轮或基于注意力的记忆网络模型,显著降低了语义帧错误率。

ABSTRACT

Spoken Language Understanding (SLU) is a key component of goal oriented dialogue systems that would parse user utterances into semantic frame representations. Traditionally SLU does not utilize the dialogue history beyond the previous system turn and contextual ambiguities are resolved by the downstream components. In this paper, we explore novel approaches for modeling dialogue context in a recurrent neural network (RNN) based language understanding system. We propose the Sequential Dialogue Encoder Network, that allows encoding context from the dialogue history in chronological order. We compare the performance of our proposed architecture with two context models, one that uses just the previous turn context and another that encodes dialogue context in a memory network, but loses the order of utterances in the dialogue history. Experiments with a multi-domain dialogue dataset demonstrate that the proposed architecture results in reduced semantic frame error rates.

研究动机与目标

  • 解决现有SLU系统仅依赖前一系统轮次作为上下文所导致的未解决歧义问题。
  • 通过使用RNN以序列化、时间顺序的方式建模对话上下文,提升语音语言理解性能。
  • 通过利用更丰富的对话历史,降低多领域、多轮目标导向对话中的语义帧错误率。
  • 开发一种数据增强技术——对话重组,以在训练期间模拟复杂、混合领域对话。
  • 评估序列化上下文建模是否在真实世界SLU任务中优于基于注意力的记忆网络和单轮上下文模型。

提出的方法

  • 提出顺序对话编码器网络(SDEN),作为HRED的扩展,将查询级编码与当前话语表示结合后进行会话级编码。
  • 采用分层RNN架构,按顺序编码话语,保留对话历史的时间顺序。
  • 使用基于余弦相似度的注意力机制的记忆网络,将当前话语与历史话语进行比较,但不保留话语的顺序。
  • 应用对话重组技术,将单领域对话合并为多领域会话,以增加训练数据的复杂性和话语轮次长度。
  • 使用基于RNN的标记头在多领域对话数据集上联合训练意图、领域和槽位分类。
  • 通过帧错误率(FER)评估性能,并分析注意力分布以解释模型在歧义话语上的行为。

实验结果

研究问题

  • RQ1与仅使用前一轮对话的模型相比,按时间顺序建模对话上下文是否能提升语音语言理解性能?
  • RQ2在多领域对话中,基于RNN的序列化上下文编码器是否优于丢失话语顺序的基于注意力的记忆网络?
  • RQ3通过对话重组实现的数据增强如何影响模型在复杂、混合领域测试集上的泛化能力和性能表现?
  • RQ4在低资源场景下,模型架构的复杂性在多大程度上影响从合成上下文中获得的收益?
  • RQ5当多个历史话语提供互补信息时,序列化上下文建模是否能更有效地解决用户话语的歧义?

主要发现

  • 在重组对话上进行训练时,顺序对话编码器网络(SDEN)在帧错误率方面优于仅使用前一轮上下文的模型和记忆网络。
  • SDEN在具有更长、混合领域对话的测试集上表现最佳,表明其对真实世界对话复杂性的泛化能力更强。
  • 记忆网络在无对话重组时表现最佳,但当上下文更复杂时性能显著下降,表明其在多领域设置中泛化能力差。
  • 对话重组显著提升了模型性能,尤其对SDEN等复杂架构而言,通过增加训练数据的多样性与话语轮次长度实现。
  • 注意力可视化显示,SDEN能有效聚焦于最相关的近期话语,而记忆网络则表现出分散的注意力,表明其对上下文的利用不够精确。
  • 在无重组的情况下,SDEN在低资源场景下无法泛化,凸显其因参数量更大和架构更复杂而易受过拟合影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。