Skip to main content
QUICK REVIEW

[论文解读] Effective Incorporation of Speaker Information in Utterance Encoding in Dialog

Tianyu Zhao, Tatsuya Kawahara|arXiv (Cornell University)|Jul 12, 2019
Speech and dialogue systems被引用 7
一句话总结

本文提出相对说话人建模方法,通过编码说话人关系(例如“与当前说话人相同”)而非绝对标签,以解决对话中说话人标注不一致的问题。在对话行为识别和响应生成任务上,该方法相较于绝对说话人建模展现出更优且更一致的性能,尤其在具有多样化说话人的非任务导向对话中表现更佳。

ABSTRACT

In dialog studies, we often encode a dialog using a hierarchical encoder where each utterance is converted into an utterance vector, and then a sequence of utterance vectors is converted into a dialog vector. Since knowing who produced which utterance is essential to understanding a dialog, conventional methods tried integrating speaker labels into utterance vectors. We found the method problematic in some cases where speaker annotations are inconsistent among different dialogs. A relative speaker modeling method is proposed to address the problem. Experimental evaluations on dialog act recognition and response generation show that the proposed method yields superior and more consistent performances.

研究动机与目标

  • 为解决在具有大量不同说话人的非任务导向语料中,对话内说话人标注不一致的问题。
  • 通过关系性地建模说话人角色而非绝对标签,改进对话编码,避免依赖固定说话人标签。
  • 在对话理解与生成任务中,系统性地比较绝对说话人建模与一种新颖的相对说话人建模方法。
  • 证明相对说话人建模在不同对话数据集上能实现更一致且更鲁棒的性能表现。

提出的方法

  • 提出一种相对说话人建模方法,通过二元指示符(1表示相同,0表示不同)编码当前话语的说话人是否与前一说话人相同。
  • 引入两个独立的话语编码器:一个用于当前说话人的话语,另一个用于其他说话人的话语,两者均基于说话人关系进行条件化。
  • 采用基于层次RNN的编码器结构,其中话语向量通过分别对自身说话人和其他说话人使用RNN计算,再通过门控机制进行融合。
  • 修改话语编码函数,引入说话人关系嵌入,替代话语编码器输入中的绝对说话人标签。
  • 使用共享的对话级RNN对话语向量序列进行编码,保留标准的层次化架构。
  • 该方法仅需对现有模型进行最小修改,仅需在话语编码器输入中将绝对说话人标签替换为说话人关系信号。

实验结果

研究问题

  • RQ1在非任务导向对话中,相对说话人建模是否相比绝对说话人建模能提升对话编码性能?
  • RQ2相对说话人建模能否缓解因对话会话间说话人标注不一致导致的性能下降?
  • RQ3所提出的方法在对话理解与生成任务中,是否能在不同说话人角色(如说话人A与B)之间实现更一致的性能表现?
  • RQ4在对话行为识别与响应生成任务中,相对说话人建模方法与无说话人信息的基线模型相比表现如何?

主要发现

  • 相对说话人建模方法在对话行为识别F1分数上相比基线模型实现了3.07%的绝对提升,优于绝对说话人建模和基线模型。
  • 在响应生成任务中,相对模型的BLEU-1得分为1447,SIF嵌入相似度为1.14,表明其在不同说话人角色间具有更好的一致性,优于绝对模型。
  • 相对模型的Distinct-1比率(1.14)和Distinct-2比率(1.19)更接近真实话语比率(1.29),而绝对模型的比率分别为1.12和1.16,表明其在多样性一致性方面表现更优。
  • 相对模型在对话行为识别与响应生成任务中,对不同说话人角色的性能表现更一致,说话人特定指标的方差更低。
  • 该方法在Switchboard和Cornell Movie Dialogs两个数据集上,于理解和生成任务中均优于绝对说话人建模,证明了其在多样化对话类型中的鲁棒性。
  • 相对说话人建模方法在仅做最小架构修改的情况下实现了显著性能提升,表明其具有高度实用性与良好的泛化潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。