Skip to main content
QUICK REVIEW

[论文解读] Speaker-Guided Encoder-Decoder Framework for Emotion Recognition in Conversation

Yinan Bao, Qianwen Ma|arXiv (Cornell University)|Jun 7, 2022
Speech Recognition and Synthesis被引用 6
一句话总结

本文提出了一种说话人引导的编码器-解码器(SGED)框架,用于对话中的情绪识别(ERC),通过一种新型的说话人状态编码器(SSE)联合建模动态的说话人内与说话人间依赖关系。该框架通过动态说话人状态引导解码器,提升了情绪预测性能,在三个基准数据集上实现了最先进性能,尤其在多人对话中表现突出。

ABSTRACT

The emotion recognition in conversation (ERC) task aims to predict the emotion label of an utterance in a conversation. Since the dependencies between speakers are complex and dynamic, which consist of intra- and inter-speaker dependencies, the modeling of speaker-specific information is a vital role in ERC. Although existing researchers have proposed various methods of speaker interaction modeling, they cannot explore dynamic intra- and inter-speaker dependencies jointly, leading to the insufficient comprehension of context and further hindering emotion prediction. To this end, we design a novel speaker modeling scheme that explores intra- and inter-speaker dependencies jointly in a dynamic manner. Besides, we propose a Speaker-Guided Encoder-Decoder (SGED) framework for ERC, which fully exploits speaker information for the decoding of emotion. We use different existing methods as the conversational context encoder of our framework, showing the high scalability and flexibility of the proposed framework. Experimental results demonstrate the superiority and effectiveness of SGED.

研究动机与目标

  • 为解决现有ERC模型在捕捉影响情绪表达的动态复杂说话人交互方面的局限性。
  • 在统一框架中联合建模动态的说话人内依赖性(情绪惯性)与说话人间依赖性(他人情绪影响)。
  • 设计一种灵活可扩展的框架,可与各种现有的对话上下文编码器集成用于ERC。
  • 通过使用动态说话人状态表示引导解码过程,提升情绪识别性能。

提出的方法

  • 提出一种模块化设计的说话人引导的编码器-解码器(SGED)框架:对话上下文编码器(CCE)与说话人状态编码器(SSE),随后是说话人引导的解码器(SGD)。
  • 提出一种新型的说话人状态编码器(SSE),通过循环状态更新动态建模说话人内依赖性(自我影响)与说话人间依赖性(他人影响)。
  • 利用SSE输出的说话人状态向量来条件化SGD模块中的解码过程,实现在每一步的上下文感知情绪预测。
  • 支持与多种现有CCE(如DialogueGCN、基于BERT的模型)集成,展现出高度的可扩展性与灵活性。
  • 在SSE中引入门控机制,自适应融合说话人特定历史与邻近说话人状态,实现动态表征学习。
  • 在三个基准数据集(EmoryNLP、IEMOCAP、MELD)上应用该框架,并通过消融实验验证各组件的贡献。

实验结果

研究问题

  • RQ1联合建模动态的说话人内与说话人间依赖关系是否能提升多轮对话中的情绪识别性能?
  • RQ2所提出的说话人引导解码器与使用静态说话人嵌入的标准解码方式相比表现如何?
  • RQ3在不同对话场景(如两人对话 vs. 多人对话)中,说话人内依赖与说话人间依赖的相对贡献如何?
  • RQ4所提出的说话人建模方案在多样化ERC基准上的性能提升程度如何?

主要发现

  • 所提出的SGED框架在三个基准数据集(EmoryNLP、IEMOCAP、MELD)上均实现了最先进性能。
  • 在MELD数据集上,SGED在多人对话中相比基线模型实现了1.28%的绝对性能提升,且在五人对话中提升最大。
  • 消融实验表明,若在SSE中移除说话人内或说话人间依赖,性能均出现显著下降,证实了两种依赖关系的互补性。
  • 当移除说话人引导解码器(SGD)时,性能在两人对话中下降1.23%,在多人对话中下降1.28%,表明SGD的贡献显著。
  • 当同时移除SSE与SGD两个组件时,完整SGED模型性能急剧下降,验证了所提说话人建模方案的有效性。
  • 错误分析显示,中性情绪常与非中性情绪(如快乐)混淆,且类似情绪(如快乐与惊讶)仍难以区分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。