Skip to main content
QUICK REVIEW

[论文解读] DialogueTRM: Exploring the Intra- and Inter-Modal Emotional Behaviors in the Conversation

Yuzhao Mao, Qi Sun|arXiv (Cornell University)|Oct 15, 2020
Language, Metaphor, and Cognition参考文献 23被引用 18
一句话总结

本文提出DialogueTRM,一种新颖的多模态Transformer架构,用于建模对话中模态内上下文偏好与模态间特征交互,实现情感识别。通过整合用于模态特异性上下文处理的分层Transformer与用于神经元级和向量级跨模态注意力的多粒度交互融合模块,DialogueTRM在三个基准数据集上达到最先进性能,显著优于先前方法。

ABSTRACT

Emotion Recognition in Conversations (ERC) is essential for building empathetic human-machine systems. Existing studies on ERC primarily focus on summarizing the context information in a conversation, however, ignoring the differentiated emotional behaviors within and across different modalities. Designing appropriate strategies that fit the differentiated multi-modal emotional behaviors can produce more accurate emotional predictions. Thus, we propose the DialogueTransformer to explore the differentiated emotional behaviors from the intra- and inter-modal perspectives. For intra-modal, we construct a novel Hierarchical Transformer that can easily switch between sequential and feed-forward structures according to the differentiated context preference within each modality. For inter-modal, we constitute a novel Multi-Grained Interactive Fusion that applies both neuron- and vector-grained feature interactions to learn the differentiated contributions across all modalities. Experimental results show that DialogueTRM outperforms the state-of-the-art by a significant margin on three benchmark datasets.

研究动机与目标

  • 为解决现有对话情感识别(ERC)模型忽视模态内与模态间差异化情感行为的问题。
  • 通过分层Transformer中的动态结构切换机制,建模模态特异性上下文偏好——即文本依赖上下文而视觉与语音模态为上下文无关。
  • 通过同时支持神经元粒度与向量粒度的特征交互,学习多模态融合中的模态特异性贡献。
  • 通过联合建模模态内时间依赖与模态间空间依赖,提升情感预测准确性。

提出的方法

  • 设计分层Transformer(HT),通过可学习注意力掩码,根据模态特异性上下文偏好在序列(上下文依赖)与前馈(上下文无关)结构间动态切换。
  • HT结合BERT与Transformer组件,实现对模态特异性表示的自适应上下文处理。
  • 提出多粒度交互融合(MGIF)模块,利用多模态门机制实现神经元粒度融合,对齐不同模态空间的特征。
  • MGIF采用Transformer编码器执行向量粒度融合,学习模态贡献的动态注意力权重。
  • 完整DialogueTRM模型整合HT与MGIF模块,联合优化模态内与模态间情感行为建模。
  • 模型在三个多模态ERC基准数据集上端到端训练,使用交叉熵损失并配合早停策略。

实验结果

研究问题

  • RQ1在单个模态(文本、语音、视觉)中,情感表达在多大程度上依赖于对话上下文?
  • RQ2在多模态情感识别中,建模模态特异性上下文偏好的最优结构设计是什么?
  • RQ3如何有效融合具有不同特征空间的多模态表示,以捕捉模态特异性贡献?
  • RQ4与单粒度或非交互式融合相比,多粒度(神经元级与向量级)融合在多大程度上提升了情感识别性能?

主要发现

  • DialogueTRM在三个基准数据集(IEMOCAP、MELD、DailyDialog)上达到最先进性能,显著优于先前最先进方法。
  • MGIF模块相比MulT实现F1分数提升3倍,证明多粒度融合的有效性。
  • 在上下文依赖设置下,文本模态表现显著更优;而在上下文无关设置下,视觉与语音模态表现最佳。
  • 消融实验证实,神经元粒度融合(通过多模态门)与向量粒度融合(通过Transformer)均不可或缺,且后者优于线性拼接。
  • 当仅使用文本时发生情感误分类的情况下,多模态融合可纠正高达85.41%的'neutral'与70.45%的'frustrated'预测,尤其在被中性语言掩盖的负面情感中表现突出。
  • 对于话语'yeah.',准确率从仅使用文本的43.48%提升至使用上下文时的65.22%,进一步提升至使用多模态特征时的73.91%,凸显多模态上下文的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。