[论文解读] DialogueTRM: Exploring the Intra- and Inter-Modal Emotional Behaviors in the Conversation
本文提出DialogueTRM,一种新颖的多模态Transformer架构,用于建模对话中模态内上下文偏好与模态间特征交互,实现情感识别。通过整合用于模态特异性上下文处理的分层Transformer与用于神经元级和向量级跨模态注意力的多粒度交互融合模块,DialogueTRM在三个基准数据集上达到最先进性能,显著优于先前方法。
Emotion Recognition in Conversations (ERC) is essential for building empathetic human-machine systems. Existing studies on ERC primarily focus on summarizing the context information in a conversation, however, ignoring the differentiated emotional behaviors within and across different modalities. Designing appropriate strategies that fit the differentiated multi-modal emotional behaviors can produce more accurate emotional predictions. Thus, we propose the DialogueTransformer to explore the differentiated emotional behaviors from the intra- and inter-modal perspectives. For intra-modal, we construct a novel Hierarchical Transformer that can easily switch between sequential and feed-forward structures according to the differentiated context preference within each modality. For inter-modal, we constitute a novel Multi-Grained Interactive Fusion that applies both neuron- and vector-grained feature interactions to learn the differentiated contributions across all modalities. Experimental results show that DialogueTRM outperforms the state-of-the-art by a significant margin on three benchmark datasets.
研究动机与目标
- 为解决现有对话情感识别(ERC)模型忽视模态内与模态间差异化情感行为的问题。
- 通过分层Transformer中的动态结构切换机制,建模模态特异性上下文偏好——即文本依赖上下文而视觉与语音模态为上下文无关。
- 通过同时支持神经元粒度与向量粒度的特征交互,学习多模态融合中的模态特异性贡献。
- 通过联合建模模态内时间依赖与模态间空间依赖,提升情感预测准确性。
提出的方法
- 设计分层Transformer(HT),通过可学习注意力掩码,根据模态特异性上下文偏好在序列(上下文依赖)与前馈(上下文无关)结构间动态切换。
- HT结合BERT与Transformer组件,实现对模态特异性表示的自适应上下文处理。
- 提出多粒度交互融合(MGIF)模块,利用多模态门机制实现神经元粒度融合,对齐不同模态空间的特征。
- MGIF采用Transformer编码器执行向量粒度融合,学习模态贡献的动态注意力权重。
- 完整DialogueTRM模型整合HT与MGIF模块,联合优化模态内与模态间情感行为建模。
- 模型在三个多模态ERC基准数据集上端到端训练,使用交叉熵损失并配合早停策略。
实验结果
研究问题
- RQ1在单个模态(文本、语音、视觉)中,情感表达在多大程度上依赖于对话上下文?
- RQ2在多模态情感识别中,建模模态特异性上下文偏好的最优结构设计是什么?
- RQ3如何有效融合具有不同特征空间的多模态表示,以捕捉模态特异性贡献?
- RQ4与单粒度或非交互式融合相比,多粒度(神经元级与向量级)融合在多大程度上提升了情感识别性能?
主要发现
- DialogueTRM在三个基准数据集(IEMOCAP、MELD、DailyDialog)上达到最先进性能,显著优于先前最先进方法。
- MGIF模块相比MulT实现F1分数提升3倍,证明多粒度融合的有效性。
- 在上下文依赖设置下,文本模态表现显著更优;而在上下文无关设置下,视觉与语音模态表现最佳。
- 消融实验证实,神经元粒度融合(通过多模态门)与向量粒度融合(通过Transformer)均不可或缺,且后者优于线性拼接。
- 当仅使用文本时发生情感误分类的情况下,多模态融合可纠正高达85.41%的'neutral'与70.45%的'frustrated'预测,尤其在被中性语言掩盖的负面情感中表现突出。
- 对于话语'yeah.',准确率从仅使用文本的43.48%提升至使用上下文时的65.22%,进一步提升至使用多模态特征时的73.91%,凸显多模态上下文的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。