Skip to main content
QUICK REVIEW

[论文解读] A Hierarchical Transformer with Speaker Modeling for Emotion Recognition in Conversation

Jiangnan Li, Zheng Lin|arXiv (Cornell University)|Dec 29, 2020
Sentiment Analysis and Opinion Mining参考文献 22被引用 10
一句话总结

该论文提出了一种带有说话人建模的分层Transformer(TRMSM),用于对话中的情感识别,将复杂的说话人间交互简化为二元的同说话人与跨说话人间依赖关系。通过在独立的Transformer模块中分别为常规注意力、同说话人注意力和跨说话人注意力设计三种专用掩码,并利用可学习注意力机制融合其输出,该模型在IEMOCAP和MELD数据集上实现了最先进性能,有效捕捉了长距离上下文信息与说话人感知信息。

ABSTRACT

Emotion Recognition in Conversation (ERC) is a more challenging task than conventional text emotion recognition. It can be regarded as a personalized and interactive emotion recognition task, which is supposed to consider not only the semantic information of text but also the influences from speakers. The current method models speakers' interactions by building a relation between every two speakers. However, this fine-grained but complicated modeling is computationally expensive, hard to extend, and can only consider local context. To address this problem, we simplify the complicated modeling to a binary version: Intra-Speaker and Inter-Speaker dependencies, without identifying every unique speaker for the targeted speaker. To better achieve the simplified interaction modeling of speakers in Transformer, which shows excellent ability to settle long-distance dependency, we design three types of masks and respectively utilize them in three independent Transformer blocks. The designed masks respectively model the conventional context modeling, Intra-Speaker dependency, and Inter-Speaker dependency. Furthermore, different speaker-aware information extracted by Transformer blocks diversely contributes to the prediction, and therefore we utilize the attention mechanism to automatically weight them. Experiments on two ERC datasets indicate that our model is efficacious to achieve better performance.

研究动机与目标

  • 为解决现有方法在建模对话中成对说话人间交互时存在的计算复杂度和可扩展性问题。
  • 将说话人间交互建模从细粒度关系简化为二元的同说话人与跨说话人间依赖结构,以提升泛化能力和可扩展性。
  • 通过自定义注意力掩码整合说话人感知依赖关系,实现在分层Transformer中对长距离上下文进行建模。
  • 利用注意力机制自动加权并融合多样化的说话人感知上下文表征,以提升情感预测性能。

提出的方法

  • 该模型采用两级分层Transformer结构:使用BERT在句子级别进行话语编码,使用对话级别Transformer进行上下文建模。
  • 设计了三种不同的掩码:常规掩码用于标准自注意力,同说话人掩码用于关注同一说话人的话语,跨说话人掩码用于集体关注所有其他说话人。
  • 每种掩码分别应用于对话级别的独立Transformer模块,以学习上下文依赖关系的不同表征。
  • 通过可学习注意力机制动态融合来自三个模块的说话人感知表征,以优先选择信息量丰富的特征用于情感分类。
  • 评估了其他融合策略(如加法和拼接)以证明基于注意力的融合方法的优越性。
  • 该模型在两个公开的ERC数据集(IEMOCAP和MELD)上进行端到端训练,并通过消融实验验证各组件的有效性。

实验结果

研究问题

  • RQ1将说话人间交互建模从成对关系简化为二元的同说话人与跨说话人间依赖结构,是否能提升ERC中的可扩展性和性能?
  • RQ2在分层Transformer中,专用注意力掩码是否能有效同时建模常规、同说话人和跨说话人间依赖关系?
  • RQ3基于注意力的说话人感知表征融合是否优于固定融合方法(如加法或拼接)?
  • RQ4随着上下文长度的增加,该模型的性能表现如何,尤其是在与仅限于局部上下文的模型对比时?
  • RQ5在多样的对话情境中,同说话人与跨说话人间依赖关系在情感预测中的贡献程度如何?

主要发现

  • 所提出的TRMSM模型在IEMOCAP和MELD两个数据集上均实现了最先进性能,优于先前方法(包括DialogueGCN)。
  • 消融实验表明,若移除常规掩码或跨说话人掩码,性能会显著下降,证实了三个组件的必要性。
  • 采用完整注意力融合机制(TRMSM-Att)的模型始终优于使用加法或拼接进行特征融合的模型,证明了可学习注意力的有效性。
  • 性能随上下文窗口长度增加而提升,且TRMSM-Att在使用完整上下文时仍优于DialogueGCN,表明其具备更优的长距离建模能力。
  • 案例研究证实,模型能正确识别出同说话人依赖关系(如持续的情感状态)或跨说话人依赖关系(如他人情感影响)在预测中的关键作用。
  • 在MELD数据集中,增加网络层数会导致稀有情感类别(恐惧、厌恶)出现过拟合,表明数据不平衡仍是需进一步研究的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。