Skip to main content
QUICK REVIEW

[论文解读] Multi-Task Learning with Auxiliary Speaker Identification for Conversational Emotion Recognition

Jingye Li, Meishan Zhang|arXiv (Cornell University)|Mar 3, 2020
Sentiment Analysis and Opinion Mining参考文献 25被引用 22
一句话总结

本文提出了一种多任务学习框架,将说话人识别(SI)作为辅助任务,通过 BERT 和分层双向 GRU 网络结合注意力与门控机制,共享表示以提升对话情感识别(CER)性能。该方法在 EmoryNLP 数据集(F1 提升 1.16%)和 MELD 数据集(F1 提升 0.59%)上取得了新的 SOTA 结果,通过增强说话人感知的上下文表示实现性能提升。

ABSTRACT

Conversational emotion recognition (CER) has attracted increasing interests in the natural language processing (NLP) community. Different from the vanilla emotion recognition, effective speaker-sensitive utterance representation is one major challenge for CER. In this paper, we exploit speaker identification (SI) as an auxiliary task to enhance the utterance representation in conversations. By this method, we can learn better speaker-aware contextual representations from the additional SI corpus. Experiments on two benchmark datasets demonstrate that the proposed architecture is highly effective for CER, obtaining new state-of-the-art results on two datasets.

研究动机与目标

  • 通过有效建模说话人敏感的话语表示,以提升对话情感识别(CER)性能。
  • 解决仅依赖情感标注数据学习说话人感知表示的局限性。
  • 探索大规模、未标注的对话语料(含说话人身份)在表示学习中的效用。
  • 探究将说话人识别(SI)作为辅助任务,通过多任务学习是否能提升 CER 性能。
  • 设计一种联合学习框架,实现在话语和对话层面,CER 与 SI 任务之间的相互作用。

提出的方法

  • 采用多任务学习(MTL)框架,联合训练 CER 与 SI,使用共享组件和任务特定组件。
  • 以 BERT 作为话语表示的上下文编码器基础,随后在话语和对话层级使用分层双向 GRU。
  • 引入注意力网络与门控机制,实现在话语和对话层级上 CER 与 SI 的完全交互。
  • 针对 SI 任务,从原始对话中构建二分类对,预测两句话是否来自同一说话人。
  • 利用大规模、未标注的对话数据进行 SI 预训练,以丰富说话人感知表示。
  • 通过共享编码器和任务特定头,统一两项任务,并利用交叉注意力与门控机制促进特征交换。

实验结果

研究问题

  • RQ1将说话人识别(SI)作为辅助任务,能否提升对话情感识别(CER)模型的性能?
  • RQ2在多任务学习中,SI 对增强对话中说话人感知上下文表示的有效性如何?
  • RQ3通过注意力与门控机制实现 CER 与 SI 之间的相互作用,是否能带来更好的情感识别效果?
  • RQ4MTL 在不同预训练词表示(如 GloVe、ELMo、BERT)上的性能增益有何差异?
  • RQ5所学习到的注意力模式在多大程度上反映了有意义的说话人相关和上下文相关的语句?

主要发现

  • 所提出的 MTL 框架,以 SI 作为辅助任务,在 EmoryNLP 和 MELD 两个数据集上均取得了新的 SOTA 性能。
  • 在 EmoryNLP 上,基于 BERT 的模型在 MTL 下达到 35.92% 的 F1,较基线(34.76%)提升 1.16%。
  • 在 MELD 上,MTL 增强的 BERT 模型达到 61.90% 的 F1,较基线(61.31%)提升 0.59%。
  • 所有设置下,MTL 的性能提升均具有统计显著性(p < 0.0001),包括使用 GloVe、ELMo 和 BERT 的情况。
  • 模型学会关注与说话人相关的词汇(如 'Phoebe'、'Rachel'),并连接来自同一说话人或目标说话人的语句,表明实现了有效的说话人感知表示学习。
  • 当基线模型本身较强时(如 BERT 对比 GloVe),性能增益逐渐减小,表明 MTL 在基线模型已较强时最具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。