Skip to main content
QUICK REVIEW

[论文解读] Attention-Augmented End-to-End Multi-Task Learning for Emotion Prediction from Speech

Zixing Zhang, Bingwen Wu|arXiv (Cornell University)|Mar 29, 2019
Emotion and Mood Recognition参考文献 25被引用 8
一句话总结

本文提出了一种基于自注意力机制的端到端多任务学习框架,用于语音情感预测,联合训练唤醒度、愉悦度和支配度三个维度。通过整合辅助任务和注意力机制,模型提升了表征的鲁棒性以及任务特定的特征加权,相较于基线模型在IEMOCAP数据集上取得了显著的性能提升,尤其在愉悦度和支配度预测方面表现突出。

ABSTRACT

Despite the increasing research interest in end-to-end learning systems for speech emotion recognition, conventional systems either suffer from the overfitting due in part to the limited training data, or do not explicitly consider the different contributions of automatically learnt representations for a specific task. In this contribution, we propose a novel end-to-end framework which is enhanced by learning other auxiliary tasks and an attention mechanism. That is, we jointly train an end-to-end network with several different but related emotion prediction tasks, i.e., arousal, valence, and dominance predictions, to extract more robust representations shared among various tasks than traditional systems with the hope that it is able to relieve the overfitting problem. Meanwhile, an attention layer is implemented on top of the layers for each task, with the aim to capture the contribution distribution of different segment parts for each individual task. To evaluate the effectiveness of the proposed system, we conducted a set of experiments on the widely used database IEMOCAP. The empirical results show that the proposed systems significantly outperform corresponding baseline systems.

研究动机与目标

  • 为解决因训练数据有限导致的端到端语音情感识别中过拟合问题。
  • 通过多任务学习联合学习多个情感维度(唤醒度、愉悦度、支配度),提升表征鲁棒性。
  • 通过集成自注意力机制,动态加权相关话语片段,提升任务特定特征的重要性。
  • 评估在端到端框架中结合多任务学习与注意力机制在语音情感预测中的有效性。

提出的方法

  • 该框架采用深层神经网络,通过共享编码器层提取三个情感维度(唤醒度、愉悦度、支配度)的联合表征。
  • 通过在训练过程中联合优化所有三个情感预测头的损失函数,应用多任务学习以提升泛化能力。
  • 在每个任务特定的头之上添加注意力机制,以学习输入话语片段在时间维度上的动态重要性权重。
  • 模型在原始语音信号上进行端到端训练,无需人工设计特征,采用1D-CNN与LSTM架构进行序列建模。
  • 注意力权重通过缩放点积注意力机制计算,使网络能够针对每个情感任务聚焦于显著的语段。
  • 实验在IEMOCAP数据集上进行,以UAR(未加权平均召回率)为主要评估指标。

实验结果

研究问题

  • RQ1联合学习多个情感维度(唤醒度、愉悦度、支配度)是否能提升表征鲁棒性并减少端到端语音情感识别中的过拟合?
  • RQ2集成注意力机制是否通过使模型聚焦于任务特定的显著语音片段而提升性能?
  • RQ3不同情感预测任务的注意力权重有何差异?它们是否与已知的情感声学相关特征一致?
  • RQ4所提出的端到端多任务学习结合注意力机制是否优于单任务端到端模型以及使用人工特征的传统系统?

主要发现

  • 所提出的注意力增强型端到端多任务学习系统在唤醒度预测中达到48.5% UAR,显著优于基线端到端系统(45.1% UAR,p值 < 0.05)。
  • 在愉悦度预测中,系统达到63.8% UAR,显著优于基线端到端模型(60.9% UAR)。
  • 多任务学习与注意力机制的结合在六项评估中的五项中表现最佳,证明了其互补优势。
  • 注意力权重在不同任务间存在显著差异:唤醒度关注高能量段,愉悦度关注低能量段,支配度关注高能量区域,与已知的声学相关特征一致。
  • 尽管性能有所提升,但该模型在唤醒度预测上仍逊于人工特征系统,表明传统特征可能更擅长捕捉简单的唤醒度模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。