Skip to main content
QUICK REVIEW

[论文解读] Multimodal Continuous Emotion Recognition using Deep Multi-Task Learning with Correlation Loss

Berkay Köprü, Engin Erzin|arXiv (Cornell University)|Nov 2, 2020
Emotion and Mood Recognition被引用 5
一句话总结

该论文提出了一种用于语音和身体动作信号的多模态深度多任务学习框架,以预测激活度(Activation)、效价(Valence)和支配度(Dominance)(AVD)。通过结合原始特征与提取特征的早期融合、多任务学习以及基于相关性的损失函数(CCC 和 PCC),该模型在性能上实现了显著提升——尤其在效价预测上较单任务学习和 MSE 损失基线提升了 6% 的 CCC,在 RECOLA 数据集上更是提升了 13%以上。

ABSTRACT

In this study, we focus on continuous emotion recognition using body motion and speech signals to estimate Activation, Valence, and Dominance (AVD) attributes. Semi-End-To-End network architecture is proposed where both extracted features and raw signals are fed, and this network is trained using multi-task learning (MTL) rather than the state-of-the-art single task learning (STL). Furthermore, correlation losses, Concordance Correlation Coefficient (CCC) and Pearson Correlation Coefficient (PCC), are used as an optimization objective during the training. Experiments are conducted on CreativeIT and RECOLA database, and evaluations are performed using the CCC metric. To highlight the effect of MTL, correlation losses and multi-modality, we respectively compare the performance of MTL against STL, CCC loss against root mean square error (MSE) loss and, PCC loss, multi-modality against single modality. We observe significant performance improvements with MTL training over STL, especially for estimation of the valence. Furthermore, the CCC loss achieves more than 7% CCC improvements on CreativeIT, and 13% improvements on RECOLA against MSE loss.

研究动机与目标

  • 通过使用基于相关性的损失函数,解决连续情绪识别(CER)中训练损失(如 MSE)与评估指标(如 CCC、PCC)之间的不匹配问题。
  • 通过多任务学习(MTL)在 AVD 预测任务间共享表示,提升在标注情感数据有限条件下的泛化能力与鲁棒性。
  • 通过多模态输入(语音与身体动作)的早期融合以及从原始信号和提取特征端到端学习,进一步提升性能。
  • 在多模态 CER 设置中,证明多任务学习(MTL)与相关性损失相较于单任务学习(STL)和 MSE 损失的优越性。

提出的方法

  • 提出一种半端到端的深度神经网络,将原始语音信号与身体动作序列与提取特征(MFCC 和欧拉角)进行融合。
  • 采用多任务学习(MTL)联合预测三个连续情绪维度:激活度(Activation)、效价(Valence)和支配度(Dominance)(AVD),以促进共享表征学习。
  • 使用基于相关性的损失函数——组内相关系数(CCC)和皮尔逊相关系数(PCC)作为优化目标,而非标准的 MSE。
  • 应用具有不同感受野大小(N=20, 40, 60)的时间窗口,以评估上下文长度对性能的影响。
  • 每帧使用 39 维声学特征向量(MFCC + 能量 + 导数)和 24 维身体动作特征向量(欧拉角 + 差分)。
  • 在 CreativeIT 和 RECOLA 数据集上训练模型,并在整个消融研究中以 CCC 作为主要评估指标。

实验结果

研究问题

  • RQ1在多模态设置下,多任务学习(MTL)相较于单任务学习(STL)是否能提升连续情绪识别的性能?
  • RQ2与均方误差(MSE)相比,使用组内相关系数(CCC)作为损失函数在 AVD 维度上的预测性能如何?
  • RQ3与单一模态相比,结合语音与身体动作模态对 CER 准确率有何影响?
  • RQ4时间上下文长度(窗口大小)对所提 MTL 模型在 AVD 预测中的性能有何影响?
  • RQ5基于相关性的损失函数是否能更好地对齐训练目标与评估指标,从而提升 CER 中的泛化能力?

主要发现

  • 在 CreativeIT 数据集上,所提出的 CER-MTL 模型在效价预测上相比 STL 基线实现了 6% 的 CCC 提升,分别达到 0.38(激活度)与 0.31(效价),而 STL 基线为 0.31(激活度)与 0.10(效价)。
  • 在 RECOLA 数据集上,CER-MTL 在激活度上达到 0.66 CCC,在效价上达到 0.34 CCC,优于 STL 基线(分别为 0.62 和 0.27 CCC)。
  • 与 MSE 损失相比,使用 CCC 损失在 CreativeIT 上使 CCC 提升超过 7%,在 RECOLA 上提升超过 13%,证明了指标对齐优化的有效性。
  • 将时间窗口大小(N)从 20 增加到 60,显著提升了激活度预测性能(在 CreativeIT 上 CCC 从 0.38 提升至 0.45),但效价与支配度未呈现一致趋势。
  • 在 RECOLA 开发集上,CER-MTL 模型在激活度上达到 0.79 CCC,在效价上达到 0.37 CCC,相比 SOTA 方法至少提升了 1% CCC。
  • 尽管纯 CNN 基线模型复杂度较高,但在 CreativeIT 上仍比所提 CER-MTL 模型低至少 11% CCC,表明 MTL 与相关性损失的显著优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。