Skip to main content
QUICK REVIEW

[论文解读] audEERING's approach to the One-Minute-Gradual Emotion Challenge

Andreas Triantafyllopoulos, Hesam Sagha|arXiv (Cornell University)|May 3, 2018
Emotion and Mood Recognition参考文献 5被引用 6
一句话总结

本文介绍了audEERING在One-Minute-Gradual Emotion Challenge中的方法,结合音频与视频模态,利用深度学习预测连续的唤醒度与效价。通过使用CDF校正的音频特征和基于VGGFace嵌入的视频特征的双流BLSTM网络,该方法在唤醒度(音频)上达到0.343 CCC,在效价(视频)上达到0.401 CCC,通过模型融合与领域自适应技术减轻说话人偏差,进一步提升了性能。

ABSTRACT

This paper describes audEERING's submissions as well as additional evaluations for the One-Minute-Gradual (OMG) emotion recognition challenge. We provide the results for audio and video processing on subject (in)dependent evaluations. On the provided Development set, we achieved 0.343 Concordance Correlation Coefficient (CCC) for arousal (from audio) and .401 for valence (from video).

研究动机与目标

  • 解决在带有渐进唤醒度与效价标注的1分钟YouTube视频片段中进行连续情绪识别的挑战。
  • 通过减轻训练集、开发集与测试集之间的数据泄露与说话人重叠问题,提升OMG数据集上的模型性能。
  • 探究仅使用音频建模唤醒度与仅使用视频建模效价的有效性,并通过融合提升效价预测性能。
  • 通过交叉验证、特征归一化与领域自适应技术,减少过拟合并增强模型泛化能力。
  • 评估说话人相关与说话人无关的数据划分对模型性能的影响。

提出的方法

  • 使用openSMILE提取音频特征,包括1170个低级声学特征(LLDs)及2秒窗口、1秒步长下的统计函数,随后通过CDF调整对特征分布进行归一化,降低异常值敏感性。
  • 在音频特征上训练一个包含100和40个单元的两层BLSTM网络,损失函数最小化负CCC,基于交叉验证结果采用早停策略。
  • 视频处理方面,使用MTCCN进行人脸检测与对齐,随后通过VGGFace卷积神经网络模型提取深层特征。
  • 视频序列通过一个包含16和8个单元的两层BLSTM网络处理,以建模面部表情的时间动态,输出使用tanh激活函数,并进行均值-方差归一化。
  • 为缓解说话人偏差,引入联合训练目标,将效价预测与说话人误分类任务结合,以促进说话人无关的表征学习。
  • 最终预测通过平均多个交叉验证折的输出获得,训练数据被合并并重新划分为七折,用于测试集推理。

实验结果

研究问题

  • RQ1在OMG数据集上,CDF调整的音频特征相较于均值-方差归一化,在提升情绪识别性能方面表现如何?
  • RQ2训练集、开发集与测试集之间的说话人重叠在多大程度上损害了模型泛化能力?应如何缓解?
  • RQ3结合音频(唤醒度)与视频(效价)特征的双流方法是否能优于单模态模型?
  • RQ4将说话人分类作为辅助任务的多任务学习是否能增强视频基效价预测模型对说话人特异性偏差的鲁棒性?
  • RQ5在交叉验证折上进行模型集成平均在提升预测稳定性与CCC得分方面有多有效?

主要发现

  • 仅使用音频的唤醒度最佳模型在官方开发集上达到0.343 CCC,采用CDF校正特征与随机打乱策略。
  • 仅使用视频的效价最佳模型在开发集上达到0.401 CCC,采用CDF校正特征与随机打乱策略,优于说话人无关的交叉验证折。
  • 说话人无关的交叉验证使效价性能下降至0.232 CCC,表明数据泄露与说话人偏差导致显著性能下降。
  • 通过引入说话人误分类作为辅助任务的联合训练,使效价CCC从0.360(说话人无关)提升至0.390,接近随机打乱策略的性能。
  • 音频与视频预测的融合使效价CCC提升至0.388,证明了多模态融合的有效性。
  • CDF校正方法优于均值-方差归一化,尤其在降低特征分布中异常值的敏感性方面表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。