Skip to main content
QUICK REVIEW

[论文解读] Towards Multimodal Emotion Recognition in German Speech Events in Cars using Transfer Learning

Deniz Cevher, Sebastian Zepf|arXiv (Cornell University)|Sep 6, 2019
Emotion and Mood Recognition被引用 13
一句话总结

本文提出了一种用于德语车载语音交互中多模态情感识别的迁移学习方法,结合了音频、面部表情和转录文本模态。通过在新的车载语料库(AMMER)上微调预训练文本模型,该方法在喜悦、恼怒和不安全感三种情感上的微平均F1最高达到76%,比现成工具高出最多10个百分点,尤其在基于文本的情感识别方面表现更优。

ABSTRACT

The recognition of emotions by humans is a complex process which considers multiple interacting signals such as facial expressions and both prosody and semantic content of utterances. Commonly, research on automatic recognition of emotions is, with few exceptions, limited to one modality. We describe an in-car experiment for emotion recognition from speech interactions for three modalities: the audio signal of a spoken interaction, the visual signal of the driver's face, and the manually transcribed content of utterances of the driver. We use off-the-shelf tools for emotion detection in audio and face and compare that to a neural transfer learning approach for emotion recognition from text which utilizes existing resources from other domains. We see that transfer learning enables models based on out-of-domain corpora to perform well. This method contributes up to 10 percentage points in F1, with up to 76 micro-average F1 across the emotions joy, annoyance and insecurity. Our findings also indicate that off-the-shelf-tools analyzing face and audio are not ready yet for emotion detection in in-car speech interactions without further adjustments.

研究动机与目标

  • 开发一种基于音频、面部表情和文本信号的德语车载语音交互多模态情感识别系统。
  • 评估现成工具在受控车载环境中对面部和声学情感识别的性能。
  • 研究是否可利用域外高质量文本语料的迁移学习来提升低资源车载环境下的情感识别性能。
  • 比较在域内和域外数据联合训练与迁移学习在基于文本的情感分类中的表现。
  • 评估在车载场景中多模态融合用于情感识别的可行性和性能。

提出的方法

  • 从驾驶模拟器中收集了包含12名参与者与虚拟助手及副驾驶进行情感语音交互的多模态数据集(AMMER)。
  • 使用现成工具进行面部表情识别(基于OpenCV和FACS追踪)和声学情感检测(基于语调和频谱特征)。
  • 采用基于神经网络的文本分类器,通过迁移学习方法,在AMMER数据集上微调来自域外语料库(如ISEAR、EmoInt、TEC、Figure8)的预训练模型。
  • 采用留一法交叉验证进行迁移学习,其中每个模型先在外部语料库上预训练,再在AMMER训练子集上进一步优化。
  • 将迁移学习性能与使用全部域外数据加AMMER的联合训练基线进行比较,以分离迁移学习的增益。
  • 使用三种目标情感(喜悦、恼怒和不安全感)的微平均F1分数评估模型性能。

实验结果

研究问题

  • RQ1在未进行领域特定适配的情况下,现成的面部和声学情感识别工具在车载语音交互场景中的表现如何?
  • RQ2从高质量域外文本语料迁移学习在低资源车载环境中能在多大程度上提升情感识别性能?
  • RQ3对于基于文本的情感分类,迁移学习是否优于在域内和域外数据联合训练的方法?
  • RQ4在德语车载交互中,哪种模态——面部表情、声学信号还是转录文本——对情感识别的贡献最有效?
  • RQ5迁移学习是否能实现在数据量有限的域内数据上对复杂情感(如不安全感和恼怒)实现稳健的情感分类,特别是在跨域场景下?

主要发现

  • 基于迁移学习的文本分类实现了高达76%的微平均F1分数,显著优于现成工具和联合训练基线。
  • 与联合训练基线相比,迁移学习方法的性能最高提升了13个百分点,尤其在ISEAR预训练模型上表现更优。
  • 现成的面部表情识别工具表现有限,仅喜悦被中等程度识别;恼怒和不安全感识别效果较差。
  • 声学情感识别工具对负面情绪状态存在明显偏差,表明需要进行说话人特定的个性化或环境适应。
  • 基于文本的情感识别是效果最佳的模态,迁移学习使在数据有限的域内场景下仍能实现高性能。
  • 结果表明,从高质量域外文本语料进行迁移学习是低资源专用领域(如车载交互)情感识别的一种可行且有效策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。