Skip to main content
QUICK REVIEW

[论文解读] EEV: A Large-Scale Dataset for Studying Evoked Expressions from Video

Jennifer J. Sun, Ting Liu|arXiv (Cornell University)|Jan 15, 2020
Emotion and Mood Recognition参考文献 49被引用 8
一句话总结

本论文提出了EEV,一个大规模数据集,包含23,574段视频,共3670万帧的面部表情标注,采样频率为6 Hz,用于捕捉观众在观看视频时的诱发性面部反应。通过使用基于视频的表情识别模型实现可扩展的数据收集,作者构建了一个多模态RNN基线模型,并在LIRIS-ACCEDE数据集上展示了迁移学习的增益,表明EEV能够提升从视频内容预测诱发性情感的能力。

ABSTRACT

Videos can evoke a range of affective responses in viewers. The ability to predict evoked affect from a video, before viewers watch the video, can help in content creation and video recommendation. We introduce the Evoked Expressions from Videos (EEV) dataset, a large-scale dataset for studying viewer responses to videos. Each video is annotated at 6 Hz with 15 continuous evoked expression labels, corresponding to the facial expression of viewers who reacted to the video. We use an expression recognition model within our data collection framework to achieve scalability. In total, there are 36.7 million annotations of viewer facial reactions to 23,574 videos (1,700 hours). We use a publicly available video corpus to obtain a diverse set of video content. We establish baseline performance on the EEV dataset using an existing multimodal recurrent model. Transfer learning experiments show an improvement in performance on the LIRIS-ACCEDE video dataset when pre-trained on EEV. We hope that the size and diversity of the EEV dataset will encourage further explorations in video understanding and affective computing. A subset of EEV is released at https://github.com/google-research-datasets/eev.

研究动机与目标

  • 为解决现有缺乏大规模、多样化数据集以研究视频内容引发的情感反应的问题。
  • 开发一种可扩展、自动化的框架,用于从观看视频的观众中收集帧级面部表情标注。
  • 建立一个基准模型,直接从视频内容的多模态特征预测诱发性面部表情。
  • 评估EEV在相关情感计算任务中迁移学习的潜力。
  • 探究视频主题与内容如何与特定诱发表情相关联。

提出的方法

  • 利用预训练的表情识别模型,在视频播放过程中实时检测并标注观众的面部表情。
  • 收集观众观看公开可用视频时的反应,采用6 Hz的帧率以捕捉诱发表情的动态变化。
  • 在23,574段视频中,对每帧标注15种连续的面部表情标签(例如:愉悦、惊讶、愤怒)。
  • 使用结合图像、人脸和音频特征的多模态循环神经网络(RNN)模型,从视频内容预测诱发表情。
  • 通过在EEV上预训练基线模型,并在LIRIS-ACCEDE数据集上微调,实现迁移学习。
  • 通过特征消融实验,评估各模态(图像、人脸、音频)对预测性能的独立贡献。

实验结果

研究问题

  • RQ1仅从视频内容本身,能否预测诱发性面部表情,而无需额外的观众个体数据?
  • RQ2哪些诱发性面部表情更容易从视频内容中预测,哪些更具挑战性?
  • RQ3不同视频主题或内容类型如何与特定诱发表情相关联?
  • RQ4EEV数据集在多大程度上可通过迁移学习提升相关情感计算任务的性能?
  • RQ5视觉、面部和音频特征在预测诱发表情中的相对贡献如何?

主要发现

  • 基线多模态RNN模型在全部15种诱发表情上均表现出正相关,其中愉悦、专注和惊讶的预测相关性更高,而愤怒和胜利感的预测相关性较低。
  • 音频特征对预测性能的贡献最大,移除音频导致所有表情的相关性下降幅度最大。
  • 人脸特征作为单一模态信息量最少,其移除对性能的影响小于移除音频,表明存在冗余或判别能力有限。
  • 从EEV进行迁移学习后,LIRIS-ACCEDE数据集上的性能得到提升,情感维度的均方误差(MSE)降低30%,唤醒度降低32%,其中情感维度的增益更高。
  • 数据集显示,当包含音频特征时,满足感和失望等表情的预测能力显著增强。
  • EEV中视频主题的分布(通过自动标注获得)显示内容多样且主题不重叠,支持其在情感化视频分析中的广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。