[论文解读] EmotiW 2018: Audio-Video, Student Engagement and Group-Level Affect Prediction
本论文介绍了 EmotiW 2018,这是一个多模态情感识别挑战赛,包含三个子挑战:音视频情感识别、MOOC 中的学生参与度预测以及群体层面的情感识别。该研究引入了一个新的学生参与度数据集,包含 149 个训练视频、48 个验证视频和 67 个测试视频,并报告了使用深度学习集成模型的顶尖模型在音视频情感识别任务中达到 61.87% 的准确率。
This paper details the sixth Emotion Recognition in the Wild (EmotiW) challenge. EmotiW 2018 is a grand challenge in the ACM International Conference on Multimodal Interaction 2018, Colorado, USA. The challenge aims at providing a common platform to researchers working in the affective computing community to benchmark their algorithms on `in the wild' data. This year EmotiW contains three sub-challenges: a) Audio-video based emotion recognition; b) Student engagement prediction; and c) Group-level emotion recognition. The databases, protocols and baselines are discussed in detail.
研究动机与目标
- 通过在 ICMI 2018 举办的大型挑战赛,建立在非受限真实环境中情感计算的基准。
- 通过创建一个多样化的新数据集,解决 MOOC 中学生参与度检测缺乏公开可用数据集的问题,该数据集涵盖不同的光照条件、背景和录制环境。
- 推动从视觉数据中进行群体层面情感识别的研究,重点关注社交场景中的集体情感状态。
- 为三个不同子挑战的情感识别提供标准化协议、评估指标和基线。
- 通过竞赛促进多模态情感识别领域的创新,重点关注深度学习和集成方法。
提出的方法
- 从宿舍、餐厅和计算机实验室等多样化的真实场景中收集了新的学生参与度数据集,包含 149 个训练视频、48 个验证视频和 67 个测试视频。
- 使用 OpenFace 从视频帧中提取眼动和头部运动特征,并将数据按 25% 重叠的片段进行下采样和分段,以支持时间序列分析。
- 对人脸关键点和视线点的时间序列应用统计特征(均值、标准差、偏度、峰度),用于参与度建模。
- 采用深度学习模型,特别是集成网络,进行音视频情感识别和群体层面情感预测。
- 使用加权 Cohen’s Kappa 评估参与度标签的标注者间一致性,标签被回归到 [0–1] 区间。
- 使用分类准确率评估情感和群体层面情感的模型性能,使用回归指标评估参与度预测性能。
实验结果
研究问题
- RQ1如何在非受限的真实 MOOC 视频观看场景中,利用多模态线索可靠地检测学生参与度?
- RQ2深度学习模型在“真实世界”视频数据中的音视频情感识别任务中表现如何?
- RQ3仅从视觉数据中能否准确预测群体场景中的集体情感状态?
- RQ4集成深度学习模型在多模态情感识别任务中与基线方法相比表现如何?
- RQ5在非受控环境中,哪些关键视觉和音视频特征最能有效预测参与度和情感?
主要发现
- 在音视频情感识别子挑战中,表现最佳的团队在测试集上达到了 61.87% 的分类准确率,显著优于基线的 41.07%。
- 通过使用 OpenFace 提取的眼动和头部运动特征,成功建立了学生参与度预测模型,重点在于时间序列的统计模式。
- 群体层面情感识别子挑战表明,仅从群体场景的视觉线索即可中等准确度地推断集体情感状态。
- 深度学习集成模型,特别是在音视频情感识别任务中,整体上在所有子挑战中表现最佳。
- 新引入的学生参与度数据集包含 91 名受试者,覆盖 149 个训练视频,且环境条件多样,为未来研究提供了稳健的基准。
- 参与度标签的标注者间一致性为中等到较高水平(加权 Kappa),验证了标注协议的可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。