[论文解读] How Deep Neural Networks Can Improve Emotion Recognition on Video Data
本文提出一种CNN+RNN框架用于视频数据中的维度化情绪识别,利用卷积网络提取帧级特征,并通过循环网络建模时序动态。该方法在AV+EC 2015数据集上达到最先进性能,CCC得分为0.507,优于基线模型,证明了端到端深度学习在连续情绪预测中的有效性。
We consider the task of dimensional emotion recognition on video data using deep learning. While several previous methods have shown the benefits of training temporal neural network models such as recurrent neural networks (RNNs) on hand-crafted features, few works have considered combining convolutional neural networks (CNNs) with RNNs. In this work, we present a system that performs emotion recognition on video data using both CNNs and RNNs, and we also analyze how much each neural network component contributes to the system's overall performance. We present our findings on videos from the Audio/Visual+Emotion Challenge (AV+EC2015). In our experiments, we analyze the effects of several hyperparameters on overall performance while also achieving superior performance to the baseline and other competing methods.
研究动机与目标
- 探究与传统手工设计特征相比,深度神经网络是否能提升视频数据中的维度化情绪识别性能。
- 评估卷积神经网络(CNNs)和循环神经网络(RNNs)在单独和联合使用时对建模时序情绪动态的贡献。
- 优化超参数(如窗口长度、隐藏单元数量和RNN深度)以提升连续兴奋度预测的性能。
- 在AV+EC 2015基准上,将所提出的CNN+RNN模型与现有最先进方法进行比较。
提出的方法
- 使用一个单帧CNN,包含三层卷积层(64、128、256个滤波器),ReLU激活函数,最大池化操作,以及一个300维的全连接层,用于从单个视频帧中提取空间特征。
- CNN被冻结并用作固定特征提取器;其300维输出被输入到RNN中,以建模帧序列之间的时序依赖关系。
- 以W帧的时序窗口作为RNN的输入,RNN最终输出在每个时间步的兴奋度预测值。
- RNN使用门控循环单元(GRUs),激活函数为ReLU或tanh,模型通过均方误差损失进行端到端训练。
- 在窗口大小(W)、隐藏单元数量(h)和RNN层数上进行超参数调优,以优化性能。
- 使用RMSE、皮尔逊相关系数(CC)和组内一致性相关系数(CCC)评估性能,其中CCC作为主要指标。
实验结果
研究问题
- RQ1单帧CNN是否能在视频数据的维度化情绪识别中超越基于手工特征的模型?
- RQ2在连续情绪预测中,加入RNN组件对性能的提升有多大?
- RQ3在CNN+RNN架构中,针对兴奋度回归任务,窗口长度、隐藏单元数量和RNN深度等超参数的最佳配置是什么?
- RQ4在AV+EC 2015数据集上,CNN+RNN模型在CCC、CC和RMSE指标上与其他最先进方法相比如何?
主要发现
- CNN+RNN模型在AV+EC 2015开发集上取得了0.507的CCC得分,优于基线方法(CCC:0.273)和其他竞争方法。
- 加入Dropout的单帧CNN(CNN+D)取得了0.326的CCC,表明仅使用学习到的特征即可超越手工特征基线。
- RNN的最佳时序窗口长度为100帧(约4秒),此时CCC最高;窗口过短或过长均导致性能下降。
- 隐藏单元数为100时表现最佳,50和200个单元的配置性能较低。
- RNN使用三层结构时性能略优于一层或两层,三层模型的CCC达到0.507。
- RNN中使用ReLU激活函数优于tanh,CCC分别为0.506和0.492,表明ReLU具有更优的梯度流动和表征学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。