[论文解读] Multi-velocity neural networks for gesture recognition in videos
该论文提出多速度神经网络,通过半监督训练协议在大规模人脸视频数据集上自适应学习最优时间采样率,实现手势识别的最优性能。通过结合时间卷积自编码器与分类损失,该方法在多个基准数据集上达到最先进水平,实现对不同运动速度下动作识别的鲁棒性。
We present a new action recognition deep neural network which adaptively learns the best action velocities in addition to the classification. While deep neural networks have reached maturity for image understanding tasks, we are still exploring network topologies and features to handle the richer environment of video clips. Here, we tackle the problem of multiple velocities in action recognition, and provide state-of-the-art results for gesture recognition, on known and new collected datasets. We further provide the training steps for our semi-supervised network, suited to learn from huge unlabeled datasets with only a fraction of labeled examples.
研究动机与目标
- 解决视频手势识别中动作速度变化带来的挑战,该挑战会损害标准深度神经网络的性能。
- 开发一种新型神经网络架构,在训练过程中自适应学习最优时间采样率,使其对运动速度变化具有不变性。
- 通过利用大规模未标注视频数据集(仅少量标注样本)实现有效的半监督学习。
- 创建并发布迄今最大的面部表情视频数据集,包含1.62亿张人脸图像和78亿个标注,以支持未来研究。
提出的方法
- 提出多速度层,通过B样条插值自适应重采样视频帧,以在不同时间尺度上学习运动不变特征。
- 采用混合训练策略,结合时间卷积自编码器在未标注数据上进行无监督预训练,以及在标注数据上进行有监督微调的分类损失。
- 使用带有残差连接的深层时空卷积神经网络,通过反向传播端到端联合重建与分类目标进行训练。
- 应用B样条插值在多个时间分辨率下重建视频序列,使网络能够学习速度鲁棒的表征。
- 实施半监督学习协议,其中自编码器从未标注数据中学习时间模式,而分类器在小部分标注子集上进行训练。
- 利用大规模数据集(650万段视频剪辑,1.62亿张人脸图像,78亿个标注),其中2,777个视频标注了七种面部情绪,数据通过自动化数据采集管道收集。
实验结果
研究问题
- RQ1深度神经网络能否在动作速度变化的视频中学习到最优时间采样率?
- RQ2当仅有少量数据被标注时,如何有效应用半监督学习于视频手势识别?
- RQ3大规模高质量视频数据集对提升面部表情识别性能有何影响?
- RQ4与固定采样率相比,多速度层是否能提升在不同动作速度下的泛化能力?
- RQ5所提出的混合自编码器-分类器训练框架与端到端有监督训练或传统半监督方法相比如何?
主要发现
- 在MMI数据集上,该方法达到66.15%的准确率,优于先前最先进方法(63.4%)的10折交叉验证结果。
- 在CK+数据集上,该方法达到94.18%的准确率,超过先前最先进水平(92.4%)。
- 在所有测试数据集(MMI、CK+、Asevo)上,该模型均达到最先进性能,且相对于多种核方法和表达基线持续提升。
- 使用大规模未标注数据集(1.62亿张图像)显著提升了泛化能力,即使仅有2,777个标注视频。
- 多速度层使网络能够学习运动不变特征,降低对动作速度时间变化的敏感性。
- 半监督训练协议有效利用了未标注数据,表明即使标注数据极少,性能也能显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。