[论文解读] Deep video gesture recognition using illumination invariants
本文提出了一种基于光照不变特征的深度视频手势识别系统,通过一种新型自适应归一化层和堆叠自编码器的半监督学习方法实现。通过在大规模未标注视频数据上进行无监督预训练,并结合微调后的有监督预测,该方法在不同光照条件下的手势识别任务中实现了最先进性能,在基准数据集上的表现相比之前方法最高提升达10%。
In this paper we present architectures based on deep neural nets for gesture recognition in videos, which are invariant to local scaling. We amalgamate autoencoder and predictor architectures using an adaptive weighting scheme coping with a reduced size labeled dataset, while enriching our models from enormous unlabeled sets. We further improve robustness to lighting conditions by introducing a new adaptive filer based on temporal local scale normalization. We provide superior results over known methods, including recent reported approaches based on neural nets.
研究动机与目标
- 开发一种用于视频面部手势识别的深度学习框架,使其在不同光照条件下仍保持鲁棒性。
- 通过利用大规模未标注视频数据进行半监督学习,解决视频手势识别中标签数据有限的挑战。
- 通过在网络架构中引入一种自适应、可学习的归一化层,提升模型对时间维度光照变化的鲁棒性。
- 在保持尺度不变性的同时,减少对光照变化的敏感性,实现视频手势识别的最先进性能。
提出的方法
- 该方法使用堆叠自编码器在数百万个未标注视频片段上进行无监督预训练,以学习时空特征。
- 在使用自编码器权重初始化后,对一个小规模标签数据集微调有监督预测网络,从而实现有效的半监督学习。
- 引入一种自适应时间局部尺度归一化层,以动态归一化特征,并在训练过程中增强光照不变性。
- 该架构使用4D卷积层从视频序列中提取时空特征,捕捉运动与外观动态。
- 自适应归一化层是可微的,并与网络其余部分联合优化,实现光照不变表示的端到端学习。
- 系统通过组合自编码器的重建损失和预测头的分类损失,采用混合损失函数进行训练。
实验结果
研究问题
- RQ1是否可以仅使用少量标注样本和大量未标注视频数据,有效训练深度神经网络用于视频手势识别?
- RQ2在深度学习框架中,如何减轻视频序列中的光照变化以提升识别鲁棒性?
- RQ3自适应、可学习的归一化层是否优于固定归一化技术(如局部响应归一化)以应对光照变化?
- RQ4尺度不变架构是否能提升在真实世界光照变化下视频手势识别任务的性能?
主要发现
- 所提方法在CK+数据集上达到73.68%的准确率,较次优方法提升4.26个百分点。
- 在MMI数据集上,系统准确率达到59.03%,较半监督基线提升3.33个百分点。
- 与固定局部响应归一化相比,自适应归一化层显著提升了性能,尤其在较大数据集上表现更优。
- 该方法对光照变化表现出强鲁棒性,在Florentine和CK+等多个数据集上均实现一致的性能提升。
- 系统在大规模未标注数据上训练耗时超过3天,凸显了深度自编码器预训练的计算成本。
- 尽管性能优异,该系统仍局限于正面视角和固定输入帧尺寸,限制了其在非受限环境中的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。