[论文解读] Recurrent Regression for Face Recognition
本文提出一种循环回归神经网络(RRNN),通过建模序列化图像变换,实现统一的跨姿态与基于视频的人脸识别。通过利用带有姿态序列监督的循环编码-解码机制,RRNN 能够自适应地记忆与遗忘不同姿态下的特征,在 YTC 数据集上达到 86.6% 的准确率,在 MultiPIE 数据集上达到 95.2%,性能达到当前最先进水平。
To address the sequential changes of images including poses, in this paper we propose a recurrent regression neural network(RRNN) framework to unify two classic tasks of cross-pose face recognition on still images and video-based face recognition. To imitate the changes of images, we explicitly construct the potential dependencies of sequential images so as to regularize the final learning model. By performing progressive transforms for sequentially adjacent images, RRNN can adaptively memorize and forget the information that benefits for the final classification. For face recognition of still images, given any one image with any one pose, we recurrently predict the images with its sequential poses to expect to capture some useful information of others poses. For video-based face recognition, the recurrent regression takes one entire sequence rather than one image as its input. We verify RRNN in static face dataset MultiPIE and face video dataset YouTube Celebrities(YTC). The comprehensive experimental results demonstrate the effectiveness of the proposed RRNN method.
研究动机与目标
- 解决在静态图像与视频序列中姿态变化带来的人脸识别挑战。
- 在单一框架下统一经典的人脸识别任务——跨姿态识别与基于视频的识别。
- 通过建模图像序列中的序列依赖关系,对学习过程进行正则化,提升对姿态与外观变化的鲁棒性。
- 通过显式编码图像序列的时序动态特性,利用循环变换提升识别准确率。
- 在具有复杂姿态与外观变化的非约束性数据集上验证方法的有效性。
提出的方法
- 提出一种循环回归神经网络(RRNN),采用循环编码-解码架构,建模序列化图像变换。
- 使用序列重建损失,基于已知姿态序列强制预测图像序列的一致性。
- 引入全局正则化项,以保持重建图像序列之间的结构一致性。
- 引入判别性标签预测损失,用于基于视频的识别任务,以提升分类性能。
- 采用联合目标函数,结合重建损失、全局一致性损失与分类损失,进行端到端训练。
- 通过从单张输入图像预测序列化姿态,将相同框架应用于静态图像,利用已知的姿态排序信息。
实验结果
研究问题
- RQ1统一的深度学习框架能否有效同时处理静态图像的跨姿态人脸识别与基于视频的人脸识别?
- RQ2建模序列化图像变换如何提升对姿态与外观变化的鲁棒性?
- RQ3循环记忆机制在捕捉姿态间依赖关系以提升识别性能方面有何贡献?
- RQ4目标函数的不同组件(重建、全局正则化、分类)如何影响最终性能?
- RQ5所提出方法是否在具有复杂姿态变化的基准数据集上优于现有最先进方法?
主要发现
- RRNN 在 YouTube Celebrities(YTC)数据集上达到 86.6% 的平均准确率,显著优于先前最先进方法,最高提升达 7.2 个百分点。
- 在 MultiPIE 数据集上,RRNN 在跨姿态人脸识别任务中达到 95.2% 的准确率,展现出对姿态变化的强大泛化能力。
- 消融实验表明,同时包含序列重建损失与标签预测损失可提升性能,最佳结果出现在两者均启用时。
- 出人意料的是,使用正前方人脸($0^\circ$)作为图库集时准确率反而低于非正前方姿态,归因于误差传播以及非正前方视角中更丰富的轮廓信息。
- 模型的循环结构实现了有效的特征记忆与遗忘,提升了对不同姿态下外观变化的鲁棒性。
- 该方法在两个数据集上均持续优于基于子空间与度量的方法,如 MMDML、SSDML 与 DFRV。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。