[论文解读] Cross Euclidean-to-Riemannian Metric Learning with Application to Face Recognition from Video
该论文提出了一种新型框架——交叉欧几里得到黎曼度量学习(CERML),用于学习欧几里得表示(例如,人脸特征均值)与黎曼流形(例如,表示视频变化的格拉斯曼或对称正定(SPD)流形)之间的统一距离度量。通过将两种空间映射到一个共同的再生核希尔伯特空间(RKHS),CERML 实现了在异构数据类型之间的判别性度量学习,在四个基准数据集上的视频到静态图像、静态图像到视频以及视频到视频的人脸识别任务中均达到了最先进性能。
Riemannian manifolds have been widely employed for video representations in visual classification tasks including video-based face recognition. The success mainly derives from learning a discriminant Riemannian metric which encodes the non-linear geometry of the underlying Riemannian manifolds. In this paper, we propose a novel metric learning framework to learn a distance metric across a Euclidean space and a Riemannian manifold to fuse the average appearance and pattern variation of faces within one video. The proposed metric learning framework can handle three typical tasks of video-based face recognition: Video-to-Still, Still-to-Video and Video-to-Video settings. To accomplish this new framework, by exploiting typical Riemannian geometries for kernel embedding, we map the source Euclidean space and Riemannian manifold into a common Euclidean subspace, each through a corresponding high-dimensional Reproducing Kernel Hilbert Space (RKHS). With this mapping, the problem of learning a cross-view metric between the two source heterogeneous spaces can be expressed as learning a single-view Euclidean distance metric in the target common Euclidean space. By learning information on heterogeneous data with the shared label, the discriminant metric in the common space improves face recognition from videos. Extensive experiments on four challenging video face databases demonstrate that the proposed framework has a clear advantage over the state-of-the-art methods in the three classical video-based face recognition tasks.
研究动机与目标
- 为解决在基于视频的人脸识别中,使用异构数据表示融合均值外观与模式变化的挑战。
- 开发一种统一的度量学习框架,可在欧几里得空间与黎曼流形之间运行,以提升识别鲁棒性。
- 在三种标准视频人脸识别任务中实现有效度量学习:视频到静态图像、静态图像到视频以及视频到视频。
- 克服现有黎曼度量学习方法仅关注流形内或欧几里得内学习的局限性。
- 通过共享度量空间,证明联合建模视频序列中的均值与方差的优越性。
提出的方法
- 使用核嵌入技术,将欧几里得与黎曼表示均映射到一个共同的高维再生核希尔伯特空间(RKHS)。
- 采用核函数将黎曼流形(格拉斯曼或 SPD)嵌入欧几里得空间,从而在统一空间中实现标准度量学习。
- 在共同的 RKHS 中学习单视角欧几里得距离度量,以捕捉来自两种源空间的判别性信息。
- 利用异构视图之间的共享标签信息指导度量学习,提升判别能力。
- 应用优化技术以最小化统一目标函数,平衡度量学习与几何一致性。
- 通过将查询与图库视为源自不同但对齐的表示空间,支持三种识别设置。
实验结果
研究问题
- RQ1统一的度量学习框架能否有效融合视频序列中的均值外观与时间变化,以实现人脸识别?
- RQ2在基于视频的人脸识别中,欧几里得与黎曼空间之间的跨视角度量学习,与传统的同空间度量学习相比表现如何?
- RQ3通过欧几里得与黎曼表示联合建模均值与协方差,在多样化视频数据集上能将识别准确率提升多少?
- RQ4所提出的框架是否能在无需架构修改的情况下泛化至不同视频识别任务(V2S、S2V、V2V)?
- RQ5基于核的映射对跨空间度量学习的可扩展性与性能有何影响?
主要发现
- CERML 在四个具有挑战性的视频人脸识别数据库(YTC、YTF、PaSC 和 COX)上,所有三种视频识别任务中均实现了最先进性能。
- 在 PaSC 数据集上,CERML-EG 在不同设置下相较于最先进方法 DCC,V2V 识别性能分别提升了约 4% 和 10%。
- 在 COX 数据集上,CERML 始终优于所有对比方法,当使用深度特征时,平均性能比最先进深度学习方法 VGGDeepFace 提升 5%。
- 消融实验表明,通过 CERML 融合均值与方差表示的性能优于仅使用任一表示,效果更优。
- CERML-ES 的优化算法在数十轮迭代内收敛至稳定的目标值,表明其具有良好的收敛性。
- CERML 展现出强大的泛化能力,在互联网及监控类视频数据集上,性能与深度学习方法相当或更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。