[论文解读] Part-based Face Recognition with Vision Transformers
该论文提出 fViT,一种基于视觉Transformer的面部识别模型,在使用标准损失函数的情况下,在多个基准测试中实现了最先进性能。此外,该研究还引入了基于部件的框架 part fViT,其通过轻量级CNN端到端预测面部关键点,随后在围绕这些关键点提取的图像块上应用ViT——在无需关键点监督的情况下提升了识别准确率。
Holistic methods using CNNs and margin-based losses have dominated research on face recognition. In this work, we depart from this setting in two ways: (a) we employ the Vision Transformer as an architecture for training a very strong baseline for face recognition, simply called fViT, which already surpasses most state-of-the-art face recognition methods. (b) Secondly, we capitalize on the Transformer's inherent property to process information (visual tokens) extracted from irregular grids to devise a pipeline for face recognition which is reminiscent of part-based face recognition methods. Our pipeline, called part fViT, simply comprises a lightweight network to predict the coordinates of facial landmarks followed by the Vision Transformer operating on patches extracted from the predicted landmarks, and it is trained end-to-end with no landmark supervision. By learning to extract discriminative patches, our part-based Transformer further boosts the accuracy of our Vision Transformer baseline achieving state-of-the-art accuracy on several face recognition benchmarks.
研究动机与目标
- 评估在使用标准损失函数的情况下,原始视觉Transformer(fViT)作为面部识别强基线模型的性能。
- 探索视觉Transformer在处理非均匀分布视觉标记方面的潜力,受部件化面部识别的启发。
- 开发一种新型端到端可训练的流程 part fViT,联合学习具有判别力的面部部件定位与识别,而无需显式的关键点标注。
- 证明通过ViT学习部件化特征可提升泛化能力与识别准确率,优于整体特征学习方法。
- 展示 part fViT 中的地标预测头可作为有效的无监督面部关键点发现方法。
提出的方法
- 使用ArcFace损失在完整人脸图像上直接训练视觉Transformer(ViT),形成fViT基线模型。
- 通过轻量级CNN直接从输入图像回归面部关键点坐标,无需依赖标注的关键点。
- 从人脸图像中围绕预测的关键点坐标提取图像块,形成非均匀分布的视觉标记网格。
- 将这些非均匀分布的图像块输入视觉Transformer进行特征提取与识别,实现基于部件的注意力学习。
- 整个系统(包括关键点回归器与ViT)仅通过身份监督实现端到端训练。
- 该方法利用ViT对非均匀分布标记的注意力能力,有效建模面部部件(如眼睛、鼻子、嘴巴)的特征。
实验结果
研究问题
- RQ1在未进行架构修改的情况下,仅通过适当优化,标准视觉Transformer主干网络是否能实现最先进的人脸识别准确率?
- RQ2是否可以利用视觉Transformer在处理非均匀分布视觉标记方面的内在灵活性,设计出一种基于部件的人脸识别系统?
- RQ3仅通过身份标签对关键点预测头与ViT进行端到端训练,是否能实现有效且具有判别力的部件定位?
- RQ4所提出的 part fViT 在标准基准测试中的性能与整体ViT及其他最先进的人脸识别模型相比如何?
- RQ5part fViT 流程中的关键点预测头是否可作为有用的无监督面部关键点检测方法?
主要发现
- fViT 基线模型在使用标准ArcFace损失训练后,在LFW(99.44%)、AgeDB-30(93.52%)和IJB-C(91.03%)上实现了最先进准确率,且未使用特殊数据增强或复杂头结构。
- part fViT 模型在所有评估基准上均优于fViT基线,分别达到LFW的99.56%、AgeDB-30的93.92%和IJB-C的91.03%,在这些数据集上创下新的最先进记录。
- 注意力图可视化显示,part fViT 能够聚焦于多个判别性面部部件,尤其是眼睛;而整体fViT在不同注意力头之间注意力分布较不集中且不一致。
- part fViT 中学习到的关键点在不同姿态下表现出良好对应性,表明模型在无监督条件下隐式学习到了有意义的面部结构。
- supplementary material 验证了 part fViT 中的地标预测头作为无监督面部关键点发现方法具有良好的泛化能力。
- 消融实验确认,关键点预测头与基于部件的图像块提取机制均对相比整体fViT基线的准确率提升有显著贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。