[论文解读] VarGFaceNet: An Efficient Variable Group Convolutional Neural Network for Lightweight Face Recognition
VarGFaceNet 是一种轻量级人脸识别网络,通过使用可变组卷积来平衡计算效率与特征判别能力。通过引入专用的网络头部设置以及具有通道扩展和参数高效卷积的嵌入模块,它在 LFR 2019 挑战赛中实现了最先进性能(在 FPR=1e-8 时 TPR 提高 5%),同时保持在 1G FLOPs 和 20MB 内存以下。
To improve the discriminative and generalization ability of lightweight network for face recognition, we propose an efficient variable group convolutional network called VarGFaceNet. Variable group convolution is introduced by VarGNet to solve the conflict between small computational cost and the unbalance of computational intensity inside a block. We employ variable group convolution to design our network which can support large scale face identification while reduce computational cost and parameters. Specifically, we use a head setting to reserve essential information at the start of the network and propose a particular embedding setting to reduce parameters of fully-connected layer for embedding. To enhance interpretation ability, we employ an equivalence of angular distillation loss to guide our lightweight network and we apply recursive knowledge distillation to relieve the discrepancy between the teacher model and the student model. The champion of deepglint-light track of LFR (2019) challenge demonstrates the effectiveness of our model and approach. Implementation of VarGFaceNet will be released at https://github.com/zma-c-137/VarGFaceNet soon.
研究动机与目标
- 在严格的计算约束下,提升轻量级人脸识别网络的判别能力和泛化能力。
- 通过引入可变组卷积,解决残差块内计算强度不平衡的问题。
- 通过修改网络头部设置,避免在网络起始阶段下采样,从而保留关键的面部细节。
- 通过新颖的嵌入模块设计,在保持判别能力的同时减少全连接层的参数量。
- 通过高效的角度蒸馏损失和递归知识蒸馏,提升模型可解释性和性能。
提出的方法
- 引入可变组卷积,动态调整每层的通道分组,提升计算效率和特征表示能力。
- 采用修改后的头部设置,在第一卷积层中省略下采样操作,以保留高分辨率的面部特征。
- 设计自定义嵌入模块,在应用可变组卷积和逐点卷积前,将通道数从 320 扩展至 1024,以减少参数量。
- 应用等效的角度蒸馏损失,利用教师模型提供的角度边界信息来指导学生网络。
- 采用递归知识蒸馏,其中每个学生模型成为下一代的教师模型,从而减少分布差异。
- 使用 ArcFace 损失进行训练,并在 LFW、CFP-FP、AgeDB-30 和 DeepGlint-Light 等标准基准上验证性能。
实验结果
研究问题
- RQ1可变组卷积能否改善轻量级人脸识别网络在性能与效率之间的权衡?
- RQ2保留早期特征分辨率的修改头部设置在大规模人脸数据集上的识别准确率有何影响?
- RQ3具有通道扩展和参数高效卷积的自定义嵌入模块在不牺牲判别能力的前提下,能在多大程度上减小模型尺寸?
- RQ4等效角度蒸馏损失在引导轻量级学生网络实现更好泛化能力方面有多有效?
- RQ5当学生与教师模型存在较大架构差异时,递归知识蒸馏是否能显著提升性能?
主要发现
- 在与 prior SOTA 模型相同的 1G FLOPs 和 20MB 内存约束下,VarGFaceNet 在 DeepGlint-Light 测试集上的 TPR@FPR=1e-8 提高了 5%。
- 尽管通道容量更高,VarGFaceNet 在 AgeDB-30 上的验证准确率提高了 0.6%,在 CFP-FP 上提高了 0.2%,优于 MobileFaceNet (y2)。
- 所提出的嵌入模块在减少全连接层参数量的同时保留了判别性特征,优于 MobileFaceNet 的 7×7 深度可分离卷积方法。
- 递归知识蒸馏使 LFW 和 CFP-FP 的验证准确率提升 0.1%,并在 DeepGlint-Light 上使 TPR@FPR=1e-8 提升 0.4%,相比非递归训练。
- 模型性能与教师模型质量高度相关,表明更强的教师模型能带来更好的学生泛化能力。
- 消融实验确认,头部设置和嵌入模块设计至关重要,因为使用标准设置的普通 VarGNet 在所有基准上均表现逊于 VarGFaceNet。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。