Skip to main content
QUICK REVIEW

[论文解读] Deep Face Recognition Model Compression via Knowledge Transfer and Distillation

Karlekar Jayashree, Jiashi Feng|arXiv (Cornell University)|Jun 3, 2019
Face recognition and analysis参考文献 28被引用 10
一句话总结

本文提出了一种基于知识蒸馏与迁移的模型压缩方法,用于深度人脸验证,其中高分辨率教师网络在不进行剪枝或量化的情况下指导低分辨率学生网络。该方法在 IJB-C 数据集上实现了最先进性能,训练速度、推理速度、内存效率和准确率最高提升四倍,使模型能够在资源受限设备上部署。

ABSTRACT

Fully convolutional networks (FCNs) have become de facto tool to achieve very high-level performance for many vision and non-vision tasks in general and face recognition in particular. Such high-level accuracies are normally obtained by very deep networks or their ensemble. However, deploying such high performing models to resource constraint devices or real-time applications is challenging. In this paper, we present a novel model compression approach based on student-teacher paradigm for face recognition applications. The proposed approach consists of training teacher FCN at bigger image resolution while student FCNs are trained at lower image resolutions than that of teacher FCN. We explored three different approaches to train student FCNs: knowledge transfer (KT), knowledge distillation (KD) and their combination. Experimental evaluation on LFW and IJB-C datasets demonstrate comparable improvements in accuracies with these approaches. Training low-resolution student FCNs from higher resolution teacher offer fourfold advantage of accelerated training, accelerated inference, reduced memory requirements and improved accuracies. We evaluated all models on IJB-C dataset and achieved state-of-the-art results on this benchmark. The teacher network and some student networks even achieved Top-1 performance on IJB-C dataset. The proposed approach is simple and hardware friendly, thus enables the deployment of high performing face recognition deep models to resource constraint devices.

研究动机与目标

  • 解决由于模型尺寸庞大和计算需求高,导致高精度深度人脸验证模型难以在资源受限设备上部署的问题。
  • 克服现有压缩技术依赖剪枝、量化或架构修改的局限性。
  • 探索一种新型师生范式,其中学生网络的训练分辨率低于教师网络,通过知识迁移与蒸馏实现性能提升。
  • 在不修改网络架构或减少参数量的前提下,实现更高的准确率与效率。
  • 通过硬件友好的压缩方法,实现高性能人脸验证模型在边缘设备上的实际部署。

提出的方法

  • 在较高输入分辨率(例如 112×112)下训练一个全卷积教师网络(FCN),以捕获丰富特征。
  • 在逐步降低的分辨率(例如 48×48 至 112×112)下训练学生 FCN,同时与教师网络共享相同架构。
  • 通过在训练过程中从教师网络向学生网络迁移层参数,应用知识迁移(KT)。
  • 通过从教师网络向学生网络迁移软标签概率和中间层表征,应用知识蒸馏(KD)。
  • 联合使用 KT 与 KD 对学生网络进行联合训练,使其性能超越从零开始训练的模型。
  • 使用 MTCNN 进行人脸检测,并采用平均特征池化以提升特征表示质量。

实验结果

研究问题

  • RQ1能否通过高分辨率教师网络的知识迁移与蒸馏,提升低分辨率学生网络在人脸验证中的性能?
  • RQ2在低分辨率下训练学生网络的同时,借助高分辨率教师网络的知识,是否能在不损失准确率的前提下实现更快的训练与推理速度?
  • RQ3所提方法是否能在不修改架构或剪枝参数的前提下,在 IJB-C 等基准数据集上实现最先进准确率?
  • RQ4使用该方法压缩深度人脸验证模型时,模型大小、推理速度与准确率之间的权衡关系如何?
  • RQ5知识迁移与蒸馏的结合在不同输入分辨率下,对提升学生网络性能的有效性如何?

主要发现

  • 在 96×96 和 80×80 分辨率下,通过知识迁移(KT)训练的学生网络在 IJB-C 1:1 混合验证协议上达到了 Top-1 准确率。
  • 与教师网络相比,80×80 分辨率的学生网络将 CPU 推理时间减少了 51%,MACC 操作减少了 49%,同时保持了相近的准确率。
  • 在 IJB-C 1:1 验证协议中,FAR 为 10⁻⁴ 时,KT 将准确率从无 KT 的 95.89% 提升至 96.05%(96×96 分辨率)。
  • 在 48×48 分辨率下,KT 将 1:1 验证准确率从 91.74% 提升至 93.94%(FAR 为 10⁻⁴),表明在低分辨率下取得了显著提升。
  • 所有学生网络在 IJB-C 1:1 验证与 1:N 识别协议上均取得了最先进结果,教师网络也达到了 Top-1 性能。
  • 该方法实现了四倍优势:训练加速、推理更快、内存使用减少、准确率提升,且无需修改架构或量化参数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。