Skip to main content
QUICK REVIEW

[論文レビュー] Deep Face Recognition Model Compression via Knowledge Transfer and Distillation

Karlekar Jayashree, Jiashi Feng|arXiv (Cornell University)|Jun 3, 2019
Face recognition and analysis参考文献 28被引用数 10
ひとこと要約

本稿では、プルーニングや量子化を伴わずに、高解像度の教師ネットワークが低解像度の学生ネットワークをガイドする、知識伝達および蒸留に基づくモデル圧縮手法を提案する。この手法は、IJB-Cで最先端の性能を達成し、トレーニング速度、推論速度、メモリ効率、精度において最大4倍の向上を実現し、リソース制約のあるデバイスへのデプロイを可能にする。

ABSTRACT

Fully convolutional networks (FCNs) have become de facto tool to achieve very high-level performance for many vision and non-vision tasks in general and face recognition in particular. Such high-level accuracies are normally obtained by very deep networks or their ensemble. However, deploying such high performing models to resource constraint devices or real-time applications is challenging. In this paper, we present a novel model compression approach based on student-teacher paradigm for face recognition applications. The proposed approach consists of training teacher FCN at bigger image resolution while student FCNs are trained at lower image resolutions than that of teacher FCN. We explored three different approaches to train student FCNs: knowledge transfer (KT), knowledge distillation (KD) and their combination. Experimental evaluation on LFW and IJB-C datasets demonstrate comparable improvements in accuracies with these approaches. Training low-resolution student FCNs from higher resolution teacher offer fourfold advantage of accelerated training, accelerated inference, reduced memory requirements and improved accuracies. We evaluated all models on IJB-C dataset and achieved state-of-the-art results on this benchmark. The teacher network and some student networks even achieved Top-1 performance on IJB-C dataset. The proposed approach is simple and hardware friendly, thus enables the deployment of high performing face recognition deep models to resource constraint devices.

研究の動機と目的

  • 大規模で計算コストの高い高精度な深層顔認識モデルを、リソース制約のあるデバイスにデプロイする課題に対処する。
  • プルーニング、量子化、アーキテクチャ変更に依存する既存の圧縮技術の限界を克服する。
  • 学生ネットワークを教師より低解像度で訓練するという、新たな学生-教師パラダイムを検討し、知識伝達と蒸留を活用する。
  • ネットワークアーキテクチャの変更やパラメータ数の削減なしに、精度と効率を向上させる。
  • ハードウェアフレンドリーな圧縮により、エッジデバイスにおける高パフォーマンス顔認識モデルの実用的デプロイを実現する。

提案手法

  • 高解像度入力(例:112×112)で完全畳み込みネットワーク(FCN)として教師をトレーニングし、豊富な特徴を捉える。
  • 教師と同じアーキテクチャを持つが、段階的に低解像度(例:48×48 から 112×112)で学生FCNをトレーニングする。
  • トレーニング中に教師のレイヤーパラメータを学生に伝達することで、知識伝達(KT)を適用する。
  • 教師のソフトラベル確率および中間層特徴表現を学生に伝達することで、知識蒸留(KD)を適用する。
  • KTとKDを組み合わせて学生ネットワークを共同でトレーニングし、初期化からトレーニングするのとは異なる性能向上を実現する。
  • 顔検出にはMTCNNを、特徴表現品質の向上には平均特徴プーリングを用いる。

実験結果

リサーチクエスチョン

  • RQ1高解像度の教師ネットワークからの知識伝達および蒸留は、顔認識における低解像度の学生ネットワークの性能を向上させることができるか?
  • RQ2教師が高解像度であるのに対し、学生ネットワークを低解像度でトレーニングすることで、精度を損なわずにトレーニングおよび推論を高速化できるか?
  • RQ3本手法は、アーキテクチャの変更やパラメータプルーニングなしに、IJB-Cなどのベンチマークデータセットで最先端の精度を達成できるか?
  • RQ4本手法を用いた深層顔認識モデルの圧縮において、モデルサイズ、推論速度、精度の間のトレードオフはいかなるものか?
  • RQ5知識伝達と蒸留の組み合わせは、異なる入力解像度において学生ネットワークの性能向上にどの程度効果的か?

主な発見

  • 96×96および80×80解像度で知識伝達(KT)を用いてトレーニングされた学生ネットワークは、IJB-C 1:1ミックス検証プロトコルでトップ1精度を達成した。
  • 80×80解像度の学生ネットワークは、教師と比較してCPU推論時間を51%短縮し、MACC演算数を49%削減しながら、同等の精度を維持した。
  • IJB-C 1:1検証プロトコル(FAR = 10⁻⁴)において、KTにより96×96解像度で精度が95.89%(KTなし)から96.05%に向上した。
  • 48×48解像度では、10⁻⁴ FARで1:1検証精度が91.74%から93.94%に向上し、低解像度でも顕著な向上が確認された。
  • すべての学生ネットワークは、IJB-C 1:1検証および1:N識別プロトコルで最先端の結果を達成し、教師ネットワークもトップ1性能を達成した。
  • 本手法は、アーキテクチャの変更やパラメータ量子化なしに、トレーニングの高速化、推論の高速化、メモリ使用量の削減、精度向上という4倍の利点を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。