Skip to main content
QUICK REVIEW

[論文レビュー] AirFace: Lightweight and Efficient Model for Face Recognition

Xianyang Li, Feng Wang|arXiv (Cornell University)|Jul 29, 2019
Face recognition and analysis参考文献 20被引用数 8
ひとこと要約

本稿では、新規の損失関数 Li-ArcFace と注意メカニズムを統合した強化版 MobileFaceNet アーキテクチャ、およびトレーニング最適化を組み合わせた軽量で効率的な顔認識モデル AirFace を提案する。Li-ArcFace は、ArcFace のコサインベースのマージンを角度の線形関数に置き換えることで、小規模な埋め込みサイズ(例:128D)における収束性を向上させ、事前学習を必要とせずエンド・ツー・エンドのトレーニングが可能となり、LFR2019 および MegaFace Challenge 1 で最先端の性能を達成する。

ABSTRACT

With the development of convolutional neural network, significant progress has been made in computer vision tasks. However, the commonly used loss function softmax loss and highly efficient network architecture for common visual tasks are not as effective for face recognition. In this paper, we propose a novel loss function named Li-ArcFace based on ArcFace. Li-ArcFace takes the value of the angle through linear function as the target logit rather than through cosine function, which has better convergence and performance on low dimensional embedding feature learning for face recognition. In terms of network architecture, we improved the the perfomance of MobileFaceNet by increasing the network depth, width and adding attention module. Besides, we found some useful training tricks for face recognition. With all the above results, we won the second place in the deepglint-light challenge of LFR2019.

研究の動機と目的

  • 128D などの小規模な埋め込みサイズのモデルをスクラッチからトレーニングする際の ArcFace の収束性の悪さを解消すること。
  • ネットワークアーキテクチャとトレーニング手順の最適化を通じて、モバイルデバイスにおける顔認識性能を向上させること。
  • 事前学習を必要とせず、クラス間の分離性を高め、クラス内での密着性を向上させる損失関数の開発。
  • DeepGlint-Light Challenge 2019 のようなリソース制限環境でも最先端の性能を達成すること。
  • 効率的なネットワーク設計とトレーニングテクニックが顔認識ベンチマークにおける性能を顕著に向上させることを示すこと。

提案手法

  • ArcFace のコサインベースの角度マージンを角度の線形関数に置き換えた新たな加法的マージン損失関数 Li-ArcFace を提案し、トレーニングの安定性と収束性を向上させる。
  • MobileFaceNet を深さと幅を増加させるとともに、 squeeze-and-excitation (SE) 注目モジュールを統合することで、特徴表現を向上させる。
  • 最終埋め込み層を除くすべての層に対して重み減衰乗数を 5e-4 に設定し、最適化の安定性を向上させる。最終埋め込み層には 5e-3 を使用。
  • Li-ArcFace のマージンハイパーパramータ m を 0.4 から 0.45 の範囲でチューニングし、最適な性能が m=0.4 時に得られた。
  • MS1M-retina データセットを用いたデータ前処理と、InsightFace の顔検出およびアライメントパイプラインを実装。
  • SGD とモーメンタムを用いてエンド・ツー・エンドでモデルをトレーニングし、LFW、CFP-FP、AgeDB、MegaFace Challenge 1 などの標準ベンチマークで評価。

実験結果

リサーチクエスチョン

  • RQ1スクラッチからトレーニングする際、小規模な埋め込みサイズ(例:128D)のモデルに対して、修正された損失関数が収束性と性能を向上させられるか。
  • RQ2Li-ArcFace は、低次元顔埋め込みにおける ArcFace や CosFace と比較して、収束性と精度の面で優れているか。
  • RQ3MobileFaceNet のアーキテクチャ的改善が、計算コストを増加させずに顔認識精度をどの程度向上させられるか。
  • RQ4どのようなトレーニングテクニックが、軽量顔認識モデルの性能を顕著に向上させるか。
  • RQ5軽量モデルが、MegaFace Challenge 1 や DeepGlint-Light Challenge 2019 といった主要ベンチマークで最先端の性能を達成できるか。

主な発見

  • Li-ArcFace は LFW で 99.27%、CFP-FP で 94.20%、AgeDB で 93.25% の認証精度を達成し、ほとんどの設定で ArcFace や CosFace を上回った。
  • DeepGlint-Light Challenge 2019 では、1e-8 FPR 時に 88.415% の認証精度を達成し、2位を獲得した。
  • MegaFace Challenge 1 では、1e-6 FAR 時に 97.93% の認証 TAR を達成し、FLOPs はたったの 1G にとどまり、MobileFaceNet を上回り、より大きなモデルと同等の性能を示した。
  • Li-ArcFace は小規模な埋め込みサイズにおいて、ArcFace よりも優れた収束性を示し、ソフトマックス損失による事前学習の必要性を排除した。
  • 注目モジュールとアーキテクチャ的強化を施したモデルは、標準の MobileFaceNet と比較して AgeDB で 6% 以上の性能向上を達成した。
  • Li-ArcFace の最適なマージンハイパーパramータは m=0.4 であり、m=0.5 以上に設定すると性能がわずかに低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。