Skip to main content
QUICK REVIEW

[論文レビュー] Killing Two Birds with One Stone:Efficient and Robust Training of Face Recognition CNNs by Partial FC

Xiang An, Jiankang Deng|arXiv (Cornell University)|Mar 28, 2022
Face recognition and analysis被引用数 6
ひとこと要約

本稿では、各学習イテレーションで負例クラスの中心のサブセットと正例クラスの中心のみを選択してマージンベースのソフトマックス損失を計算する、スパarsely更新される完全結合層(Partial FC: PFC)を提案する。計算コストを著しく削減することで、クラス間の衝突や末端クラスにおける受動的更新を軽減し、WebFace42Mのような大規模データセット上での顔認識モデルの効率的で堅牢かつ高精度な学習を可能にする。PFCは、最大5倍の高速化とGPUメモリ使用量の50%削減を実現し、IJB-Cで98.00%という最先端の精度を達成した。

ABSTRACT

Learning discriminative deep feature embeddings by using million-scale in-the-wild datasets and margin-based softmax loss is the current state-of-the-art approach for face recognition. However, the memory and computing cost of the Fully Connected (FC) layer linearly scales up to the number of identities in the training set. Besides, the large-scale training data inevitably suffers from inter-class conflict and long-tailed distribution. In this paper, we propose a sparsely updating variant of the FC layer, named Partial FC (PFC). In each iteration, positive class centers and a random subset of negative class centers are selected to compute the margin-based softmax loss. All class centers are still maintained throughout the whole training process, but only a subset is selected and updated in each iteration. Therefore, the computing requirement, the probability of inter-class conflict, and the frequency of passive update on tail class centers, are dramatically reduced. Extensive experiments across different training data and backbones (e.g. CNN and ViT) confirm the effectiveness, robustness and efficiency of the proposed PFC. The source code is available at \https://github.com/deepinsight/insightface/tree/master/recognition.

研究の動機と目的

  • 標準的な完全結合(FC)層を用いた数百万のアイデンティティを含む顔認識モデルの学習における、高いメモリ使用量と計算コストを低減すること。
  • WebFace42Mのような自動収集された大規模データセットにおけるクラス間の衝突やラベルノイズがモデル性能を低下させることを軽減すること。
  • 長尾分布における未代表化された末端クラスの中心に対する更新頻度の低減。
  • モデル精度を損なわずに単一GPU環境でも効率的な学習を可能にすること。
  • 主要ベンチマークで最先端の性能を達成するとともに、学習コストを顕著に低減すること。

提案手法

  • PFCは訓練中に全クラス中心を維持するが、各イテレーションでサンプリングされたサブセットのみを更新する。
  • 各フォワードパスでは、正例クラス中心は正解ラベルに基づいて選択され、負例クラス中心からランダムにサブセットが選択されて損失計算に用いられる。
  • マージンベースのソフトマックス損失は、選択された正例および負例クラス中心の間でのみ計算され、計算複雑度はO(N)からO(rN)に低下する。ここでrはサンプリング比である。
  • 全クラス中心は保持され、更新はサンプリングされたサブセットのみに限定されるため、モデルの安定性と収束性が保証される。
  • ラベルノイズにさらされた状況下でもさらなる堅牢性を向上させるため、シンプルなオンライン異常クラス間フィルタリング機構を適用する。
  • 本手法は、CNNやビジョン変換器(ViT)を含むさまざまなバックボーンと互換性を持つ。

実験結果

リサーチクエスチョン

  • RQ1スパarsely更新される完全結合層は、性能を劣化させることなく、大規模顔認識学習における学習コストを低減できるか?
  • RQ2負例クラス中心の部分的サンプリングは、ラベルノイズやクラス間衝突に対するモデルの堅牢性にどのように影響するか?
  • RQ3PFCは、WebFace42Mのような大規模データセット上でのGPUメモリ使用量と学習時間をどの程度削減できるか?
  • RQ4従来のサンプリング手法やFCフリー手法と比較して、PFCは長尾データ分布下でどのように性能を発揮するか?
  • RQ5PFCは、IJB-C や CFP-FP のような主要ベンチマークで最先端の精度を達成できるか、かつ単一ノードでの学習を可能にできるか?

主な発見

  • ResNet100を用いてWebFace42Mで学習したPFC-0.1は、MFR-Allで96.19%の認証精度を達成し、FCベースラインや他のサンプリング手法を上回った。
  • ResNet100を用いたPFC-0.008は、IJB-Cで97.51%の精度を達成し、FC計算コストはほぼ無視できるほど低く、極めて高い効率性を示した。
  • 1000万アイデンティティの合成データセット上では、PFC-0.1はFCベースラインと比較して5倍の高速化が達成され、GPUメモリ使用量は半分未満であった。
  • PFC-0.2は長尾分布下でMFR-Allで91.96%の精度を達成し、FCベースラインを4.52%、DCQを2.59%上回った。
  • PFC-0.3はIJB-Cで98.00%、CFP-FPで99.51%の精度を達成し、複数のベンチマークで新たな最先端の結果を樹立した。
  • r=0.04でWebFace4Mで学習したPFCモデルは、パラメータを100倍以上削減したVirtual FCと比較しても、IJB-Bで27.47%、IJB-Cで25.33%の高い性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。