Skip to main content
QUICK REVIEW

[論文レビュー] Masked Face Recognition with Generative-to-Discriminative Representations

Shiming Ge, Weijia Guo|arXiv (Cornell University)|May 27, 2024
Face recognition and analysis被引用数 4
ひとこと要約

本稿は、マスク付き顔認識のための生成的から判別的表現学習フレームワークを提案する。3モジュールのネットワークを用いる:事前学習済みの生成的エンコーダ(遮蔽に強い、カテゴリに敏感な記述子を生成)、知識蒸留によって微調整された判別的リフォーマ(アイデンティティに敏感な特徴を生成)、分類器ヘッド。本手法は合成および実際のマスク付き顔ベンチマークで最先端の性能を達成し、CPLFWでは92.86%、合成LFWではArcFaceを教師モデルとして用いることで98.02%の精度を達成した。

ABSTRACT

Masked face recognition is important for social good but challenged by diverse occlusions that cause insufficient or inaccurate representations. In this work, we propose a unified deep network to learn generative-to-discriminative representations for facilitating masked face recognition. To this end, we split the network into three modules and learn them on synthetic masked faces in a greedy module-wise pretraining manner. First, we leverage a generative encoder pretrained for face inpainting and finetune it to represent masked faces into category-aware descriptors. Attribute to the generative encoder's ability in recovering context information, the resulting descriptors can provide occlusion-robust representations for masked faces, mitigating the effect of diverse masks. Then, we incorporate a multi-layer convolutional network as a discriminative reformer and learn it to convert the category-aware descriptors into identity-aware vectors, where the learning is effectively supervised by distilling relation knowledge from off-the-shelf face recognition model. In this way, the discriminative reformer together with the generative encoder serves as the pretrained backbone, providing general and discriminative representations towards masked faces. Finally, we cascade one fully-connected layer following by one softmax layer into a feature classifier and finetune it to identify the reformed identity-aware vectors. Extensive experiments on synthetic and realistic datasets demonstrate the effectiveness of our approach in recognizing masked faces.

研究の動機と目的

  • 実世界の応用における遮蔽および情報損失の影響により生じるマスク付き顔認識の課題に対処すること。
  • 生成的モデルの文脈回復能力と判別的モデルのアイデンティティ識別能力を統合することで、純粋な生成的または判別的アプローチの限界を克服すること。
  • マスク付きおよびマスクなしの両方の顔に対して性能を維持する統合的でエンド・ツー・エンドで訓練可能なフレームワークを構築すること。
  • 異なるマスクタイプに対して一貫性のある、アイデンティティに敏感な表現を学習することで、遮蔽の意味的変動にかかわらず耐性を高めること。
  • 効率的な推論速度(RTX 3090で23.35 FPS)を実現し、実用的導入を可能とすること。

提案手法

  • 合成マスク付き顔で事前学習された顔補完エンコーダを生成的エンコーダとして用い、遮蔽された顔からカテゴリに敏感な記述子を生成するよう微調整することで、文脈的な顔の情報を回復する能力を活用する。
  • 22層の畳み込み判別的リフォーマを導入し、事前学習済みの顔認識モデル(例:ArcFace や VGGFace2)からの知識蒸留を用いて、カテゴリに敏感な記述子をアイデンティティに敏感な特徴に変換する。
  • マルチロス訓練戦略を採用:アイデンティティ分類のためのクロスエントロピー損失、特徴再構成のためのL1損失、教師モデルからの関係に敏感な表現を転送するための知識蒸留。
  • グリーディでモジュール単位の事前学習を実施:まず合成マスク付き顔で生成的エンコーダを事前学習し、次に知識蒸留と分類信号を用いて判別的リフォーマと特徴分類器を同時に微調整する。
  • 事前学習後、バックボーン(生成的エンコーダ+判別的リフォーマ)を固定し、下流の認識タスクでは最終分類器ヘッドのみを微調整する。
  • データオーグメンテーションおよび合成マスク付き顔の生成を用いて、多様なマスクタイプにわたる耐性と一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1生成的および判別的コンponentsを統合した統合ネットワークアーキテクチャは、単独の生成的または判別的モデルと比較して、マスク付き顔認識の精度を向上させることができるか?
  • RQ2高精度な顔認識モデルからの知識蒸留は、マスク付き顔から学習された表現の判別力を向上させるか?
  • RQ3顔補完で事前学習された生成的エンコーダは、マスク付き顔認識に一般化可能な、遮蔽に頑健な記述子を生成できるか?
  • RQ4提案された生成的から判別的へのパイプラインは、合成および現実的マスク付き顔データセットの両方でどの程度の性能を示すか?
  • RQ5マスク付き顔認識の向上を図る一方で、本手法は通常の顔認識の性能をどの程度維持できるか?

主な発見

  • 提案されたG2Dモデルは、マスク付き顔認識のCPLFWベンチマークで92.86%の精度を達成し、MaskInv や SphereFace などの先行手法を上回った。
  • 合成マスク付きLFWでは、ArcFaceを蒸留教師として用いることで98.02%の認証精度に達した。VGGFace2を用いた場合は97.58%であった。
  • 学習された表現の類似度スコア分布は、正例対と負例対の重なりが最小限に抑えられており、理想に近い強い判別性を示している。
  • 通常の顔認識においても競争力ある性能を維持し、CPLFWで92.23%の精度を示しており、マスク付きおよびマスクなしの入力に対して耐性があることが示された。
  • 推論速度はRTX 3090 1枚で23.35 FPSに達しており、都市統治や公共安全システムにおけるリアルタイム導入の可能性を示している。
  • アブレーションスタディの結果、アイデンティティ学習において直接的なクロスエントロピー監視よりも知識蒸留がより効果的であることが確認され、蒸留を用いたモデルは収束性と性能が優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。