Skip to main content
QUICK REVIEW

[論文レビュー] The Elements of End-to-end Deep Face Recognition: A Survey of Recent Advances

Hang Du, Hailin Shi|arXiv (Cornell University)|Sep 28, 2020
Face recognition and analysis被引用数 14
ひとこと要約

このサーベイは、深層畳み込みニューラルネットワーク(DCNN)を用いたエンドツーエンドのディープフェイス認識、すなわち顔検出、アライメント、表現の各分野を包括的にレビューしている。強力なベースライン手法を特定し、各コンponent間の相互作用を分析するとともに、ロバストでフェアかつ解釈可能なフェイス認識システムにおける主な課題と今後の方向性を提示している。

ABSTRACT

Face recognition is one of the most popular and long-standing topics in computer vision. With the recent development of deep learning techniques and large-scale datasets, deep face recognition has made remarkable progress and been widely used in many real-world applications. Given a natural image or video frame as input, an end-to-end deep face recognition system outputs the face feature for recognition. To achieve this, a typical end-to-end system is built with three key elements: face detection, face alignment, and face representation. The face detection locates faces in the image or frame. Then, the face alignment is proceeded to calibrate the faces to the canonical view and crop them with a normalized pixel size. Finally, in the stage of face representation, the discriminative features are extracted from the aligned face for recognition. Nowadays, all of the three elements are fulfilled by the technique of deep convolutional neural network. In this survey article, we present a comprehensive review about the recent advance of each element. To start with, we present an overview of the end-to-end deep face recognition. Then, we review the advance of each element, respectively, covering many aspects such as the to-date algorithm designs, evaluation metrics, datasets, performance comparison, existing challenges, and promising directions for future research. Also, we provide a detailed discussion about the effect of each element on its subsequent elements and the holistic system. Through this survey, we wish to bring contributions in two aspects: first, readers can conveniently identify the methods which are quite strong-baseline style in the subcategory for further exploration; second, one can also employ suitable methods for establishing a state-of-the-art end-to-end face recognition system from scratch.

研究の動機と目的

  • エンドツーエンドのディープフェイス認識分野における最近の進展を体系的にレビューすること。特に、顔検出、顔アライメント、顔表現という3つのコアなコンponentに焦点を当てる。
  • 各コンponentが次の段階および全体のシステムに与える影響を、相互依存性と性能への影響を分析すること。
  • 各サブタスクにおける強力なベースライン手法を特定し、今後の研究およびシステム開発を支援すること。
  • ドメイン一般化、ロングテイルデータ、ノイズの多いラベル、ラベルなしデータの活用といったオープンチャレンジを強調すること。
  • 解釈可能なモデル、統合最適化、ユニバーサル事前学習、信頼性のあるシステムといった今後の研究方向性を提案すること。

提案手法

  • 深層畳み込みニューラルネットワーク(DCNN)を用いた顔検出、顔アライメント、顔表現分野における最先端手法をサーベイすること。
  • 標準指標(例:mAP、正答率)およびベンチマークデータセット(例:MS-Celeb-1M、CASIA-WebFace)に基づいてアルゴリズムを評価すること。
  • アブレーションおよび比較研究を通じて、各コンponentが下流の性能に与える影響を分析すること。
  • 3段階の各段階において、アーキテクチャ設計、損失関数、トレーニング戦略の観点から手法を分類すること。
  • ラベルなしデータの活用のため、半教師あり学習、クラスタリング、自己教師あり事前学習の知見を統合すること。
  • エンドツーエンドトレーニングの包括的フレームワークを提案し、下流の顔認識タスクにおけるユニバーサル事前学習の推奨を提唱すること。

実験結果

リサーチクエスチョン

  • RQ1最近のディープラーニング手法は、エンドツーエンドのフェイス認識における顔検出、アライメント、表現の各分野をどのように改善しているか?
  • RQ2各コンponent(検出、アライメント、表現)の性能が、全体のシステム精度に与える影響は何か?
  • RQ3各サブタスクにおける強力なベースライン手法は何か。今後の研究における公平な比較に使用できるか?
  • RQ4実世界の応用において、クロスドメイン認識、ロングテイルデータ、ノイズの多いラベル、ラベルなしデータに関する主な課題は何か?
  • RQ5統合モデリングとユニバーサル事前学習を活用することで、エンドツーエンドシステムをより解釈可能で、フェアで、ロバストかつ信頼性のあるものにできるか?

主な発見

  • DCNNベースの検出器のおかげで顔検出は著しく進歩し、大規模データセットでも高い正確性を達成しているが、極端な条件下での課題は依然残っている。
  • 深層ランドマーク検出を用いた顔アライメントは、ポーズや照明の変化が激しい状況でも表現品質を向上させる。
  • DCNNを用いた顔表現は、主要なベンチマークで人間水準に近い性能を達成しており、マージンベースおよびトリプレット損失関数が特に効果的である。
  • システム全体の性能は、最も弱いコンponentに制限されてしまうことが明らかになった。これは、コンponentレベルの最適化とコンponent間の連携の重要性を示している。
  • ロングテイルデータとドメインシフトは依然として主要な課題であり、特に代表が不足しているクラスやドメインでは性能の低下が観察されている。
  • 自己教師ありおよび非教師あり事前学習は、下流の顔認識タスクを向上させるユニバーサルな顔表現を学習する上で有望である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。