Skip to main content
QUICK REVIEW

[論文レビュー] An Automatic System for Unconstrained Video-Based Face Recognition

Jingxiao Zheng, Rajeev Ranjan|arXiv (Cornell University)|Dec 10, 2018
Face recognition and analysis参考文献 59被引用数 9
ひとこと要約

本論文は、マルチスケール顔検出、品質に配慮した顔同定、および顔認識のための新規な部分空間間類似度メトリックを統合した、制約なし動画ベース顔認識のための頑健でエンドツーエンドのシステムを提示する。このシステムは、IJB-BおよびIJB-Sベンチマークで最先端の性能を達成し、FOCSで人間水準を超える正確性を示し、監視映像から単一画像への照合プロトコルおよび監視映像から予約データへの照合プロトコルにおいてArcFaceを上回る。これは、品質に配慮した部分空間学習と分散に配慮したマッチングを活用することで実現された。

ABSTRACT

Although deep learning approaches have achieved performance surpassing humans for still image-based face recognition, unconstrained video-based face recognition is still a challenging task due to large volume of data to be processed and intra/inter-video variations on pose, illumination, occlusion, scene, blur, video quality, etc. In this work, we consider challenging scenarios for unconstrained video-based face recognition from multiple-shot videos and surveillance videos with low-quality frames. To handle these problems, we propose a robust and efficient system for unconstrained video-based face recognition, which is composed of modules for face/fiducial detection, face association, and face recognition. First, we use multi-scale single-shot face detectors to efficiently localize faces in videos. The detected faces are then grouped respectively through carefully designed face association methods, especially for multi-shot videos. Finally, the faces are recognized by the proposed face matcher based on an unsupervised subspace learning approach and a subspace-to-subspace similarity metric. Extensive experiments on challenging video datasets, such as Multiple Biometric Grand Challenge (MBGC), Face and Ocular Challenge Series (FOCS), IARPA Janus Surveillance Video Benchmark (IJB-S) for low-quality surveillance videos and IARPA JANUS Benchmark B (IJB-B) for multiple-shot videos, demonstrate that the proposed system can accurately detect and associate faces from unconstrained videos and effectively learn robust and discriminative features for recognition.

研究の動機と目的

  • ポーズ、照明、ぼやけ具合、品質の面で顔認識に大きな映像内・映像間のばらつきが生じる制約なしの動画ベース顔認識の課題に対処すること。
  • 大量の動画データを最小限の人的介入で処理できるスケーラブルで効率的なシステムの開発。
  • 顔テンプレートを部分空間としてモデル化し、品質および分散に配慮した類似度メトリックを用いることで認識精度の向上。
  • 特に低品質およびマルチショット条件下での性能を向上させるために、IJB-BおよびIJB-Sのような困難なベンチマークで既存手法を上回ること。

提案手法

  • 制約なしの動画における高速かつ正確な顔検出のため、マルチスケールのワンショット検出器を採用する。
  • 特にシーンチェンジや視点変化があるマルチショット動画においても、複数のショットにまたがる顔をグループ化するためのカスタム顔同定戦略を用いる。
  • 教師なし部分空間学習により学習された低次元部分空間として顔テンプレートを表現し、サンプル間の相関関係を捉える。
  • テンプレート表現の段階で、高品質なフレームに高い重みを割り当てる品質に配慮したエグジンプラ構築法を導入する。
  • 部分空間間の類似度を計算するために分散に配慮した射影メトリック(VPM)を適用し、外見のばらつきに対する耐性を高める。
  • 品質に配慮したコサイン距離、品質に配慮した部分空間学習、分散に配慮した射影メトリックを統合した類似度測定(QCos+QSub-VPM)を構築する。

実験結果

リサーチクエスチョン

  • RQ1品質に配慮した部分空間表現は、低品質および制約なしの動画環境下での顔認識性能を向上させ得るか?
  • RQ2部分空間類似度メトリックに分散情報を組み込むことで、多様な動画条件下での認識の頑健性はどのように向上するか?
  • RQ3マルチショットおよび監視映像における顔同定の正確性は、全体の認識性能にどの程度影響を与えるか?
  • RQ4提案された部分空間間類似度測定は、オープンセット動画顔識別において、従来のエグジンプラベースまたは埋め込みベースのマッチングを上回るか?
  • RQ5本手法のシステムは、オープンセット識別プロトコル下で、FOCSのような困難な動画ベンチマークで人間水準を超える性能を示せるか?

主な発見

  • 提案されたシステムは、IJB-BおよびIJB-Sベンチマークで最先端の性能を達成し、すべてのプロトコルでランク1正確性が顕著に向上した。
  • IJB-Sの監視映像から監視映像へのプロトコルにおいて、高解像度ギャラリー設定ではArcFaceを上回り、品質に配慮したマッチングにより一貫した向上を示した。
  • アブレーションスタディにより、各構成要素(品質に配慮したエグジンプラ、部分空間学習、分散に配慮したメトリック)が順次性能向上に寄与していることが確認された。
  • FOCSデータセットでは人間水準を超える性能を達成し、システムの頑健さと識別力の高さを示した。
  • ネットワークDとEの統合は、監視映像から監視映像へのプロトコルでは性能向上をもたらさなかった。これは、低品質ギャラリーテンプレートの表現が不十分であるためと推測される。
  • 提案されたQCos+QSub-VPM類似度メトリックは、すべてのデータセットおよび特徴タイプ(ArcFace特徴を含む)において、ベースライン手法を一貫して上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。