Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Discriminative Heterogeneous Face Recognition

Lingxiao Song, Man Zhang|arXiv (Cornell University)|Sep 12, 2017
Face recognition and analysis参考文献 42被引用数 11
ひとこと要約

本稿では、異種顔認識(HFR)のためのエンドツーエンドの敵対的特徴学習フレームワークを提案する。このフレームワークは、ピクセル空間におけるGANベースのクロススペクトル顔ハリュウネーションと、特徴空間における敵対的損失および高次分散差損失を組み合わせることで、モダリティギャップを低減する。本手法は、大規模なペアデータや複雑なアーキテクチャを必要とせず、256次元のコンパクトな特徴量を用いて、3つのNIR-VISデータベースで最先端の性能を達成した。

ABSTRACT

The gap between sensing patterns of different face modalities remains a challenging problem in heterogeneous face recognition (HFR). This paper proposes an adversarial discriminative feature learning framework to close the sensing gap via adversarial learning on both raw-pixel space and compact feature space. This framework integrates cross-spectral face hallucination and discriminative feature learning into an end-to-end adversarial network. In the pixel space, we make use of generative adversarial networks to perform cross-spectral face hallucination. An elaborate two-path model is introduced to alleviate the lack of paired images, which gives consideration to both global structures and local textures. In the feature space, an adversarial loss and a high-order variance discrepancy loss are employed to measure the global and local discrepancy between two heterogeneous distributions respectively. These two losses enhance domain-invariant feature learning and modality independent noise removing. Experimental results on three NIR-VIS databases show that our proposed approach outperforms state-of-the-art HFR methods, without requiring of complex network or large-scale training dataset.

研究の動機と目的

  • NIRとVISのような異種顔モダリティ間のセンシングギャップを解消し、正確な顔認識を実現すること。
  • ペア学習データが不足するクロススペクトル顔認識において、より優れたハリュウネーションを実現するため、二パスGNNアーキテクチャを活用すること。
  • 両モダリティ間のグローバルおよびローカル分布の差を最小化することで、ドメイン不変で判別性の高い特徴を学習すること。
  • クロススペクトル顔ハリュウネーションと判別的特徴学習を統合し、一括で最適化可能なエンドツーエンドの敵対的ネットワークを構築すること。
  • 大規模データセットや複雑なネットワークに依存せずに、コンパクトな特徴表現で高い認識精度を達成すること。

提案手法

  • ピクセル空間に二パスGNNアーキテクチャを採用し、NIR入力から写真のようなリアルなVIS顔を生成することで、グローバル構造とローカルテクスチャの両方をモデル化することで、画像品質を向上させる。
  • 特徴空間に敵対的損失を導入し、異種顔特徴のグローバル分布をモダリティ間で一致させる。
  • 高次分散差損失(CVD)を適用し、ローカル変動とモダリティに依存しないノイズを低減することで、同一人物の一貫性を向上させる。
  • ピクセル空間のハリュウネーションと特徴空間のドメイン適応を統合し、エンドツーエンドの敵対的ネットワークで一括最適化する。
  • GAN、敵対的損失、CVD損失の共同最適化により学習される256次元の特徴表現を用いる。これはコンパクトかつ判別性に優れている。

実験結果

リサーチクエスチョン

  • RQ1ピクセル空間および特徴空間における敵対的学習が、異種顔認識におけるセンシングギャップを効果的に埋めることができるか?
  • RQ2ペア学習データが限られる状況下で、二パスGNNアーキテクチャがクロススペクトル顔ハリュウネーションをどのように向上させるか?
  • RQ3敵対的損失および高次分散差損失(CVD)が、ドメイン不変で判別性の高い特徴学習をどの程度向上させるか?
  • RQ4ハリュウネーションと特徴学習を統合的に最適化することで、個別に最適化する手法よりも優れた認識性能が得られるか?
  • RQ5大規模またはペア学習データを必要とせず、コンパクトな256次元特徴表現が最先端の性能を達成できるか?

主な発見

  • CASIA NIR-VISデータベースでは、本手法がランク1正答率98.15%、FAR=0.1%における認証率97.18%を達成し、以前の最先端手法IDRよりそれぞれ0.81%および1.45%高い性能を示した。
  • BUAA-VisNirデータベースでは、ランク1正答率95.2%、FAR=0.1%における認証率88.0%を達成し、以前の最良手法IDRよりそれぞれ0.9%および3.3%高い性能を示した。
  • Oulu-CASIA NIR-VISデータベースでは、ランク1正答率95.5%、FAR=0.1%における認証率60.7%を達成し、IDRの94.3%および46.2%を上回った。
  • アブレーションスタディの結果、敵対的損失および高次分散差損失(CVD)の両方が不可欠であることが確認された。両方の損失を除去すると、特にFARが低い状況で性能が著しく低下した。
  • 本手法は、ペアデータが限られる状況下でも、二パスGNN設計のおかげで、NIR入力から写真のようなリアルなVIS画像を生成でき、効果的なクロススペクトルハリュウネーションを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。