Skip to main content
QUICK REVIEW

[論文レビュー] Coupled Deep Learning for Heterogeneous Face Recognition

Xiang Wu, Lingxiao Song|arXiv (Cornell University)|Apr 8, 2017
Face recognition and analysis参考文献 32被引用数 11
ひとこと要約

本稿では、トレースノルムとブロック・ディアゴナル事前分布を関連性制約として用い、NIR および VIS 顔画像を共有の特徴空間にアライメントすることで、異種顔認識のための新規なディープラーニングフレームワーク、カップルド・ディープラーニング(CDL)を提案する。同時に、識別性を向上させるためにクロスモダリティランクングを統合する。CDL は CASIA NIR-VIS 2.0 およびスケッチ・フォトデータベースにおいて、SOTA手法を著しく上回り、1位ランク精度が 98.62%、FAR=0.1% 時の認証率が 98.32% を達成する。

ABSTRACT

Heterogeneous face matching is a challenge issue in face recognition due to large domain difference as well as insufficient pairwise images in different modalities during training. This paper proposes a coupled deep learning (CDL) approach for the heterogeneous face matching. CDL seeks a shared feature space in which the heterogeneous face matching problem can be approximately treated as a homogeneous face matching problem. The objective function of CDL mainly includes two parts. The first part contains a trace norm and a block-diagonal prior as relevance constraints, which not only make unpaired images from multiple modalities be clustered and correlated, but also regularize the parameters to alleviate overfitting. An approximate variational formulation is introduced to deal with the difficulties of optimizing low-rank constraint directly. The second part contains a cross modal ranking among triplet domain specific images to maximize the margin for different identities and increase data for a small amount of training samples. Besides, an alternating minimization method is employed to iteratively update the parameters of CDL. Experimental results show that CDL achieves better performance on the challenging CASIA NIR-VIS 2.0 face recognition database, the IIIT-D Sketch database, the CUHK Face Sketch (CUFS), and the CUHK Face Sketch FERET (CUFSF), which significantly outperforms state-of-the-art heterogeneous face recognition methods.

研究の動機と目的

  • NIR と VIS モダリティ間の顕著なドメイン差異と、限られたペアドトレーニングデータの課題に対処すること。
  • 照明やセンサータイプに起因するモダリティ固有の外観差異に起因するクラス内変動を低減し、マッチング精度を向上させること。
  • 限られた NIR-VIS ペアドサンプルに対して、大規模な VIS データを活用して一般化性能を向上させるディープラーニングフレームワークを開発すること。
  • 共有埋め込み空間における関連性およびランク付け制約の共同最適化を通じて、特徴の識別性とモダリティ不変性を向上させること。
  • 低ランクおよびブロック・ディアゴナル構造を持つ制約付きパラメータ共有と反復的最適化を用いた、CNN の有効なエンド・ツー・エンド訓練を可能にすること。

提案手法

  • トレースノルムとブロック・ディアゴナル事前分布の制約を組み合わせたカップルド・ディープラーニング(CDL)の目的関数を導入し、VIS および NIR 投影行列間の相関を強制する。
  • 非凸的トレースノルム制約の微分可能な最適化を可能にする近似変分定式化を用いることで、エンド・ツー・エンドのバックプロパゲーションを促進する。
  • 1つのNIR画像と、異なる個人の2つのVIS画像からなるトリプレットサンプルにクロスモダリティランクング損失を組み込み、クラス間マージンを最大化し、識別性を向上させる。
  • 交互最小化を適用して、ディープネットワークのパラメータと低ランク構造を同時に最適化し、収束性と一般化性能を向上させる。
  • モダリティ間で浅い層の重みを共有することで、限られたペアドデータにおける過学習を低減し、パラメータの効率を向上させる。
  • 組み合わせ損失(ソフトマックスに関連性制約を加えたもの + クロスモダリティランクング)を用いて、確率的勾配降下法でモデルをエンド・ツー・エンドに訓練する。

実験結果

リサーチクエスチョン

  • RQ1トレースノルムおよびブロック・ディアゴナル事前分布という関連性制約は、異種顔認識においてモダリティ固有の変動を効果的に低減しつつ、アイデンティティ情報を保持できるか?
  • RQ2少数のペアドサンプルしか利用できない状況において、クロスモダリティランクング損失の統合が特徴の識別性と一般化性能を向上させるか?
  • RQ3提案された近似変分定式化は、エンド・ツー・エンドのCNNフレームワークにおいて、高次元トレースノルム制約を効率的に最適化できるか?
  • RQ4さまざまな異種顔認識ベンチマークにおいて、CDL はSOTA手法と比較して認証精度と頑健性に優れているか?
  • RQ5パラメータ共有と共同最適化を通じて、大規模なVISデータを活用することで、限られたNIR-VISペアドデータセットにおける性能がどの程度向上するか?

主な発見

  • CASIA NIR-VIS 2.0 データベースにおいて、CDL は 98.62% のランク-1精度を達成し、前回のSOTA手法 IDR(91.88%)を著しく上回る。
  • FAR=0.1% 時に、CDL は 98.32% の認証率を達成し、IDR(85.31%)および他のCNNベースの手法を上回る。
  • IIIT-D スケッチデータベースでは、CDL が 85.35% のランク-1精度を達成し、他のすべてのCNNベースの手法および既存のスケッチ-フォト認識技術を上回る。
  • 関連性制約の導入により、FAR=0.1% 時のVRが 2.20% 向上し、FAR=0.01% 時にも同様に 2.20% 向上する。
  • クロスモダリティランクング損失のみでは、ソフトマックスに関連性制約を加えたものに比べて性能が劣り、最適な性能を得るには両方の要素が必要であることが示された。
  • FAR が非常に低い場合(例:0.0001%)でも、CDL は約 75% の認証率を維持するが、他の手法(IDR:55%、ガボールベースモデル:40%未満)に比べ顕著に優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。