Skip to main content
QUICK REVIEW

[論文レビュー] Improving Heterogeneous Face Recognition with Conditional Adversarial Networks

Wuming Zhang, Zhixin Shu|arXiv (Cornell University)|Sep 8, 2017
Face recognition and analysis参考文献 23被引用数 12
ひとこと要約

本論文は、2次元カラー画像から2.5次元深度画像を再構築することで、異種顔認識(HFR)の性能を向上させる条件付き生成対抗ネットワーク(cGAN)ベースの手法を提案する。この手法により、クロスモーダルなマッチングが高精度で実現可能となる。2次元と2.5次元の特徴抽出にそれぞれ独立したCNNを訓練し、マルチモーダルなマッチングスコアを統合することで、FRGC 2D/3Dベンチマークで最先端の認識精度を達成した。また、1画像あたり1.6 msというリアルタイム推論性能を実現した。

ABSTRACT

Heterogeneous face recognition between color image and depth image is a much desired capacity for real world applications where shape information is looked upon as merely involved in gallery. In this paper, we propose a cross-modal deep learning method as an effective and efficient workaround for this challenge. Specifically, we begin with learning two convolutional neural networks (CNNs) to extract 2D and 2.5D face features individually. Once trained, they can serve as pre-trained models for another two-way CNN which explores the correlated part between color and depth for heterogeneous matching. Compared with most conventional cross-modal approaches, our method additionally conducts accurate depth image reconstruction from single color image with Conditional Generative Adversarial Nets (cGAN), and further enhances the recognition performance by fusing multi-modal matching results. Through both qualitative and quantitative experiments on benchmark FRGC 2D/3D face database, we demonstrate that the proposed pipeline outperforms state-of-the-art performance on heterogeneous face recognition and ensures a drastically efficient on-line stage.

研究の動機と目的

  • プローブ画像が2次元カラー画像である一方でギャラリーに3次元深度データが存在する異種顔認識(HFR)の課題に対処すること。
  • 照明やポーズの変化に伴う2次元顔認識の限界を、3次元形状情報の活用によって克服すること。
  • 条件付きGANを用いて、1枚の2次元カラー画像から現実的な2.5次元深度画像を再構築するエンドツーエンドのフレームワークを開発すること。
  • オンライン推論時に3次元データ収集を回避しつつ、高精度な認識精度を維持した、効率的でリアルタイムなHFRを実現すること。
  • 2次元および2.5次元のマッチングスコアを統合することで、従来のクロスモーダル手法を上回る認識性能を向上させること。

提案手法

  • 2次元(カラー)および2.5次元(深度)の顔特徴抽出のための、別々の深層CNNを訓練し、事前学習済みモデルとして使用する。
  • スキップ接続とオートエンコーダーを備えた条件付きGAN(cGAN)を実装し、2次元カラー画像から2.5次元深度画像を再構築する。
  • モダリティ間の特徴を整合させるために、ソフトマックス分類損失と相関損失を組み合わせたジョイント損失関数を用いる。
  • 2次元および2.5次元特徴間のクロスモーダル相関を学習するための2方向のCNNを適用する。
  • 2次元および2.5次元のマッチングスコアを統合して、認識性能を向上させる。
  • 推論時には、2次元プローブ画像と再構築された2.5次元深度画像のみを用い、テスト時に実際の3次元データ収集を回避する。

実験結果

リサーチクエスチョン

  • RQ1条件付きGANは、HFR用に1枚の2次元カラー顔画像から現実的な2.5次元深度画像を効果的に再構築できるか?
  • RQ22次元および2.5次元のマッチングスコアの統合は、単一モーダルまたは従来のクロスモーダル手法と比較して、認識精度をどのように向上させるか?
  • RQ3頑健なクロスモーダル特徴学習を実現するためのジョイント学習目的関数において、ソフトマックス損失と相関損失の最適なバランスは何か?
  • RQ4深度再構築とマルチモーダルマッチングの複雑さを考慮しても、本手法はリアルタイム性能を達成できるか?
  • RQ5訓練データが限られているような極端な顔の状態(例:ひげ、影)において、本手法は一般化性能を示せるか?

主な発見

  • 提案手法は、Huangら(2012)のプロトコルに従い、FRGCデータセットでランク1認識精度が0.9792に達し、最先端の手法を上回った。
  • Wangら(2014)のプロトコルでは、ランク1精度が0.9745に達し、以前の最高記録0.9600を上回った。
  • 1枚の画像あたり1.6 msの速度で、単一のNVIDIA GTX TITAN X GPU上で深度画像の再構築が可能であり、リアルタイム推論を実現した。
  • アブレーションスタディの結果、相関損失の重みλ = 0.6が最適な性能をもたらし、λ > 0.8に設定すると顕著に精度が低下した。
  • 相関損失を設定しない場合(λ = 0)でも、92.45%の精度を維持しており、ソフトマックス損失のみでもネットワークが有用な特徴を学習可能であることが示された。
  • 本手法は、3次元プロトタイプモデルに依存せずに2.5次元深度再構築を達成した最初の手法であり、一般化性能の向上と、従来の3次元顔データベースへの依存度の低減に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。