Skip to main content
QUICK REVIEW

[論文レビュー] Cross-spectral Face Completion for NIR-VIS Heterogeneous Face Recognition

Ran He, Jie Cao|arXiv (Cornell University)|Feb 10, 2019
Face recognition and analysis参考文献 5被引用数 8
ひとこと要約

本論文は、近赤外(NIR)入力から高解像度の正面可視(VIS)顔画像を、テクスチャ補完とポーズ補正のコンponentを統合することで、エンドツーエンドの深層生成フレームワークであるクロススペクトル顔補完(CFC)を提案する。1対多の教師なし画像変換を1対1のペアド変換に変換することで、CFCはCASIA NIR-VIS 2.0データセットにおいて、100%のランク1精度を達成し、異種顔認識性能を顕著に向上させた。

ABSTRACT

Near infrared-visible (NIR-VIS) heterogeneous face recognition refers to the process of matching NIR to VIS face images. Current heterogeneous methods try to extend VIS face recognition methods to the NIR spectrum by synthesizing VIS images from NIR images. However, due to self-occlusion and sensing gap, NIR face images lose some visible lighting contents so that they are always incomplete compared to VIS face images. This paper models high resolution heterogeneous face synthesis as a complementary combination of two components, a texture inpainting component and pose correction component. The inpainting component synthesizes and inpaints VIS image textures from NIR image textures. The correction component maps any pose in NIR images to a frontal pose in VIS images, resulting in paired NIR and VIS textures. A warping procedure is developed to integrate the two components into an end-to-end deep network. A fine-grained discriminator and a wavelet-based discriminator are designed to supervise intra-class variance and visual quality respectively. One UV loss, two adversarial losses and one pixel loss are imposed to ensure synthesis results. We demonstrate that by attaching the correction component, we can simplify heterogeneous face synthesis from one-to-many unpaired image translation to one-to-one paired image translation, and minimize spectral and pose discrepancy during heterogeneous recognition. Extensive experimental results show that our network not only generates high-resolution VIS face images and but also facilitates the accuracy improvement of heterogeneous face recognition.

研究の動機と目的

  • NIRとVISスペクトル間のクロススペクトル顔認識の課題に対処すること。NIR画像は自己遮蔽とセンシングギャップのため、テクスチャが不完全になる。
  • 非正面のNIR顔を正面のVISポーズに変換するポーズ補正コンponentを導入することで、1対多の教師なし画像変換の複雑さを軽減すること。
  • ピクセル、 adversarial、およびアイデンティティ保持損失を統合したマルチスケールおよび細分化された識別器を用いて、合成品質と認識精度を向上させること。
  • 異種顔認識におけるクロススペクトル顔合成のための包括的評価を可能にする、CASIA NIR-VIS 2.0における新しいベンチマークを確立すること。

提案手法

  • フレームワークは、NIR入力からVISテクスチャを生成するテクスチャ補完コンponentと、非正面のNIR顔を正面のVISポーズにマッピングするポーズ補正コンponentを統合する。
  • ワープ処理により、2つのコンponentをエンドツーエンドの深層ネットワークに統合し、1つのNIR入力から対応する正面VIS出力へのペアド画像変換を可能にする。
  • マルチスケールウェーブレットベースの識別器が高周波成分と視覚的品質を監視する一方、細分化された識別器は生成された顔のクラス内ばらつきを低減する。
  • 損失関数はピクセル損失、2つの adversarial 損失(最終画像用とウェーブレット分解用)、およびアイデンティティ保持損失を組み合わせており、アイデンティティの一貫性を維持する。
  • 実際のNIR-VISペアと合成データ拡張を組み合わせた訓練法を採用し、スペクトル的およびポーズ的差異を最小限に抑えることを目的とする。

実験結果

リサーチクエスチョン

  • RQ11対多の教師なし変換ではなく、ペアド画像変換問題としてクロススペクトル顔合成をモデル化することで、1対多の教師なし変換と比較して認識精度が向上するか?
  • RQ2ポーズ補正とテクスチャ補完の統合は、生成されたVIS顔におけるクラス内ばらつきの低減と視覚的忠実性の向上にどの程度効果的か?
  • RQ3マルチスケールおよび細分化された識別器は、生成されたNIRからVISへの顔画像の知覚的品質および認識性能をどの程度向上させるか?
  • RQ4統合された生成フレームワークは、ドメイン間のペアド訓練データを必要とせず、異種顔認識ベンチマークで最先端の性能を達成できるか?

主な発見

  • CFCはCASIA NIR-VIS 2.0データセットで100%のランク1精度を達成し、異種顔認識における画像合成によるこの高スコアは、本研究が初めての記録である。
  • Oulu-CASIA NIR-VISデータベースでは、CFCは1%のFAR(False Acceptance Rate)で99.9%のランク1精度、0.1%のFARで98.1%の認証率、90.7%のFAR=0.1%の認証率を達成し、比較対象のすべての手法を上回った。
  • アブレーションスタディにより、アイデンティティ保持損失が耳や髪の毛などの微細な顔面特徴の再構成を顕著に向上させ、これらがNIR画像ではしばしば欠落していることが確認された。
  • ウェーブレットベースのマルチスケール識別器は、局所的テクスチャ品質を向上させ、単一スケールの代替手法と比較して、より鋭い顔面特徴とぼやけの低減を示した。
  • 最終画像に対する adversarial 識別器(L_G_F, L_D_F)を削除すると、結果がぼやけたものとなり、視覚的品質を保持する上でその重要性が裏付けられた。
  • ポーズ補正コンponentにより1対1の変換が可能となり、学習問題が単純化され、ドメインシフトが低減し、これが高い認識精度に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。