Skip to main content
QUICK REVIEW

[論文レビュー] Learning a High Fidelity Pose Invariant Model for High-resolution Face Frontalization

Jie Cao, Yibo Hu|arXiv (Cornell University)|Jun 22, 2018
Face recognition and analysis被引用数 55
ひとこと要約

HF-PIMは高分解能顔を正面化するための密な対応場とテクスチャマップのワープを導入し、対向 residual Dictionary Learningによる3Dデータ依存を回避し、最先端の姿勢不変認識と高忠実度の正面化を実現します。

ABSTRACT

Face frontalization refers to the process of synthesizing the frontal view of a face from a given profile. Due to self-occlusion and appearance distortion in the wild, it is extremely challenging to recover faithful results and preserve texture details in a high-resolution. This paper proposes a High Fidelity Pose Invariant Model (HF-PIM) to produce photographic and identity-preserving results. HF-PIM frontalizes the profiles through a novel texture warping procedure and leverages a dense correspondence field to bind the 2D and 3D surface spaces. We decompose the prerequisite of warping into dense correspondence field estimation and facial texture map recovering, which are both well addressed by deep networks. Different from those reconstruction methods relying on 3D data, we also propose Adversarial Residual Dictionary Learning (ARDL) to supervise facial texture map recovering with only monocular images. Exhaustive experiments on both controlled and uncontrolled environments demonstrate that the proposed method not only boosts the performance of pose-invariant face recognition but also dramatically improves high-resolution frontalization appearances.

研究の動機と目的

  • 野外条件下での高解像度かつ同一性を保持する顔正面化の課題に取り組む。
  • 密な対応場と顔のテクスチャマップを介した密な2D-3D結合を活用し、ワープを誘導する。
  • Adversarial Residual Dictionary Learning (ARDL) を用いて3Dデータなしでテクスチャマップ復元を監督する。
  • 幾何推定、テクスチャ復元、正面化を統合するエンドツーエンドの深層ネットワークを提供する。
  • 複数のデータセットで姿勢不変認識と高解像度正面化の改善を示す。

提案手法

  • 2Dテクスチャ空間と正面ビューを結ぶ密な対応場 F を推定する。
  • オートエンコーダを用いてUV空間の顔のテクスチャマップ T を復元し、真の T が利用できない場合は ARDL によって指導される。
  • テクスチャマップを正面ビューへワープする。Y = warp(i,j;F,T) = T_{u_{ij},v_{ij}} を用い、aRec を用いて非顔領域を生成する。
  • 視覚的リアリズムを確保するために再構成誤差loss L_rec = ||Rec(F,T) - Y||_1 で訓練する。
  • ARDLを用いて3Dデータなしでテクスチャ表現を監督する。辞書学習モジュールを介してポーズ間でテクスチャエンコーディングを整列させ、ポーズ識別辞書予測子に対する敵対的損失を用いる。
  • 識別特徴を保持するために知覚損失 L_p を用い、写真実現性のためにRGB対立損失 L_g/L_d を用いる。

実験結果

リサーチクエスチョン

  • RQ1密な対応場による密な2D-3D結合は、横顔画像からの高解像度顔正面化を改善できるか。
  • RQ2ARDLは真の3Dテクスチャマップなしで効果的なテクスチャマップ復元を可能にするか。
  • RQ3提案手法 HF-PIM は野外条件で256×256解像度の高忠実度・同一性保持の正面化を達成できるか。
  • RQ4標準ベンチマークと高解像度データセットで姿勢不変な顔認識を改善するか。

主な発見

  • HF-PIMはMulti-PIEで大幅なポーズ変動にもとづくRank-1認識を従来法と比較して大幅に向上させる。
  • 正面化結果を用いると、野外データセット(LFWとIJB-A)で最先端の検証/認識を達成。
  • CelebA-HQで高解像度(256×256)の正面化を実証し、知覚的およびテクスチャ細部は従来のGANベース正面化よりも良好に保持。
  • 密な対応場とテクスチャワープフレームワークは忠実なテクスチャ細部と姿勢不変の再構成を可能にする。
  • ARDLは3Dデータなしでテクスチャマップ復元の監督を可能にし、ラベル付き3Dデータセットへの依存を減らす。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。