Skip to main content
QUICK REVIEW

[論文レビュー] High Fidelity Face Manipulation with Extreme Poses and Expressions

Chaoyou Fu, Yibo Hu|arXiv (Cornell University)|Mar 28, 2019
Face recognition and analysis参考文献 74被引用数 9
ひとこと要約

本論文は、6000×4000解像度で極端なポーズや表情における高精細な顔の改変を実現する二段階フレームワークを提案する。まず、ポーズおよび表情推定器を備えた半教師あり条件付きエンコーダ・デコーダネットワークを用いて顔の境界画像を予測し、次にプロキシネットワークと特徴量しきい値損失を用いて潜在空間で構造とテクスチャを分離する。新しく収集されたMVF-HQデータセットを用いた実験で、高解像度における極端な改変において最先端の結果を達成した。

ABSTRACT

Face manipulation has shown remarkable advances with the flourish of Generative Adversarial Networks. However, due to the difficulties of controlling structures and textures, it is challenging to model poses and expressions simultaneously, especially for the extreme manipulation at high-resolution. In this paper, we propose a novel framework that simplifies face manipulation into two correlated stages: a boundary prediction stage and a disentangled face synthesis stage. The first stage models poses and expressions jointly via boundary images. Specifically, a conditional encoder-decoder network is employed to predict the boundary image of the target face in a semi-supervised way. Pose and expression estimators are introduced to improve the prediction performance. In the second stage, the predicted boundary image and the input face image are encoded into the structure and the texture latent space by two encoder networks, respectively. A proxy network and a feature threshold loss are further imposed to disentangle the latent space. Furthermore, due to the lack of high-resolution face manipulation databases to verify the effectiveness of our method, we collect a new high-quality Multi-View Face (MVF-HQ) database. It contains 120,283 images at 6000x4000 resolution from 479 identities with diverse poses, expressions, and illuminations. MVF-HQ is much larger in scale and much higher in resolution than publicly available high-resolution face manipulation databases. We will release MVF-HQ soon to push forward the advance of face manipulation. Qualitative and quantitative experiments on four databases show that our method dramatically improves the synthesis quality.

研究の動機と目的

  • 既存の手法が構造とテクスチャの分離が不十分であるため、極端なポーズや表情下での高解像度顔の改変の課題に対処すること。
  • 現在の画像対画像変換および構造ガイド付き手法に見られる限界、特に高解像度下での局所的構造のぼやけやテクスチャの損失を克服すること。
  • 極端な顔の変化に対しても顔の構造と現実的なテクスチャを両方保持する分離された潜在空間表現を開発すること。
  • 今後の研究を支援するため、大規模かつ高解像度の顔の改変データベース(MVF-HQ)を構築・公開すること。

提案手法

  • 条件付きエンコーダ・デコーダネットワークが、ポーズおよび表情ベクトルを条件入力として用いて、半教師ありの方法でターゲット顔の境界画像を予測する。
  • ポーズおよび表情推定器を統合することで、境界画像予測の精度と耐障害性を向上させる。
  • 二つの別々のエンコーダーネットワークが、予測された境界画像(構造)と入力顔画像(テクスチャ)をそれぞれ異なる潜在空間に分離する。
  • プロキシ顔認識ネットワークを分離の支援要因として用い、新規の特徴量しきい値損失がプロキシの特徴量に対して学習された特徴量の凝縮度を制御する。
  • マルチスケール画素単位損失と条件付き adversarial 損失を適用し、テクスチャの詳細と現実性を向上させる。
  • 再構成損失、分離損失、アイデンティティ保持損失、敵対的損失の組み合わせにより訓練することで、忠実性と現実性を確保する。

実験結果

リサーチクエスチョン

  • RQ1二段階フレームワークは、極端なポーズや表情下での高解像度顔の改変において、構造とテクスチャを効果的に分離できるか?
  • RQ2ポーズおよび表情ベクトルのみを制御信号として用いる半教師ありの方法で、境界画像を正確に予測できるか?
  • RQ3極端な改変シナリオにおいて、顔の構造の明瞭さとテクスチャの現実性を両立させるために、どの損失成分が不可欠か?
  • RQ4特に高解像度下で、特徴量しきい値損失は過度に特徴量を凝縮させることなく、どのように分離を支援するか?
  • RQ5本手法はドメイン間でどの程度一般化可能か?交差データベーステストによって示されるか?

主な発見

  • MVF-HQデータセットにおいて±90°のポーズ下で、Fréchet Inception Distance(FID)が12.94と最低水準に達し、Rank-1正答率が60.4%を記録した。これは優れた画像品質とアイデンティティ保持性を示している。
  • 特徴量しきい値損失のパラメータmを7に設定した場合、FIDが最小化され、Rank-1正答率が最大化され、最適な分離が達成された。
  • アブレーションスタディにより、特に特徴量しきい値損失とマルチスケール画素単位損失が、局所的テクスチャと構造の明瞭さを保持するために不可欠であることが確認された。
  • 交差データベース実験では、マルチPIEからMVF-HQへの顔の改変が、顕著なドメインギャップにもかかわらず成功しており、強力な一般化性能を示した。
  • 120,283枚の高解像度(6000×4000)画像を含み、479人の個人から構成されるMVF-HQデータセットは、既存のデータベースと比較して大幅に大規模かつ高解像度であり、より現実的な評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。