Skip to main content
QUICK REVIEW

[論文レビュー] InverseFaceNet: Deep Monocular Inverse Face Rendering

Hyeongwoo Kim, Michael Zollhöfer|arXiv (Cornell University)|Mar 31, 2017
Face recognition and analysis参考文献 46被引用数 11
ひとこと要約

InverseFaceNet は、顔のポーズ、形状、表情、反射率、照度を同時に推定することで、1枚の画像からリアルタイムで逆顔レンダリングを実現するディープラーニングフレームワークです。独自のモデル空間損失関数と自己教師付きブートストラップ法を用いて、実世界の画像への一般化性能を向上させ、最適化ベースの手法と比較して最大200倍高速な高品質な再構成を達成しています。

ABSTRACT

We introduce InverseFaceNet, a deep convolutional inverse rendering framework for faces that jointly estimates facial pose, shape, expression, reflectance and illumination from a single input image. By estimating all parameters from just a single image, advanced editing possibilities on a single face image, such as appearance editing and relighting, become feasible in real time. Most previous learning-based face reconstruction approaches do not jointly recover all dimensions, or are severely limited in terms of visual quality. In contrast, we propose to recover high-quality facial pose, shape, expression, reflectance and illumination using a deep neural network that is trained using a large, synthetically created training corpus. Our approach builds on a novel loss function that measures model-space similarity directly in parameter space and significantly improves reconstruction accuracy. We further propose a self-supervised bootstrapping process in the network training loop, which iteratively updates the synthetic training corpus to better reflect the distribution of real-world imagery. We demonstrate that this strategy outperforms completely synthetically trained networks. Finally, we show high-quality reconstructions and compare our approach to several state-of-the-art approaches.

研究の動機と目的

  • 1枚の画像から全顔パラメータを推定するリアルタイムで1ショットの逆顔レンダリング手法を開発すること。
  • 合成データと実世界の顔画像とのドメインギャップを解消するため、一般化性能を向上させること。
  • 1回の順伝播でポーズ、形状、表情、反射率、照度を同時に回帰すること。
  • 完全に合成データに依存する訓練の限界を克服するため、訓練分布を適応的に調整する自己教師付きブートストラップ機構を導入すること。

提案手法

  • 再構成精度を向上させるために、修正されたパrameter空間で直接距離を測定する新しいモデル空間損失関数を提案する。
  • ネットワークの予測結果を用いて実画像から新たな合成トレーニングデータを生成する自己教師付きブートストラッププロセスを導入する。
  • 既知の真値パラメータを備えた大量の合成レンダリング顔画像のコーパス上で、深層畳み込みニューラルネットワークを訓練する。
  • 実画像からの推定パラメータの摂動版を用いて、合成トレーニングセットを拡張し、実世界のパラメータ分布をよりよく反映する。
  • ドメイン外のサンプル、特に分布境界付近のサンプルをカバーするため、各ブートストラップ段階で平均適応ガウス再サンプリング戦略を採用する。
  • エンドツーエンドのアプローチで、ポーズ、形状、表情、反射率、照度の全顔モデルパラメータを同時に回帰する。

実験結果

リサーチクエスチョン

  • RQ1ディープニューラルネットワークは、1枚の画像から高精度にポーズ、形状、表情、反射率、照度の全主要顔パラメータを同時に推定できるか?
  • RQ2合成トレーニングデータと実世界の顔画像とのドメインギャップを効果的に低減する方法は何か?
  • RQ3自己教師付きブートストラップは、真値なしで野生の画像への一般化性能を向上させることができるか?
  • RQ4パラメータ空間で直接最適化するモデル空間損失関数は、標準的なピクセルベース損失と比較して、より高い再構成精度を達成できるか?
  • RQ5最先端の最適化ベースの逆レンダリング手法と比較して、本手法の速度と品質はどのように異なるか?

主な発見

  • 300-VW Volker シーケンスにおいて、InverseFaceNet は幾何誤差 2.10 mm(標準偏差 0.42 mm)を達成し、Tewari et al. [11](2.94 mm)を上回り、Garrido et al. [3](1.96 mm)に近づいた。
  • 本手法は1枚あたり9.4 ms で実行可能であり、Garrido et al. [3] らの最適化ベース手法(1枚あたり2分)と比較して、複数桁の速度向上を達成している。
  • 自己教師付きブートストラップを用いることで、合成データのみで訓練されたネットワークと比較して、実世界の画像における再構成品質が顕著に向上した。
  • 定性的な結果から、InverseFaceNet は最先端手法と比較して、より直感的に自然な再構成を実現しており、正確な幾何形状、適切な反射率、正しい照度を再現している。
  • 従来の学習ベース手法でしばしば無視される色反射率と照度の次元を、リアルタイム推論を維持したまま効果的に回復している。
  • モデル空間損失関数は、ピクセル空間ではなく顔モデルパラメータ空間で直接最適化することで、パラメータの精度向上に寄与している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。