Skip to main content
QUICK REVIEW

[論文レビュー] MVF-Net: Multi-View 3D Face Morphable Model Regression

Fanzi Wu, Linchao Bao|ArXiv.org|Apr 9, 2019
Face recognition and analysis参考文献 41被引用数 7
ひとこと要約

本論文では、複数視点の顔画像から3次元可塑的モデル(3DMM)パラメータを回帰するエンドツーエンドのディープラーニングフレームワーク、MVF-Netを提案する。視点間の幾何的一致性を活用することで、照明の変動や曖昧な幾何構造下でも、単一視点手法に比べて顕著に高い3次元顔再構築精度を達成する。特に、写真情報の再投影誤差を最小化するため、密度的光流推定器を用いた微分可能視点整合性損失を導入している。

ABSTRACT

We address the problem of recovering the 3D geometry of a human face from a set of facial images in multiple views. While recent studies have shown impressive progress in 3D Morphable Model (3DMM) based facial reconstruction, the settings are mostly restricted to a single view. There is an inherent drawback in the single-view setting: the lack of reliable 3D constraints can cause unresolvable ambiguities. We in this paper explore 3DMM-based shape recovery in a different setting, where a set of multi-view facial images are given as input. A novel approach is proposed to regress 3DMM parameters from multi-view inputs with an end-to-end trainable Convolutional Neural Network (CNN). Multiview geometric constraints are incorporated into the network by establishing dense correspondences between different views leveraging a novel self-supervised view alignment loss. The main ingredient of the view alignment loss is a differentiable dense optical flow estimator that can backpropagate the alignment errors between an input view and a synthetic rendering from another input view, which is projected to the target view through the 3D shape to be inferred. Through minimizing the view alignment loss, better 3D shapes can be recovered such that the synthetic projections from one view to another can better align with the observed image. Extensive experiments demonstrate the superiority of the proposed method over other 3DMM methods.

研究の動機と目的

  • 単一視点における3次元顔再構築の本質的曖昧性(信頼できる3次元制約の欠如)を解消すること。
  • エンドツーエンドで学習可能なフレームワーク内で、多視点の幾何的制約を3DMMベースの再構築に統合することで、性能を向上させること。
  • SfM/MVSパイプラインからのノイズの多い初期3次元再構築に依存するのを減らし、多視点入力から直接3DMMパラメータを回帰すること。
  • 微分可能なアライメント損失により、視点間の照明変動に対する耐性を高めること。
  • 反復的最適化を一切用いずに、完全にディープラーニングのみで最先端の性能を達成すること。

提案手法

  • 本手法は、多視点顔画像から直接3DMM形状および表現パラメータを回帰するためのCNNを用いる。
  • 観測画像と予測された3次元形状およびカメラポーズからの合成レンダリング画像を比較する、光度的再投影損失を導入する。
  • 観測画像とレンダリング画像間のアライメント誤差を計算する、新しい微分可能な密度的光流推定器を提案し、幾何的一致性のバックプロパゲーションを可能にする。
  • 視点整合性損失は、1つの視点からレンダリングされた画像を予測された3次元形状を介して別の視点に投影し、その結果をターゲット視点の観測画像と比較することで計算される。
  • ネットワーク全体がエンドツーエンドで学習可能であり、微分可能なレンダリングおよび光流推定を通じて3DMMパラメータ回帰と幾何的一致性の強制が統合されている。
  • 3DMMが提供する強力な3次元顔の事前知識を活用するとともに、多視点制約を用いて深度の曖昧性を解消する。

実験結果

リサーチクエスチョン

  • RQ1多視点の幾何的制約を、3次元顔再構築のためのディープラーニングフレームワークに効果的に統合できるか?
  • RQ2光流に基づく微分可能なアライメント損失は、標準的な光度的損失と比較して3DMMパラメータ回帰を改善するか?
  • RQ3視点間で照明が不一致である状況下で、本手法はどのように性能を発揮するか?
  • RQ4多視点の監視情報を用いたエンドツーエンド学習は、単一視点3DMM回帰手法を上回るか?
  • RQ5視点整合性損失は、訓練中の局所最適解への感受性をどの程度低減するか?

主な発見

  • 本手法は、MICCデータセットにおいて平均点対平面誤差1.220 mmを達成し、MoFA や Tran et al. [35] を含むすべての単一視点ベースラインを上回った。
  • 視点整合性損失を追加することで、照明が不一致な状況下でも、光度的損失のみの手法と比較して再構築誤差が11.5%低減した。
  • 視覚的比較では、MVF-Netが鼻や頬骨など、単一視点設定で曖昧になりがちな領域において、より正確な顔の幾何構造と表現を生成していることが示された。
  • 図8で示されるように、光度的損失とアライメント損失の両方を用いて訓練されたモデルは、照明変動に対してより良好に一般化しており、アライメント損失が欠落した場合に性能が著しく低下することが確認された。
  • アブレーションスタディにより、微分可能な光流推定器がアライメント誤差を効果的にバックプロパゲートし、収束性と形状の正確性を向上させていることが確認された。
  • 本手法は、MICCデータセットにおけるすべての評価設定(平均、プールド、重み付き平均予測)で最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。