Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Monocular 3D Face Reconstruction by Occlusion-Aware Multi-view Geometry Consistency

Jiaxiang Shang, Tianwei Shen|arXiv (Cornell University)|Jul 24, 2020
Face recognition and analysis参考文献 67被引用数 11
ひとこと要約

本稿では、ポーズと深度の曖昧さを解消するために、マルチビュー幾何的一致性を強制する自己教師あり単眼3次元顔再構成手法MGCNetを提案する。オクルージョンに配慮したビュー合成フレームワークと、ピクセル、深度、エピポーラの3つの新規損失を導入することで、顔のポーズ変動、表情、照明変化といった困難な条件下でも、ベンチマークデータセットで最先端の性能を達成した。

ABSTRACT

Recent learning-based approaches, in which models are trained by single-view images have shown promising results for monocular 3D face reconstruction, but they suffer from the ill-posed face pose and depth ambiguity issue. In contrast to previous works that only enforce 2D feature constraints, we propose a self-supervised training architecture by leveraging the multi-view geometry consistency, which provides reliable constraints on face pose and depth estimation. We first propose an occlusion-aware view synthesis method to apply multi-view geometry consistency to self-supervised learning. Then we design three novel loss functions for multi-view consistency, including the pixel consistency loss, the depth consistency loss, and the facial landmark-based epipolar loss. Our method is accurate and robust, especially under large variations of expressions, poses, and illumination conditions. Comprehensive experiments on the face alignment and 3D face reconstruction benchmarks have demonstrated superiority over state-of-the-art methods. Our code and model are released in https://github.com/jiaxiangshang/MGCNet.

研究の動機と目的

  • 単一画像からの3次元顔再構成という不適切に定義された問題、特に顔のポーズと深度推定の曖昧さを解決すること。
  • 2次元ランドマークとピクセルレベルの損失にのみ依存する従来の自己教師あり手法の限界を克服し、3次元幾何的制約を有効に活用すること。
  • 公開済みのマルチビューデータ(例:動画)を活用して、3次元の教師データが不要な状態で、複数のビュー間の幾何的一致性を強制すること。
  • 顔の表情、ポーズ、照明条件の大きな変動に対しても良好に一般化する強固なフレームワークを開発すること。
  • マルチビュー幾何的一致性制約を用いて、3次元教師データが一切不要な自己教師ありの监督のもとで、正確な3次元顔再構成を実現すること。

提案手法

  • 推定された深度とポーズを用いて、複数のソースビューからターゲットビューの画像を生成するオクルージョンに配慮したビュー合成手法を提案する。
  • 自己遮蔽に起因する誤差を低減するため、複数のビュー間で信頼できるピクセル対応関係を特定するための共通視界マップを導入する。
  • 実際の画像と合成画像の間の光度的一致性を強制するため、ピクセル一貫性損失を設計する。
  • マルチビュートリアングレーションからの幾何的制約を用いて、深度推定を正則化するための深度一貫性損失を定式化する。
  • 3DMMから投影した2次元ランドマークを用いて、エピポーラ幾何的一致性制約を強制する顔ランドマークベースのエピポーラ損失を考案する。
  • 3次元真値が不要な状態で、3つの新規損失を最適化することで、RGB画像のみを用いてモデルをエンドツーエンドに訓練する。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり3次元顔再構成において、マルチビュー幾何的一致性が、ポーズと深度の曖昧さを効果的に低減できるか。
  • RQ2オクルージョンに配慮したビュー合成は、3次元顔再構成におけるマルチビュー一貫性の信頼性をどのように向上させるか。
  • RQ3提案されたピクセル、深度、エピポーラ一貫性損失は、2次元のみの監督と比較して、再構成精度をどの程度向上させるか。
  • RQ4顔の表情、ポーズ、照明条件の極端な変動下でも、本手法はどの程度の性能を示すか。
  • RQ5明示的な3次元教師データがなくても、本モデルは屋外や制約のないデータセットに一般化できるか。

主な発見

  • MGCNetは、300W-LPおよびAFLW20003Dベンチマークで最先端の性能を達成し、従来の自己教師ありおよび教師あり手法を上回る3次元顔再構成品質を実現した。
  • BU-3DFEデータセットでは、多様な顔の表情に対しても正確な再構成を生成し、アイデンティティおよび表情の変動に対して高い耐性を示した。
  • 定性的な結果から、MGCNetはしばしば真値よりも正確な2次元顔ランドマークを予測しており、アライメント性能の向上を示している。
  • 本手法は屋外データに対しても良好に一般化し、単一画像から鮮やかで幾何的に正確な3次元顔再構成を生成できた。
  • アブレーションスタディの結果、3つの提案損失(ピクセル、深度、エピポーラ)の各々が最終性能に顕著な寄与をしていることが確認され、特にエピポーラ損失がポーズ推定の安定化に顕著に効果的であった。
  • MICC Florenceデータセットでも、特に大きなポーズ変動下において優れた結果を達成し、RingNet や Deng et al. などの手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。