Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Regress 3D Face Shape and Expression from an Image without 3D Supervision

Soubhik Sanyal, Timo Bolkart|arXiv (Cornell University)|May 16, 2019
Face recognition and analysis参考文献 41被引用数 6
ひとこと要約

RingNetは、同一人物の複数枚の画像を活用し、リング型の対照的損失によって形状の不変性を強制することで、3Dの監視なしに1枚の画像から3D顔の形状と表情を回帰する。この手法は、2D顔キーポイント検出とFLAME 3D顔モデルのみを用いて、屋外画像において最先端の精度を達成し、3D監視で学習された手法を上回る性能を示す。

ABSTRACT

The estimation of 3D face shape from a single image must be robust to variations in lighting, head pose, expression, facial hair, makeup, and occlusions. Robustness requires a large training set of in-the-wild images, which by construction, lack ground truth 3D shape. To train a network without any 2D-to-3D supervision, we present RingNet, which learns to compute 3D face shape from a single image. Our key observation is that an individual's face shape is constant across images, regardless of expression, pose, lighting, etc. RingNet leverages multiple images of a person and automatically detected 2D face features. It uses a novel loss that encourages the face shape to be similar when the identity is the same and different for different people. We achieve invariance to expression by representing the face using the FLAME model. Once trained, our method takes a single image and outputs the parameters of FLAME, which can be readily animated. Additionally we create a new database of faces `not quite in-the-wild' (NoW) with 3D head scans and high-resolution images of the subjects in a wide variety of conditions. We evaluate publicly available methods and find that RingNet is more accurate than methods that use 3D supervision. The dataset, model, and results are available for research purposes at http://ringnet.is.tuebingen.mpg.de.

研究の動機と目的

  • 変動する照明、ポーズ、遮蔽があるような制約のない条件下で、1枚の画像から正確な3D顔形状と表情を推定すること。
  • ペア付けられた3Dアノテーションデータが存在しない状況下で、2Dから3D顔形状への回帰を実現する深層ネットワークを学習すること。
  • 同一人物の複数枚の画像におけるアイデンティティの一貫性を活用し、表情・ポーズ・外観が変化しても形状の不変性を学習すること。
  • 高解像度の3Dスキャンと多様な撮影条件を備えた、厳密な評価が可能な新しいベンチマークデータセットNoWを構築すること。
  • 幾何的整合性を用いた自己教師あり学習が、3D監視に依存する手法を上回ることを実証すること。

提案手法

  • RingNetは、同一アイデンティティの複数枚の画像をリングとして用い、視点間で予測された3D顔形状が一貫したままであるように制約する。ポーズや表情の変化は許容される。
  • 同一人物間の形状差を最小化し、異なるアイデンティティ間の差を最大化する、新しいリングベースの対照的損失を採用する。
  • FLAME 3D顔モデルのパラメータに直接回帰することで、形状・ポーズ・表情を分離可能な学習を可能にする。
  • OpenPoseを用いて2D顔キーポイントを抽出し、FLAMEモデルを用いて3Dに投影することで、2D-3D特徴損失を計算する。
  • 2D-3Dキーポイント再投影損失と、複数枚の画像からなるリング全体における形状一貫性損失を組み合わせ、幾何的精度を向上させる。
  • 本手法は汎用的であり、2D関節検出を用いた全身の3D再構築への応用も可能である。

実験結果

リサーチクエスチョン

  • RQ13D監視なしに、1枚の画像から正確に3D顔形状を回帰できるか?
  • RQ2同一人物の複数枚の画像におけるアイデンティティの一貫性を活用することで、ペア付けられた3Dデータがなくても3D回帰ネットワークを学習できるか?
  • RQ3リングベースの対照的損失は、標準的なトリプレット損失を上回り、2D画像から3D幾何を学習する上で優れているか?
  • RQ4自己教師あり学習による幾何的整合性が、現実世界の条件下で3D監視に依存する手法を上回るか?
  • RQ5NoWデータセットは、既存のベンチマークと比較して、3D顔再構築手法の評価をどの程度改善するか?

主な発見

  • NoWデータセットの顔チャレンジにおいて、RingNetは平均再構築誤差1.23 mmを達成し、FLAME-neutral (1.34 mm) や [34] (1.83 mm) といった3D監視付き手法を上回った。
  • 屋外画像においても最先端の性能を示し、表情・ポーズ・照明・遮蔽・顔のひげの影響に対しても頑健であることが確認された。
  • アブレーションスタディの結果、リングサイズを3から6に増加させることで、再構築誤差が1.25 mmから1.19 mmに低下し、幾何学的学習の向上が示された。
  • リングベースの損失は、トリプレット損失のみまたは単一画像ベースのベースラインと比較して、形状の一貫性と3D精度を顕著に向上させた。
  • 3D監視を一切使用していないにもかかわらず、3Dデータで学習された手法を上回った。これは、自己教師ありの形状不変性が強力なインダクティブバイアスであることを示している。
  • NoWデータセットは、100名の被験者に対して高解像度の3Dヘッドスキャンと多様な撮影条件の画像を提供し、厳しい条件下での評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。