Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Depth Estimation, 3D Face Rotation and Replacement

Joel Ruben Antony Moniz, Christopher Beckham|arXiv (Cornell University)|Mar 25, 2018
Face recognition and analysis参考文献 25被引用数 21
ひとこと要約

この論文では、2次元画像から顔の3次元構造を推定する教師なし深層学習手法であるDepthNetsを提案する。顔のキーポイントの奥行きを予測し、それらを用いて3次元アフィン変換を計算することで、顔の回転と交換を実現する。教師あり3次元データを一切必要とせず、ポーズ正規化とアイデンティティスワッピングを可能にし、微分可能な奥行き監視と敵対的精練による外観の改善によって、現実的な3次元顔の変形を達成する。

ABSTRACT

We present an unsupervised approach for learning to estimate three dimensional (3D) facial structure from a single image while also predicting 3D viewpoint transformations that match a desired pose and facial geometry. We achieve this by inferring the depth of facial keypoints of an input image in an unsupervised manner, without using any form of ground-truth depth information. We show how it is possible to use these depths as intermediate computations within a new backpropable loss to predict the parameters of a 3D affine transformation matrix that maps inferred 3D keypoints of an input face to the corresponding 2D keypoints on a desired target facial geometry or pose. Our resulting approach, called DepthNets, can therefore be used to infer plausible 3D transformations from one face pose to another, allowing faces to be frontalized, transformed into 3D models or even warped to another pose and facial geometry. Lastly, we identify certain shortcomings with our formulation, and explore adversarial image translation techniques as a post-processing step to re-synthesize complete head shots for faces re-targeted to different poses or identities.

研究の動機と目的

  • 教師あり3次元深度や顔の幾何学的データを一切必要とせず、1枚の2次元画像から3次元顔の回転と交換を可能にすること。
  • 予測された深度と3次元アフィン変換パラメータの整合性を保つ微分可能な損失関数を用いて、教師なしで顔のキーポイントの深度を予測すること。
  • 推定された深度を用いて、ソース顔のキーポイントをターゲットの幾何構造にマッピングする3次元アフィン変換を推定することで、ポーズ正規化と顔の交換を実現すること。
  • 背景や外観の不一致を是正するために、敵対的画像間変換を適用して変形された顔の視覚的リアリズムを向上させること。

提案手法

  • DepthNetsは、深度値に何らの監視も受けない状態で、1枚の画像からN個の顔のキーポイントの奥行きをニューラルネットワークで予測する。
  • 深さを補完した2次元ソースキーポイントの疑似逆行列と2次元ターゲットキーポイントを用いて、閉形式で3次元アフィン変換行列を計算し、変換のバックプロパゲーションを可能にする。
  • 予測された深度とその結果得られる3次元アフィン変換の整合性を強制する微分可能な損失関数を用いてモデルを訓練することで、エンドツーエンド最適化が可能になる。
  • シアン・アーキテクチャを用いて、ソースおよびターゲット画像を共有重みで処理する一方、全結合型のバージョンではキーポイント座標のみを用いる。
  • 変形された3次元顔の外観を精錬するために、後処理として敵対的画像間変換ネットワークを適用し、背景の不一致や外観の不整合を是正する。
  • 推定された3次元アフィン変換を用いて、テクスチャ付きの三角メッシュを用いてソース顔をターゲットの幾何構造に投影する。

実験結果

リサーチクエスチョン

  • RQ11枚の2次元画像から、3次元監視なしに顔の3次元幾何構造とポーズ変換を予測できるか?
  • RQ2顔のキーポイントの深度予測を用いて、ソースからターゲットの顔幾何構造にマッピングする微分可能な3次元アフィン変換を計算できるか?
  • RQ3教師なし深度推定を、顔の回転と交換のエンドツーエンド学習を可能にする微分可能なパイプラインに統合できるか?
  • RQ4背景やテクスチャが不一致する場合に、敵対的画像変換によって変形された顔のリアリズムを向上させることができるか?

主な発見

  • 提案手法は、いかなる教師あり深度データも使用しない教師なし3次元顔推定において、最先端のキーポイント登録性能を達成している。
  • 微分可能な定式化により、3次元アフィン変換の疑似逆行列計算をバックプロパゲーション可能にし、深度と変換パラメータの共同最適化が可能になった。
  • 顔の前面化とアイデンティティ間のポーズ転送が、ソースとターゲットの顔に顕著な外観的・幾何的差異があっても成功裏に実現された。
  • 敵対的後処理により、背景の合成と変形顔におけるテクスチャの不整合の是正が顕著に向上し、視覚的品質が向上した。
  • モデルは多様なアイデンティティやポーズ、特に極端な非前面視点に対しても一般化可能であるが、遮蔽があるとテクスチャ抽出が困難となり、性能が低下する傾向がある。
  • カメラパrameter やソース・ターゲット間のピxls対応を必要としないため、照明や色の変化に対しても頑健である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。