Skip to main content
QUICK REVIEW

[論文レビュー] Towards High-Fidelity 3D Face Reconstruction from In-the-Wild Images Using Graph Convolutional Networks

Jiangke Lin, Yi Yuan|arXiv (Cornell University)|Mar 12, 2020
Face recognition and analysis参考文献 40被引用数 10
ひとこと要約

本論文は、1枚のウェルドイン画像から3次元モーファブルモデル(3DMM)の低精度なテクスチャをグラフ畳み込みネットワーク(GCN)を用いて精錬する、新しい粗大から細かい3次元顔再構築フレームワークを提案する。大規模な高解像度UVテクスチャデータベースを必要とせず、高精細な顔テクスチャを実現する。本手法はGCNを用いて直接メッシュ頂点に詳細なRGBカラーを伝搬させ、定量的・定性的な両面で最先端手法を上回る性能を達成する。

ABSTRACT

3D Morphable Model (3DMM) based methods have achieved great success in recovering 3D face shapes from single-view images. However, the facial textures recovered by such methods lack the fidelity as exhibited in the input images. Recent work demonstrates high-quality facial texture recovering with generative networks trained from a large-scale database of high-resolution UV maps of face textures, which is hard to prepare and not publicly available. In this paper, we introduce a method to reconstruct 3D facial shapes with high-fidelity textures from single-view images in-the-wild, without the need to capture a large-scale face texture database. The main idea is to refine the initial texture generated by a 3DMM based method with facial details from the input image. To this end, we propose to use graph convolutional networks to reconstruct the detailed colors for the mesh vertices instead of reconstructing the UV map. Experiments show that our method can generate high-quality results and outperforms state-of-the-art methods in both qualitative and quantitative comparisons.

研究の動機と目的

  • ウェルドイン画像からの顔の微細なディテールを捉えることができない3DMMベースの手法の限界を解消すること。
  • 収集が困難で高コストな大規模な高解像度UVテクスチャデータベースの必要性を排除すること。
  • 学習可能なメッシュベースの精錬プロセスを用いて、3DMMの粗いテクスチャを画像のディテールで精錬することで、テクスチャの精細度を向上させること。
  • UVマップベースの生成ではなく、直接頂点レベルでの色の精錬にグラフ畳み込みネットワーク(GCN)を活用することの検討。
  • 微分可能レンダリングを用いた自己教師あり学習と adversarial 学習を統合し、最先端の3次元顔再構築性能を達成すること。

提案手法

  • CNN回帰器を用いて、1枚の2次元画像から3DMM係数(アイデンティティ、表情、テクスチャ)およびレンダリングパラメータ(ポーズ、ライティング)を推定する粗大から細かいフレームワークを設計する。
  • 3DMMモデルは、平均形状と基底を用いたPCAベースの再構成により、初期の顔形状と粗いアルベドテクスチャを生成する。
  • 事前学習済みのFaceNetが画像レベルの特徴を抽出し、これをGCNリファイナに供給してメッシュ頂点上の詳細な色を予測する。
  • 同じ画像特徴を処理するGCNデコーダが、精錬済みのテクスチャ埋め込みを生成し、GCNリファイナの出力と連結する。
  • 統合された特徴は、コンビネットネットを通過して、メッシュ用の細分化された高精細テクスチャマップを生成する。
  • 自己教師あり学習のための微分可能レンダリングレイヤーと、リアルさを向上させ、ぼやけを低減させるGAN損失を統合する。

実験結果

リサーチクエスチョン

  • RQ11枚のウェルドイン画像のみを用いて、大規模なUVテクスチャデータベースに依存せずに、グラフ畳み込みネットワーク(GCN)が頂点レベルで3次元顔テクスチャを効果的に精錬できるか。
  • RQ2UV空間ベースのテクスチャ生成と比較して、GCNによる頂点レベルのテクスチャ精錬は、精細度とディテール保持性においてどのように優れているか。
  • RQ3学習可能なGCNベースの精錬モジュールを介して、3DMMベースの粗い再構築をどの程度向上させられるか。
  • RQ4微分可能レンダリングレイヤーと adversarial 学習を組み合わせることで、再構築された3次元顔のリアルさと知覚的品質が顕著に向上するか。
  • RQ5UVマップ上の全結合層や畳み込み層と比較して、GCNは3次元顔構造をモデル化する際にパrameter数を減らしつつも、空間的関係を保持する点で優れているか。

主な発見

  • 本手法はCelebA-HQデータセットでPSNR 29.69、SSIM 0.894を達成し、ピクセルレベルの再構築精細度において従来手法を顕著に上回った。
  • 本手法はLightCNN特徴類似度スコア0.900を達成し、入力画像と同一アイデンティティと分類される可能性がベースラインより高くなった。
  • アブレーションスタディにより、$L_{pix}$、$L_{id}$、$L_{adv}$、$L_{vert}$損失を併用することで最良の性能が得られ、PSNRが26.58から29.69に向上した。
  • UV空間上での全結合層や畳み込み層に置き換えると、性能が劣り(PSNR:25.88および27.54)、GCNが3次元構造をより効果的に保持していることが示された。
  • 高解像度画像(512×512)で学習した場合、チェス盤模様のようなアーティファクトが減少し、よりシャープでリアルなテクスチャが得られ、定性的な比較で明確に示された。
  • MICCデータセットにおいても、VGG-Face特徴類似度で最先端手法を上回り、同一アイデンティティのEMDスコア(0.08)が低く、アイデンティティ保持性の整合性が高かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。