Skip to main content
QUICK REVIEW

[論文レビュー] Learning Formation of Physically-Based Face Attributes

Ruilong Li, Karl Bladin|arXiv (Cornell University)|Apr 2, 2020
Face recognition and analysis参考文献 61被引用数 4
ひとこと要約

本論文は、4,000枚の高解像度顔面スキャンを用いて学習された非線形で深層学習ベースの3次元可塑的顔モデルを紹介する。このモデルにより、4K解像度で毛穴レベルの幾何的詳細と物理的ベースの材質属性(アルベド、スペキュラー、ディスplaceメント)を実現する。モデルは段階的なGANを用い、統合的および分離的な識別器を併用することで、リアルで解剖学的に整合性のある顔を生成し、優れた表現適合性(線形モデルと比較して1.2mm MSE vs. 2.4mm MSE)を達成するとともに、新しいアイデンティティの生成、メッシュフィッティング、低解像度から高解像度へのデータ変換を可能にする。

ABSTRACT

Based on a combined data set of 4000 high resolution facial scans, we introduce a non-linear morphable face model, capable of producing multifarious face geometry of pore-level resolution, coupled with material attributes for use in physically-based rendering. We aim to maximize the variety of face identities, while increasing the robustness of correspondence between unique components, including middle-frequency geometry, albedo maps, specular intensity maps and high-frequency displacement details. Our deep learning based generative model learns to correlate albedo and geometry, which ensures the anatomical correctness of the generated assets. We demonstrate potential use of our generative model for novel identity generation, model fitting, interpolation, animation, high fidelity data visualization, and low-to-high resolution data domain transferring. We hope the release of this generative model will encourage further cooperation between all graphics, vision, and data focused professionals while demonstrating the cumulative value of every individual's complete biometric profile.

研究の動機と目的

  • グラフィックスおよびビジョン分野の研究において利用可能な、高忠実度で物理的ベースの顔データが公的リポジトリに不足している問題に対処すること。
  • 線形3DMMがサブミリメートルレベルの幾何的詳細と材質の一貫性を捉えることの制限を克服すること。
  • 深層生成モデリングを用いて、多様で解剖学的に正しい顔のアイデンティティと表現を制御可能に生成すること。
  • 大規模かつ高解像度のスキャンデータベースから、コンactな生成モデルを構築することで、高品質な顔アセットへのアクセスを民主化すること。
  • VFXおよびバイオメトリクス分野におけるメッシュフィッティング、低解像度データの強化、高忠実度の可視化などの応用を支援すること。

提案手法

  • 非線形3DMMによる頭部幾何の組み合わせと、目、歯、頭部の線形PCAを用いたハイブリッドモデリングアプローチ。
  • 幾何とアルベドを同時に生成する段階的な生成的敵対ネットワーク(GAN)を訓練し、解剖学的整合性とテクスチャ品質を保証するため、分離的および統合的な識別器を併用。
  • 低次元の潜在コードから推論および拡大処理により、高解像度の4Kテクスチャマップ(アルベド、スペキュラー、ディスプレースメント)を回復。
  • 26の表現ごとに被験者ごとに密な対応関係とUVパラメータライゼーションを自動で行うパイプラインを実装し、一貫性のあるアライメントと学習を可能にする。
  • 別々の低次元潜在ベクトルを用いてアイデンティティと表現を分離し、独立した制御を可能にする。
  • 微分可能レンダリングとフィッティングパイプラインにより、ターゲットメッシュからの潜在コード推定を逆方向に実行することで3次元スキャンの登録を実現。

実験結果

リサーチクエスチョン

  • RQ1大規模かつ高忠実度のスキャンデータベースから、深層生成モデルが高解像度で物理的ベースの顔属性(幾何、アルベド、スペキュラー)を学習して生成できるか。
  • RQ2非線形3DMMは、線形モデルと比較して、顔の表現再構築およびスキャンデータへの適合性においてどのように優れているか。
  • RQ3モデルが学習中に見られなかった新しいアイデンティティや表現にどの程度一般化できるか。
  • RQ4低解像度の顔スキャンを、高解像度で物理的ベースのドメインに変換して強化できるか。
  • RQ5モデルは、3次元メッシュフィッティングやアニメーションリターゲティングなどの下流タスクをどの程度効果的にサポートできるか。

主な発見

  • 提案されたモデルは、表現適合性において平均二乗誤差(MSE)1.2mmを達成し、線形FaceWarehouseモデル(2.4mm MSE)を上回り、優れた再構築精度を示した。
  • モデルは、元の学習データの性別および年齢分布に近い分布を示す5,000体の新しい顔アイデンティティを生成でき、潜在空間の良好なカバーを示した。
  • 低解像度の顔スキャンが、質的および量的比較を通じて、現実的で詳細な材質と幾何を有する4K解像度に効果的に強化された。
  • 非線形逆問題処理を用いた3次元スキャンのフィッティングが正確に行われ、ハウスドルフ距離誤差指標において、Basel や FLAME などの線形モデルを上回った。
  • 分離的および統合的識別器を併用した統合GANトレーニングにより、幾何とアルベドの高品質で解剖学的に整合性のある生成が保証された。
  • アイデンティティの補間、アニメーション、データドメイン変換といった新しい応用が可能となり、グラフィックスおよびビジョンパイプラインにおける広範な有用性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。