Skip to main content
QUICK REVIEW

[論文レビュー] A high fidelity synthetic face framework for computer vision

Tadas Baltrušaitis, Erroll Wood|arXiv (Cornell University)|Jul 16, 2020
Face recognition and analysis参考文献 11被引用数 4
ひとこと要約

この論文は、パラメトリック3次元顔モデル、学習されたアイデンティティおよび表情のブレンドシェイプ、手作業で作成された髪のアセット、および画像ベースのライティングを用いて、形状、テクスチャ、表情、ポーズ、ライティング、髪の毛の属性を精確に制御可能な、高精細な合成顔フレームワークを提示する。このフレームワークにより、形状、テクスチャ、表情、ポーズ、ライティング、髪の毛の属性について、前例のない制御性を備えたスケーラブルで一貫性があり、正確なデータ合成が可能となり、コンピュータビジョンのモデル学習に貢献する。

ABSTRACT

Analysis of faces is one of the core applications of computer vision, with tasks ranging from landmark alignment, head pose estimation, expression recognition, and face recognition among others. However, building reliable methods requires time-consuming data collection and often even more time-consuming manual annotation, which can be unreliable. In our work we propose synthesizing such facial data, including ground truth annotations that would be almost impossible to acquire through manual annotation at the consistency and scale possible through use of synthetic data. We use a parametric face model together with hand crafted assets which enable us to generate training data with unprecedented quality and diversity (varying shape, texture, expression, pose, lighting, and hair).

研究の動機と目的

  • コンピュータビジョンタスクのための、大規模かつ正確にアノテートされた実際の顔データを収集する課題に対処すること。
  • スケールで手作業で取得することが困難または不可能な、グランドトゥルースのアノテーションを備えた合成顔データを生成すること。
  • アイデンティティ、表情、ポーズ、ライティング、テクスチャ、髪の毛をカバーする、高精細で多様性があり、制御可能なデータ合成を実現すること。
  • 現実的で一貫性があり、完全に教師ありの合成顔データを用いて機械学習の訓練を支援すること。
  • 幾何学的および外観的要因について、精密な制御が可能なスケーラブルなパイプラインを提供すること。

提案手法

  • アイデンティティ、表情、ポーズをブレンドシェイプと線形ブレンドスキンニングでパrameter化する7127頂点および6908個の四角形面部を持つパラメトリック3次元顔モデルを用いる。
  • 101個の高品質な3次元スキャンから、モデルパラメータとブレンドシェイプの共同最適化により、幾何学的損失と正則化損失を最小化することで、アイデンティティおよび表情のブレンドシェイプを学習する。
  • テクスチャは、顔領域をクロップして学習した、50次元の潜在空間を持つVAEで表現され、知覚的損失とMSE損失を用いることで、分離可能でコン pact な表現が可能になる。
  • 髪は物理ベースのシェーダーを用いて3次元ストランドとしてモデル化され、136本の頭皮、50本の眉毛、71本のヒゲ、3本のまつげスタイルがそれぞれメラニンとグレー割合パラメータで色付けられる。
  • 髪は長さ、密度、流れ方向のボリュームマップを用いたUVマップでエンコードされ、ML互換性を高めるためにPCAを用いた次元削減が可能になる。
  • ライティングは324枚のHDR環境マップを用いてシミュレートされ、log(1+I)で事前処理され、PCAにより50次元に削減され、分散の80%を捉える。各画像に対して5回のランダム回転を施し、データ拡張を実現する。

実験結果

リサーチクエスチョン

  • RQ1合成顔生成パイプラインは、コンピュータビジョンタスクのための、正確で一貫性があり、完全に教師ありのアノテーションを備えた顕在的レンダリングの画像を生成できるか?
  • RQ23次元顔モデルは、幾何学的正確性を維持し、アーティファクトを回避しながら、アイデンティティと表情のブレンドシェイプを同時に学習できるか?
  • RQ3VAEベースのテクスチャ表現は、顔の細部を保持しつつ、機械学習に適したコン pact で分離可能な潜在表現を実現できるか?
  • RQ43次元髪のストランドは、異なるライティングと顔の幾何学的形状を想定して、多様で現実的で学習可能な髪のスタイルをモデル化・パラメータ化できるか?
  • RQ5PCAで次元削減されたHDRマップを用いた画像ベースのライティングは、多様で現実的なライティング条件を効率的にシミュレートできるか?

主な発見

  • 1つのレンダリングパイプラインを用いて、1024×1024の顕在的レンダリング顔画像を生成し、アイデンティティ、表情、ポーズ、ライティング、テクスチャ、髪の毛の多様性を実現する。
  • モデルパラメータとアイデンティティブレンドシェイプの共同最適化により、頂点位置および法線位置の誤差を最小限に抑え、解剖学的妥当性とメッシュ品質を保証する高い幾何学的正確性が達成される。
  • VAEベースのテクスチャ表現により、顕在的品質を保持しつつ、50次元のコン pact な潜在空間が実現され、多様な顔テクスチャの効果的生成が可能になる。
  • UVマップとボリュームマップを用いた髪の表現により、PCAを用いた次元削減を経て、複雑なヘアスタイルの正確な再構成が可能になり、効率的なML利用が可能になる。
  • PCAで次元削減されたHDRライティングモデルは、わずか50次元で分散の80%を捉え、1620の拡張済みライティング条件において、効率的で現実的なライティング変動を実現する。
  • 全パイプラインは、形状、ポーズ、表情、外観のグランドトゥルースアノテーションを備えた合成データを生成し、手作業によるラベリングなしに信頼性の高いコンピュータビジョンモデルの訓練を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。