Skip to main content
QUICK REVIEW

[論文レビュー] Photo-realistic Face Images Synthesis for Learning-based Fine-scale 3D Face Reconstruction.

Yudong Guo, Juyong Zhang|arXiv (Cornell University)|Aug 3, 2017
Face recognition and analysis参考文献 30被引用数 5
ひとこと要約

本論文では、逆レンダリングとマルチスケールディティール転送を用いた新しいデータ生成手法を提案し、しわや表情を含む写真のようにリアルな顔画像を合成することで、1枚の画像または単眼動画からのリアルタイムで高精度な3次元顔再構築が可能な粗いから細かい段階への畳み込みニューラルネットワークフレームワークの構築を可能にした。これは、品質および効率性において最先端の手法を上回る。

ABSTRACT

With the powerfulness of convolution neural networks (CNN), CNN based face reconstruction has recently shown promising performance in reconstructing detailed face shape from 2D face images. The success of CNN-based methods relies on a large number of labeled data. The state-of-the-art synthesizes such data using a coarse morphable face model, which however has difficulty to generate detailed photo-realistic images of faces (with wrinkles). This paper presents a novel face data generation method. Specifically, we render a large number of photo-realistic face images with different attributes based on inverse rendering. Furthermore, we construct a fine-detailed face image dataset by transferring different scales of details from one image to another. We also construct a large number of video-type adjacent frame pairs by simulating the distribution of real video data. With these nicely constructed datasets, we propose a coarse-to-fine learning framework consisting of three convolutional networks. The networks are trained for real-time detailed 3D face reconstruction from monocular video as well as from a single image. Extensive experimental results demonstrate that our framework can produce high-quality reconstruction but with much less computation time compared to the state-of-the-art. Moreover, our method is robust to pose, expression and lighting due to the diversity of data.

研究の動機と目的

  • CNNベースの3次元顔再構築のための多様で写真のようにリアルなトレーニングデータの不足に取り組むこと、特にしわのような微細なディテールを対象とする。
  • 粗いモーファブルモデルの限界を克服し、リアルな顔のテクスチャーや表情を生成すること。
  • 一般化性を向上させるために、多様で大規模なリアルな顔画像および隣接フレームペアのデータセットを構築すること。
  • さまざまなポーズ、表情、照明条件下でも、リアルタイムで高精度な3次元顔再構築を可能にすること。

提案手法

  • 逆レンダリングを用いて、多様な属性(リアルなしわや照明の変化を含む)を有する写真のようにリアルな顔画像を生成する。
  • マルチスケールディティール転送を適用し、異なるソース画像からの特徴を組み合わせることで、高解像度で微細なディテールを持つ顔画像を合成する。
  • 上記の技術を用いて、リアルなテクスチャーや表情を有する大規模な3次元顔画像データセットを構築する。
  • 実際の動画データの時間的分布をシミュレートすることで、動画に似た隣接フレームペアを生成し、時間的整合性を向上させる。
  • 3つの級列された畳み込みネットワークを用いた粗いから細かい段階への学習フレームワークを設計し、エンドツーエンドの3次元顔再構築を実現する。
  • 合成データセット上でフレームワークを学習させ、単眼動画または単一画像からのリアルタイム推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1逆レンダリングとマルチスケールディティール転送は、しわや表情のような微細なディテールを有する写真のようにリアルな顔画像を効果的に生成できるか?
  • RQ2合成された顔画像の多様で大規模なデータセットは、3次元顔再構築モデルの一般化性とロバスト性を向上させるか?
  • RQ3合成データ上で学習された粗いから細かい段階へのCNNフレームワークは、単一画像または動画からのリアルタイムで高品質な3次元顔再構築を達成できるか?
  • RQ4本手法は、最先端のアプローチと比較して、さまざまなポーズ、表情、照明条件下でどのように性能を発揮するか?

主な発見

  • 提案手法は、しわや表情のような高精細なディテールを有する写真のようにリアルな顔画像を生成でき、従来のモーファブルモデルをはるかに凌駆するリアリズムを実現した。
  • 合成されたデータセットにより、モデルは多様なポーズ、表情、照明条件において良好な一般化性能を示した。
  • 粗いから細かい段階へのフレームワークは、最先端の手法と比較して著しく計算時間を削減しながら、高品質な3次元顔再構築を達成した。
  • モデルは単眼動画および単一画像入力においても、時間的整合性と幾何学的正確性を維持しながら、ロバストな性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。