Skip to main content
QUICK REVIEW

[論文レビュー] Procedural Humans for Computer Vision

Charlie Hewitt, Tadas Baltrušaitis|arXiv (Cornell University)|Jan 3, 2023
Face recognition and analysis被引用数 4
ひとこと要約

本論文は、[20]の高精細な顔の詳細とSMPL-Hを組み合わせたパラメトリックで手続き的な3次元人体モデルを提示する。このモデルにより、顔面の詳細、全身の形状とポーズを制御でき、密度の高い3次元アノテーションが付与されたリアルな合成データの生成が可能になる。本手法は、学習済みの事前分布を用いた微分可能レンダリングパイプラインと最適化により、自己遮蔽や高運動複雑性下でも、多視点2次元ランドマークからの正確な3次元人体再構築を実現する。

ABSTRACT

Recent work has shown the benefits of synthetic data for use in computer vision, with applications ranging from autonomous driving to face landmark detection and reconstruction. There are a number of benefits of using synthetic data from privacy preservation and bias elimination to quality and feasibility of annotation. Generating human-centered synthetic data is a particular challenge in terms of realism and domain-gap, though recent work has shown that effective machine learning models can be trained using synthetic face data alone. We show that this can be extended to include the full body by building on the pipeline of Wood et al. to generate synthetic images of humans in their entirety, with ground-truth annotations for computer vision applications. In this report we describe how we construct a parametric model of the face and body, including articulated hands; our rendering pipeline to generate realistic images of humans based on this body model; an approach for training DNNs to regress a dense set of landmarks covering the entire body; and a method for fitting our body model to dense landmarks predicted from multiple views.

研究の動機と目的

  • コンピュータビジョンにおける現実的で完全にアノテートされた合成人体データの生成に取り組み、ドメインギャップとアノテーションコストを低減すること。
  • 従来の合成顔データの研究を拡張し、関節のある手や表情を含む全身人体モデルにまで拡大し、密度の高い3次元アノテーションを提供すること。
  • 学習済み事前分布と微分可能レンダリングパイプラインを用いた最適化により、多視点2次元ランドマークから正確な3次元人体再構築を実現すること。
  • 顔再構築と比較して、ポーズ推定における曇りや自己遮蔽の増加に起因する曇りを克服し、多視点入力と頑健な初期化を必要とすること。

提案手法

  • 高精細な顔モデル[20]とSMPL-Hを統合し、12,943個の頂点と54個の関節を持つ統一されたパラメトリックな人体モデルを構築。アイデンティティ、表情、ポーズの制御が可能。
  • 手作業で作成されたスキンニング重みを用いた線形ブレンドスキンニング(LBS)関数を採用。ポーズ依存のブレンドシェイプはSMPL-Hから取得。
  • [20]のヘッドモデルをSMPLにアライメントさせ、手作業で作成されたトポロジーでメッシュを統合し、滑らかな過渡領域を確保。テクスチャ互換性を確保するためUV空間を調整。
  • 新しいトポロジーに、ソースモデルからのベース(アイデンティティ、表情、ポーズ、スキンニング重み)をマッピング関数を用いて転送。既存のアセットとの互換性を確保。
  • 微分可能レンダリングパイプラインを用いて、パラメトリックモデルからリアルな画像を生成。これにより、DNNのエンドツーエンド学習が可能となり、密度の高い2次元ランドマーク回帰が実現。
  • データ項と正則化項を含む多視点最適化フレームワークを用いて、予測された2次元ランドマークに全身体モデルをフィット。ポーズとアイデンティティのためのGMM事前分布を含む。

実験結果

リサーチクエスチョン

  • RQ1手続き的かつ高精細な3次元人体モデル(全身および顔の詳細を含む)を用いて、コンピュータビジョンのためのリアルなトレーニングデータを合成可能か?
  • RQ2このようなモデルを用いて、顔面のランドマーク、形状、ポーズなどの密度の高い3次元アノテーションをスケール的に効率的に生成できるか?
  • RQ3自己遮蔽やポーズの曇りが顕著な状況下で、多視点2次元ランドマークからの3次元人体再構築を頑健に実現する最適化戦略は何か?
  • RQ4GMM(混合ガウス分布)などの学習済み事前分布(ポーズおよびアイデンティティ用)は、L2正則化と比較して再構築の正確性と現実性をどのように向上させるか?
  • RQ5多視点入力と高品質な初期化は、単眼3次元人体再構築の不適切な性質を解消するために果たす役割は何か?

主な発見

  • 提案モデルは、SMPL-Hと同等の互換性を維持しながら、顔面の精細さが顕著に向上している。
  • 本モデルで生成された合成データは、高精度なDNNによる密度の高い2次元ランドマーク回帰のトレーニングに効果的に使用可能である。
  • 多視点入力(C ≥ 3台のカメラ)は、3次元再構築の頑健性に不可欠であり、視点数が増えるほど性能が著しく向上する。
  • 特に手のポーズに特化したGMM事前分布の使用は、L2正則化と比較して、より現実的で信頼性の高い3次元再構築を実現する。
  • 1視点からの機械学習ベースのポーズ初期化は、特に複雑な手のポーズにおいて収束性と正確性を著しく向上させる。
  • 多視点ランドマークを用いたモデルフィッティングは、高い3次元一貫性と正確なワールド座標空間の登録を実現し、視点間の一貫性を明示的に制約しない手法を上回る性能を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。