Skip to main content
QUICK REVIEW

[論文レビュー] Detailed Human Avatars from Monocular Video

Thiemo Alldieck, Marcus Magnor|arXiv (Cornell University)|Aug 3, 2018
3D Shape Modeling and Analysis参考文献 27被引用数 10
ひとこと要約

本稿では、顔のランドマーク検出、形状から明るさ(shape-from-shading)、および意味的注意を払ったテクスチャステッチ戦略を統合することで、単一のモノクロムビデオから高精細でアイデンティティを保持する3次元人間アバターを生成する新規手法を提示する。この手法は、標準的なTポーズ空間における時間的証拠を統合し、リアルな顔貌特徴、細かい衣類のシワ、高解像度テクスチャを持つアバターを生成する。ユーザースタディーにおいて、ユーザープレファレンス、アイデンティティ保持、および詳細度の観点で、最先端手法を89%以上上回った。

ABSTRACT

We present a novel method for high detail-preserving human avatar creation from monocular video. A parameterized body model is refined and optimized to maximally resemble subjects from a video showing them from all sides. Our avatars feature a natural face, hairstyle, clothes with garment wrinkles, and high-resolution texture. Our paper contributes facial landmark and shading-based human body shape refinement, a semantic texture prior, and a novel texture stitching strategy, resulting in the most sophisticated-looking human avatars obtained from a single video to date. Numerous results show the robustness and versatility of our method. A user study illustrates its superiority over the state-of-the-art in terms of identity preservation, level of detail, realism, and overall user preference.

研究の動機と目的

  • 単一のモノクロムビデオから高精細でパーソナライズされた3次元人間アバターを生成する課題に対処すること。これは、幾何的および外観的手がかりが限られているため困難である。
  • 顔の詳細や細かい表面テクスチャを統合することで、既存のモノクロム再構成手法でしばしば失われる要素を補い、アイデンティティ保持性と知覚的リアリズムを向上させること。
  • 複数視点のテクスチャ統合におけるテクスチャの飛び出し(spillover)とぼやけを回避するため、外観事前知識を組み込んだ意味的注意を払ったテクスチャステッチ戦略を導入すること。
  • フレーム単位の3次元証拠(ランドマーク、法線)を標準ポーズ空間に統合することで、動的な関節運動を持つ人物の再構成を堅牢に可能にすること。

提案手法

  • 本手法はSMPLモデルを用いて人間のポーズを追跡し、フレーム単位の顔ランドマークの射影線を標準的なTポーズ空間に変換することで、時間的統合と形状の最適化を可能にする。
  • 各フレームで形状から明るさ(shape-from-shading)を適用し、部分的な3次元法線場を回復し、それを標準空間に統合することで、しわなどの表面詳細を強化する。
  • グラフカットエネルギー関数を最小化するバイナリ最適化に基づく新規なテクスチャステッチフレームワークを導入し、複数視点からのRGB値を効率的にテクスチャピクセルに割り当てる。
  • テクスチャ更新エネルギーに意味的外観事前知識を統合し、部位別外観分布に基づいて不自然な色割り当てをペナルティ化することで、テクスチャの飛び出しを低減する。
  • 最終的な3次元再構成はSMPLボディモデルによって正則化されるが、顔貌特徴や衣類の詳細を含む高解像度の幾何学的形状とテクスチャを保持する。
  • すべてのコンponentsは、単一のビデオシーケンスからの幾何学、シャドー、外観の手がかりを統合する包括的なフレームワークで同時に最適化される。

実験結果

リサーチクエスチョン

  • RQ1モノクロムビデオからの顔ランドマーク検出が、時間的に統合されることで、3次元顔再構成とアイデンティティ保持性の向上に効果的に寄与するか?
  • RQ2複数の動く視点からの形状から明るさの手がかりをどのように集約すれば、深度センサーを必要とせずに、しわのような微細な表面詳細を向上させられるか?
  • RQ3動的な関節運動を持つ被写体の部分的なテクスチャを統合する際、ぼやけや色の飛び出しを回避するスケーラブルで効率的なテクスチャステッチ手法を設計可能か?
  • RQ4意味的外観事前知識を統合することで、モノクロム3次元アバター再構成におけるテクスチャの一貫性とリアリズムがどの程度向上するか?
  • RQ5提案手法は、ユーザープレファレンスおよびリアリズムとアイデンティティの詳細評価によって測定された知覚的品質において、最先端手法を顕著に上回るか?

主な発見

  • 本手法は、[3]の最先端手法に対して89.64%のユーザープレファレンス率を達成し、実世界評価において顕著な知覚的優位性を示した。
  • ユーザーは95.72%の割合で、本手法のアバターをより詳細であると認識した。これは、細かい幾何学的形状と表面テクスチャの保持に成功したことを確認する。
  • テクスチャ付きメッシュ比較ではアイデンティティ保持性が83.12%に向上し、テクスチャなし比較では65.70%に達した。専門家ユーザーはアイデンティティ認識において顕著に高い正確性(90.48%)を示した。
  • 意味的テクスチャ事前知識は、色の飛び出しを効果的に低減した。図9で視覚的に確認されたように、皮膚から衣類へのテクスチャの流れ(flooding)が最小限に抑えられた。
  • 形状から明るさの統合により表面詳細が向上し、図8の視覚的結果から顔貌および衣類のしわのリアリズムが明確に向上していることが示された。
  • ユーザースタディーの結果、本手法のアバターは92.27%の割合でよりリアルであると判断された。これは、本手法が知覚的に説得力のある結果を達成したことを強力に示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。