Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Reconstruct People in Clothing from a Single RGB Camera

Thiemo Alldieck, Marcus Magnor|arXiv (Cornell University)|Mar 14, 2019
3D Shape Modeling and Analysis参考文献 83被引用数 13
ひとこと要約

Octopusは、1~8フレームのモノクロムRGB動画から、衣服や髪を含めた詳細な3D人体形状を再構築する深層学習モデルであり、10秒未満で4~5 mmの再構築精度を達成する。2つのストリーム(ボトムアップおよびトップダウン)のCNNアーキテクチャを用い、ポーズに依存しない形状コードを予測し、輪郭の整合性を用いて予測を精緻化することで、最小限の入力で高速かつ正確に完全自動の3Dアバター作成を実現する。

ABSTRACT

This repository contains code corresponding to the paper Learning to Reconstruct People in Clothing from a Single RGB Camera.

研究の動機と目的

  • 最小限のモノクロムRGB動画フレームから、衣服を含むパーソナライズドな人体の高速かつ自動的な3D再構築を実現すること。
  • 数時間にわたる最適化ベースの手法が要求する長時間の処理と多数の事前処理の制限を克服すること。
  • 実世界の3Dグランドトゥーストのアノテーションを一切必要とせずに高い再構築精度を達成すること。
  • 入力フレーム数が変動する状況、最少数として1フレームでも対応可能な堅牢な推論を可能にすること。
  • 合成データにのみトレーニングされたモデルが、実世界のデータにも一般化できること。

提案手法

  • モデルはCNNを用いてF個の入力動画フレームをF個のポーズに依存しない潜在コードに変換し、それらを正準Tポーズ空間における1つの形状コードに統合する。
  • デュアルストリームアーキテクチャにより、ボトムアップおよびトップダウンのパスウェイを介してSMPLボディパラメータと3D頂点オフセット(衣服および髪用)を予測し、双方向の情報伝達を可能にする。
  • ボトムアップ予測は1フレームあたり50 msで実行され、その後、輪郭の重なりと関節再投影誤差最適化を用いて10秒間のトップダウンの精緻化が行われる。
  • モデルは実際の3Dグランドトゥーストを一切必要とせず、合成動画シーケンス、セマンティックセグメンテーションマスク、キーポイントアノテーションからなる合成データにのみトレーニングされる。
  • Tポーズの正準空間により、形状コードがポーズに依存しなくなり、マルチビュー情報の有効な統合が可能になる。
  • 推論時、同じモデルが入力フレームを用いてボトムアップ予測とトップダウン精緻化を両方実行するため、エンド・トゥ・エンドの一貫性が保証される。

実験結果

リサーチクエスチョン

  • RQ11~8フレームのモノクロムRGB動画から、衣服および髪を含む詳細な3D人体形状を高い精度で再構築できるか?
  • RQ2実際の3Dアノテーションを一切必要とせず、ボトムアップ予測の高速性とトップダウン精緻化の高精度を併せ持つ1つのモデルが可能か?
  • RQ3合成データにのみトレーニングされたモデルが、実世界のモノクロムRGBデータにも十分に一般化できるか?
  • RQ4入力フレーム数と最適化時間の変動が、再構築精度および処理速度に与える影響は何か?
  • RQ5VR/ARやバーチャルトライアウトのようなリアルタイム応用に適した、完全自動かつ高精度の再構築が可能か?

主な発見

  • Octopusは、100%のフルスーパービジョン条件下で平均頂点再構築誤差4.47 ± 4.41 mmを達成し、トップダウン最適化後には3.17 ± 3.41 mmにまで低下する。
  • 10%のフルスーパービジョンでも高い精度を維持し、最適化前は平均誤差4.73 ± 4.56 mm、最適化後は3.46 ± 3.62 mmを達成しており、限られたスーパービジョンに対しても頑健であることが示された。
  • 3D形状の再構築は10秒未満で実行可能であり、最適化ベースの最先端手法(約2時間)と比べて数個のオーダーも高速である。
  • 定性的な比較では、120フレームやRGB-Dデータを必要とする[6]および[9]と同等の視覚的品質を達成している。
  • 合成データにのみトレーニングされたモデルが、実世界データ(PeopleSnapshotおよびLifeScansデータセット)に対しても良好に一般化している。
  • 正準Tポーズ空間の使用により、ポーズに依存しない潜在コードが得られ、マルチビュー情報の有効な統合が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。