Skip to main content
QUICK REVIEW

[論文レビュー] Global-correlated 3D-decoupling Transformer for Clothed Avatar Reconstruction

Zechuan Zhang, Li Sun|arXiv (Cornell University)|Sep 24, 2023
Human Pose and Action Recognition被引用数 7
ひとこと要約

本稿では、1枚の画像から3D衣装付きアバターを再構築するための新しいトランスフォーマー基盤手法GTAを提案する。Vision Transformerエンコーダを用いてグローバルに相関する画像特徴を捉え、学習可能な埋め込みとクロスアテンションを用いた3D分解デコーダで三平面特徴を分離する。モデルは最先端の性能を達成し、CAPE-FPでチェンファーディスタンスを0.8cm未満に低下させ、特に困難なポーズやゆとりのある服の状況でも高品質なテクスチャを再構築する。

ABSTRACT

Reconstructing 3D clothed human avatars from single images is a challenging task, especially when encountering complex poses and loose clothing. Current methods exhibit limitations in performance, largely attributable to their dependence on insufficient 2D image features and inconsistent query methods. Owing to this, we present the Global-correlated 3D-decoupling Transformer for clothed Avatar reconstruction (GTA), a novel transformer-based architecture that reconstructs clothed human avatars from monocular images. Our approach leverages transformer architectures by utilizing a Vision Transformer model as an encoder for capturing global-correlated image features. Subsequently, our innovative 3D-decoupling decoder employs cross-attention to decouple tri-plane features, using learnable embeddings as queries for cross-plane generation. To effectively enhance feature fusion with the tri-plane 3D feature and human body prior, we propose a hybrid prior fusion strategy combining spatial and prior-enhanced queries, leveraging the benefits of spatial localization and human body prior knowledge. Comprehensive experiments on CAPE and THuman2.0 datasets illustrate that our method outperforms state-of-the-art approaches in both geometry and texture reconstruction, exhibiting high robustness to challenging poses and loose clothing, and producing higher-resolution textures. Codes will be available at https://github.com/River-Zhang/GTA.

研究の動機と目的

  • 現在の3D衣装付きアバター再構築手法が2D特徴に強く依存し、一貫性のないクエリ戦略を採用しているという限界を是正すること。
  • グローバル3D特徴相関を活用することで、複雑なポーズやゆとりのある服の状況下でも再構築の正確性とロバスト性を向上させること。
  • トランスフォーマーと学習可能な埋め込みを用いて、効率的かつ効果的な3D特徴分解機構を開発すること。
  • 空間的位置情報と人体の事前知識を組み合わせたハイブリッドクエリ戦略により、特徴統合を強化すること。
  • アニメーションやバーチャルトライオンなどの応用に適した高解像度でアニメーション可能な3Dアバターを実現すること。

提案手法

  • ビジョントランスフォーマー基盤のエンコーダが、単一の単眼画像からグローバルに相関する特徴を抽出する。
  • 学習可能な埋め込みをクエリとして用いたクロスアテンションを活用し、3つの直交する平面に沿った三平面3D特徴を分離する3D分解デコーダを採用する。
  • 空間クエリ(位置特定のため)と事前知識強化クエリ(身体構造のガイドラインのため)をハイブリッドに融合することで、特徴統合を向上させる戦略を採用する。
  • 三平面表現を活用することで、メモリコストを削減しながらも、高解像度の3D幾何学的形状とテクスチャ再構築を維持する。
  • アーキテクチャはTHuman2.0データセット上でエンドツーエンドに訓練され、幾何学的およびテクスチャ最適化のためのファインチューニングが実施される。
  • パラメトリックな3Dボディ上でポーズ変換と特徴置換が可能であるため、アニメーションやバーチャルトライオンなどの下流応用を支援する。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー基盤のアーキテクチャは、1枚の画像からの3D再構築を向上させるために、グローバルに相関する2D画像特徴を効果的に捉えることができるか?
  • RQ2学習可能な埋め込みとクロスアテンションを用いて、三平面3D特徴を効果的に分解・再構築できるか?
  • RQ3空間クエリと事前知識強化クエリをハイブリッド統合戦略で組み合わせることで、単独で使用する場合よりも幾何学的・テクスチャ的再構築が向上するか?
  • RQ4提案手法は、複雑なポーズやゆとりのある服といった困難な状況にも一般化可能であり、既存の最先端手法を上回る性能を示すか?
  • RQ5再構築された3Dアバターは、アニメーションやバーチャルトライオンの応用にどの程度活用可能か?

主な発見

  • GTAはCAPE-FPテストセットでチェンファーディスタンスを0.8cm未満に低下させ、単一視点での衣装付きアバター再構築において、このしきい値を初めて突破した。
  • モデルは優れたテクスチャ再構築性能を示し、最先端手法と比較して高いPSNRスコアを達成した。
  • ハイブリッド事前融合戦略は、空間クエリのみまたは事前知識強化クエリのみを使用する手法よりも、幾何学的およびテクスチャ的品質の両面で優れた性能を示した。
  • クロスアテンションと学習可能なクエリを備えた3D分解デコーダは、ベースラインの畳み込みネットワークや自己アテンションのみのトランスフォーマーと比較して、顕著に幾何学的正確性を向上させた。
  • モデルは複雑なポーズやゆとりのある服を有する実世界の画像に対しても、良好に一般化され、高い再構築忠実度を維持した。
  • ポーズ変換とパラメトリック3Dボディ上の特徴置換が可能であるため、アニメーションやバーチャルトライオンの実用的応用を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。