[論文レビュー] ARCH: Animatable Reconstruction of Clothed Humans
ARCHは、1枚の単眼RGB画像から詳細でアニメーション対応の3D衣装付き人間アバターを再構築するエンド・ツー・エンドのフレームワークを提案する。学習されたセマンティック空間と変形フィールドを用いてポーズのばらつきを正規化し、微細な調整のために透過度を考慮した微分可能レンダリングを採用することで、公開ベンチマーク上、最先端の手法と比較して50%以上の低い再構築誤差を達成するとともに、アニメーションに適した高精細なriggedモデルを生成する。
In this paper, we propose ARCH (Animatable Reconstruction of Clothed Humans), a novel end-to-end framework for accurate reconstruction of animation-ready 3D clothed humans from a monocular image. Existing approaches to digitize 3D humans struggle to handle pose variations and recover details. Also, they do not produce models that are animation ready. In contrast, ARCH is a learned pose-aware model that produces detailed 3D rigged full-body human avatars from a single unconstrained RGB image. A Semantic Space and a Semantic Deformation Field are created using a parametric 3D body estimator. They allow the transformation of 2D/3D clothed humans into a canonical space, reducing ambiguities in geometry caused by pose variations and occlusions in training data. Detailed surface geometry and appearance are learned using an implicit function representation with spatial local features. Furthermore, we propose additional per-pixel supervision on the 3D reconstruction using opacity-aware differentiable rendering. Our experiments indicate that ARCH increases the fidelity of the reconstructed humans. We obtain more than 50% lower reconstruction errors for standard metrics compared to state-of-the-art methods on public datasets. We also show numerous qualitative examples of animated, high-quality reconstructed avatars unseen in the literature so far.
研究の動機と目的
- 制約のない単眼画像から詳細で3次元的かつアニメーション可能な衣装付き人間アバターを再構築する課題に対処すること。
- 既存手法がポーズのばらつきや隠蔽を適切に処理できず、アニメーション用のriggingを備えていないという制限を克服すること。
- 標準のアニメーションパイプラインと互換性があり、高精細な幾何学的形状と外観表現を生成すること。
- 微分可能レンダリングによるピxls単位の監視とポーズに配慮した正規化を通じて、再構築の忠実度を向上させること。
- 追加のrigging処理を経ずに、モーションキャプチャデータを直接使用して再構築されたアバターをアニメーション可能にする。
提案手法
- 3D衣装付き人間を標準ポーズ空間にマッピングするためのセマンティック空間(SemS)とセマンティック変形フィールド(SemDF)を導入し、ポーズや隠蔽による曖昧さを低減する。
- 空間局所特徴(例:RBFベースの関節間距離)を用いたimplicitなニューラル表現を採用し、しわや衣類の折りたたみといった高周波数の表面ディテールをモデル化する。
- 透過度を考慮したGranular Render-and-Compareを用いた微分可能レンダラーを採用し、レンダリングされた画像と入力画像を比較することで、予測された法線とアルベドを精緻に修正する。
- 2D画像から予測された3次元的身体形状とポーズを基に、スキンニングウェイトを含む標準空間再構築を初期化し、自動riggingを実現する。
- トレーニング中に法線とアルベドに対してピxls単位の監視を適用し、表面ディテールと再ライティング忠実度を向上させる。
- 内在的にriggedである標準空間メッシュを構築し、アニメーションパイプラインへの直接適用を可能にする。
実験結果
リサーチクエスチョン
- RQ11枚の画像からの3次元再構築手法は、詳細な幾何学的形状と外観を備えた高精細でアニメーション可能な衣装付き人間アバターを生成できるか?
- RQ2制約のない画像におけるポーズのばらつきや隠蔽を効果的に正規化することで、再構築精度を向上させられるか?
- RQ3透過度を考慮した監視付き微分可能レンダリングは、implicitな3次元表現における法線とアルベドのリアルさを向上させられるか?
- RQ4セマンティック変形フィールドを有するimplicit関数は、衣類のしわや髪の毛といった微細なディテールをどれほど正確に再構築できるか?
- RQ5再構築されたアバターは、追加処理を経ずに標準のモーションキャプチャシーケンスを直接使用してアニメーション可能か?
主な発見
- ARCHは、PIFuなどの最先端手法と比較して、RenderPeopleデータセットでは50%以上、BUFFデータセットでは60%以上の低い再構築誤差を達成した。
- RBFベースの空間特徴表現は、XYZおよびL2特徴と比較して、定量的指標および定性的なディテール保持の両面で優れた性能を示した。
- 透過度を考慮した微分可能レンダリングを用いたGranular Render-and-Compareは、法線推定の向上と視覚的アーティファクトの低減に顕著な効果を示した。
- 本フレームワークは、パンツのステッチ、靴のヒール、微細なしわといった複雑な衣類ディテールを、従来手法が捉えられなかった形で成功裏に再構築した。
- 再構築されたアバターは内在的にriggedであり、リターゲティングされたMixamoモーションシーケンスを直接使用してアニメーション可能であることが実証され、完全なアニメーション対応性が示された。
- 本モデルは、挑戦的なポーズや自己接触状況に対しても良好に一般化するが、まれなポーズや重度に隠蔽されたポーズは依然として課題である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。