[論文レビュー] SCANimate: Weakly Supervised Learning of Skinned Clothed Avatar Networks
SCANimateは、テンプレートメッシュの登録や合成データを必要とせず、rawな3Dスキャンから直接高精細でアニメーション可能な衣装を着た人間アバター(Scanimats)を学習する弱い教師付きフレームワークを導入する。暗黙的なスキンニングフィールドとサイクル整合性のあるポーズ正規化を活用することで、局所的なポーズ条件に基づいたポーズ依存の衣類変形をモデル化し、最先端の手法よりも優れた現実性と一般化性能を達成する。
We present SCANimate, an end-to-end trainable framework that takes raw 3D scans of a clothed human and turns them into an animatable avatar. These avatars are driven by pose parameters and have realistic clothing that moves and deforms naturally. SCANimate does not rely on a customized mesh template or surface mesh registration. We observe that fitting a parametric 3D body model, like SMPL, to a clothed human scan is tractable while surface registration of the body topology to the scan is often not, because clothing can deviate significantly from the body shape. We also observe that articulated transformations are invertible, resulting in geometric cycle consistency in the posed and unposed shapes. These observations lead us to a weakly supervised learning method that aligns scans into a canonical pose by disentangling articulated deformations without template-based surface registration. Furthermore, to complete missing regions in the aligned scans while modeling pose-dependent deformations, we introduce a locally pose-aware implicit function that learns to complete and model geometry with learned pose correctives. In contrast to commonly used global pose embeddings, our local pose conditioning significantly reduces long-range spurious correlations and improves generalization to unseen poses, especially when training data is limited. Our method can be applied to pose-aware appearance modeling to generate a fully textured avatar. We demonstrate our approach on various clothing types with different amounts of training data, outperforming existing solutions and other variants in terms of fidelity and generality in every setting. The code is available at https://scanimate.is.tue.mpg.de.
研究の動機と目的
- 表面の登録やカスタムテンプレートを必要とせずに、rawな3Dスキャンから直接アニメーション可能な衣装を着た人間アバターのエンドツーエンド学習を可能にすること。
- 合成シミュレーションデータに依存せずに、しわやスライディング効果などの複雑な現実的な衣類変形をモデル化すること。
- グローバルなポーズ埋め込みではなく、局所的なポーズ条件付けを用いることで、未観測のポーズへの一般化を実現すること。
- 2Dテクスチャマッピングを一切使用せずに、完全なテクスチャ付きアバター生成を可能にするために、暗黙的な形状表現を外観モデリングに拡張すること。
- 固定トポロジーのテンプレートに依存する既存手法の制限や、独立したパーツモデリングによるアーティファクトを回避すること。
提案手法
- 本手法は、メッシュトポロジーの仮定を必要とせず、3次元空間における連続的なスキンニングウェイトを回帰するためのニューラル暗黙関数を用いる。これにより、ポーズから正規化、正規化からポーズへの変換が可能になる。
- 幾何的サイクル整合性を強制するために、前向きおよび逆方向の変換後に元のスキャンを再構築できるように、逆LBS関数を学習する。これにより、スキンニングウェイト学習に対する弱い教師信号が得られる。
- 局所的なポーズに敏感な暗黙関数を用いることで、欠損した幾何を補完し、ポーズ依存の変形をモデル化する。グローバルなポーズ埋め込みと比較して、長距離の誤った相関を低減できる。
- 学習された暗黙的スキンニングフィールドを用いてスキャンを共通のポーズに正規化することで、アーチクレートな変形と形状を分離する。
- 外観モデリングへの拡張として、ニューラルテクスチャフィールドを予測することで、2D UVマッピングを必要としない高解像度の3D認識レンダリングを可能にする。
- 自己交差、穴、ノイズを含むrawスキャンを、ポーズパラメータ(SMPL)のみを教師信号として、エンドツーエンドで学習する。
実験結果
リサーチクエスチョン
- RQ1テンプレートメッシュへの表面登録を必要とせず、rawな3Dスキャンからパラメトリックでアニメーション可能な衣装を着た人間アバターを直接学習することは可能か?
- RQ2合成データやラベル付きトレーニングデータが存在しない状況下でも、正確で一貫性があり、現実的な衣類変形のモデリングが可能か?
- RQ3特に限られたトレーニングデータの下で、局所的ポーズ条件付けがグローバルなポーズ埋め込みを上回る一般化性能を示すか?
- RQ4トポロジーの変化(例:衣類の持ち上げ)を保存しつつ、不規則でノイジーかつ不完全な3Dスキャンから高精細な形状と外観再構築が可能か?
- RQ5ポーズの教師信号のみで、幾何とテクスチャの両方をエンドツーエンドで学習できる、完全に微分可能なシステムを構築することは可能か?
主な発見
- SCANimateは、野生のベンチマーク(in-the-wild)で平均形状-メッシュ距離0.570 mmを達成し、CAPE(0.970 mm)とNASA(1.12 mm)を上回り、優れた再構築精度を示している。
- 野生のセットにおける知覚的画像品質スコア(Pi)は0.50に達し、CAPE(0.268)とNASA(0.432)を大きく上回り、視覚的な現実性の向上を示している。
- 野生のセットにおける知覚的ボリュームスコア(Pv)が0.50であることは、SCANimateがグローバルな一貫性を保ち、独立したパーツモデリングによるアーティファクトを回避していることを示している。
- 外挿タスクにおいて、SCANimateはCAPEやNASAよりも未観測ポーズへの一般化が優れており、アーティファクトが少なく、一貫性のある変形パターンを示している。
- 本手法は、持ち上げやしわの発生を伴うトポロジーが変化する複雑な衣類(例:ジャケット)を成功裏にモデル化しているが、固定トポロジー制約のためCAPEはこれを捉えられていない。
- 外観モデリングへの拡張により、2D UVマッピングを必要とせず、高解像度の3D認識テクスチャ予測が可能になり、Scanimatsのリアルなレンダリングが実現している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。