[論文レビュー] Human MotionFormer: Transferring Human Motions with Vision Transformers
Human MotionFormer は、階層的なビジョン変換器フレームワークを提案し、グローバルおよびローカルなモーションマッチングを統合的にモデル化することで、高精細な人間のモーショントランスファーを実現する。2つのViTエンコーダーを用いて特徴抽出を行い、ワーピングと生成の2本のブランチを持つマルチヘッドクロスアテンションデコーダーを採用。相互学習損失により性能が向上し、定量的・定性的な指標において最先端の性能を達成した。
Human motion transfer aims to transfer motions from a target dynamic person to a source static one for motion synthesis. An accurate matching between the source person and the target motion in both large and subtle motion changes is vital for improving the transferred motion quality. In this paper, we propose Human MotionFormer, a hierarchical ViT framework that leverages global and local perceptions to capture large and subtle motion matching, respectively. It consists of two ViT encoders to extract input features (i.e., a target motion image and a source human image) and a ViT decoder with several cascaded blocks for feature matching and motion transfer. In each block, we set the target motion feature as Query and the source person as Key and Value, calculating the cross-attention maps to conduct a global feature matching. Further, we introduce a convolutional layer to improve the local perception after the global cross-attention computations. This matching process is implemented in both warping and generation branches to guide the motion transfer. During training, we propose a mutual learning loss to enable the co-supervision between warping and generation branches for better motion representations. Experiments show that our Human MotionFormer sets the new state-of-the-art performance both qualitatively and quantitatively. Project page: \url{https://github.com/KumapowerLIU/Human-MotionFormer}
研究の動機と目的
- ソース人物とターゲットモーションの間で、大規模かつ微細なモーション変化を正確にマッチングする課題に対処すること。
- CNNベースの手法が長距離依存関係や疎なキーポイント表現を捉えることの制限を克服すること。
- ビジョン変換器を用いてグローバルおよびローカル特徴マッチングを統合的にモデル化することで、モーショントランスファーの品質を向上させること。
- ワーピングと生成の2本のブランチを統合し、相互監視を導入することで、アーティファクトを低減し、フォトリアルな質を向上させること。
提案手法
- フレームワークは、ソース人物画像とターゲットポーズ画像から階層的特徴を抽出するために、2つのビジョン変換器エンコーダーを採用する。
- 段階的なブロックを備えたデコーダーは、クロスアテンション機構を用い、ターゲットモーション特徴をクエリとし、ソース特徴をキーおよびバリューとしてグローバルマッチングを実現する。
- クロスアテンションの後に畳み込み層を導入し、ローカルな認識を強化し、特徴の整合性を向上させる。
- デコーダーには2本の並列ブランチが含まれる:ワーピングブランチは予測されたフローフィールドを用いてソース特徴を変形し、生成ブランチは新規な外観詳細を合成する。
- ワーピングブランチと生成ブランチ間の特徴を整列させるために、相互学習損失を導入し、共通の監視とより優れた表現学習を実現する。
- 敵対的損失とマルチスケールの監視を用い、10エポックにわたり学習率の段階的減少を適用してモデルを訓練する。
実験結果
リサーチクエスチョン
- RQ1ビジョン変換器は、人間のモーショントランスファーにおいて、グローバルおよびローカルなモーションマッチングを効果的にモデル化できるか?
- RQ2ワーピングと生成ブランチの共同最適化は、単一ブランチアプローチと比較して、モーショントランスファーのリアリズムをどのように向上させるか?
- RQ3ブランチ間の相互学習は、特徴表現の向上とアーティファクトの低減にどの程度寄与するか?
- RQ4本手法は、CNNベースおよび3Dメッシュベースの手法と比較して、大規模なモーション変化や部分的オクルージョンに対処する上で、どのように優れているか?
- RQ5本フレームワークは、多様なソース人物とターゲットモーションに対して一般化可能であり、アイデンティティおよび外観の忠実度を保持できるか?
主な発見
- 完全な Human MotionFormer モデルは、YouTube データセットで PSNR 23.50、SSIM 0.885、LPIPS 0.073、FID 65.03 を達成し、すべてのアブレーションバージョンを上回った。
- ワーピングブランチを削除すると、衣類に不自然な緑や黒の領域が顕在する深刻なアーティファクトが発生し、これはソース外観の保持にその役割があることを示している。
- 生成ブランチのみでは過学習が生じ、非現実的な出力が得られる一方、ワーピングブランチのみでは新規コンテンツを生成できないため、フォトリアルな質に欠ける。
- 相互学習損失により視覚的アーティファクトが顕著に低減され、相互学習なしのアブレーションと比較して FID が2.5ポイント改善された。
- アブレーションスタディにより、グローバルなクロスアテンションとローカルな畳み込みによる精錬の両方が、正確なマッチングと高精細な合成に不可欠であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。