[論文レビュー] MPT: Mesh Pre-Training with Transformers for Human Pose and Mesh Reconstruction
本稿では、大規模なMoCapデータを用いた自己教師あり事前学習手法であるメッシュ事前学習(MPT)を提案する。MPTは、MoCapから生成されたヒートマップと、新規に提案されたマスクドヒートマップモデリング(MHM)目的関数を活用することで、事前学習時に画像-メッシュペアを必要とせず、ゼロショット推論を可能にするとともに、Human3.6M、3DPW、FreiHANDの各データセットで最先端の性能を達成する。
Traditional methods of reconstructing 3D human pose and mesh from single images rely on paired image-mesh datasets, which can be difficult and expensive to obtain. Due to this limitation, model scalability is constrained as well as reconstruction performance. Towards addressing the challenge, we introduce Mesh Pre-Training (MPT), an effective pre-training strategy that leverages large amounts of MoCap data to effectively perform pre-training at scale. We introduce the use of MoCap-generated heatmaps as input representations to the mesh regression transformer and propose a Masked Heatmap Modeling approach for improving pre-training performance. This study demonstrates that pre-training using the proposed MPT allows our models to perform effective inference without requiring fine-tuning. We further show that fine-tuning the pre-trained MPT model considerably improves the accuracy of human mesh reconstruction from single images. Experimental results show that MPT outperforms previous state-of-the-art methods on Human3.6M and 3DPW datasets. As a further application, we benchmark and study MPT on the task of 3D hand reconstruction, showing that our generic pre-training scheme generalizes well to hand pose estimation and achieves promising reconstruction performance.
研究の動機と目的
- 3次元人間メッシュ再構成のための画像-メッシュペアデータセットの不足と高コストを解決すること。
- 画像の教師信号を必要とせず、大規模なMoCapデータを活用することで、モデルのスケーラビリティと性能を向上させること。
- 手を含む身体部位に一般化可能な汎用的な事前学習フレームワークを構築すること。
- 微調整なしに効果的な推論を可能にするために、一般化可能な人間のポーズおよび形状表現を学習すること。
提案手法
- 仮想カメラによる投影を用いて3次元メッシュデータから合成されたMoCap生成ヒートマップを用いて、メッシュ回帰トランスフォーマーを事前学習する。
- ヒートマップ入力における自己教師あり表現学習を向上させるために、マスクドヒートマップモデリング(MHM)と呼ばれるマスク付き自己符号化目的関数を導入する。
- 推論時において、オフザシェルフの2次元ポーズモデル(例:HigherHRNet)を用いて入力画像から特徴マップを抽出する。
- 1枚の画像からの再構成に適応させるために、2次元-3次元の教師信号を用いて、パイプライン全体をエンドツーエンドで微調整する。
- 200万個の人のメッシュを用いて事前学習をスケーリングし、豊富で一般化可能な人間のボディプリオンを学習する。
- 合成されたMoCapデータ(Complement)を用いて3次元手の再構成に同じ事前学習スキームを適用することで、一般化の有効性を示す。
実験結果
リサーチクエスチョン
- RQ1画像ペアを必要とせずに、MoCapデータを自己教師あり事前学習に効果的に活用できるか?
- RQ2直接的な3次元関節推定と比較して、MoCapから生成されたヒートマップを入力表現として用いることで、事前学習性能が向上するか?
- RQ3微調整なしに、実画像に対するゼロショット推論に事前学習モデルが一般化できるか?
- RQ4MoCapデータの規模が事前学習性能に与える影響は何か?
- RQ5提案されたMPTフレームワークは、最小限の適応で他の身体部位(例:手)に対しても一般化可能か?
主な発見
- MPTは、Human3.6MでPA-MPJPE 5.4 mmとPA-MPJPE 5.6 mmを達成し、先行研究を上回る最先端の性能を示した。
- 3DPWデータセットでは、PA-MPJPE 5.6 mmを達成し、制約のない画像への強い一般化性能を示した。
- FreiHANDデータセットでは、PA-MPJPE 5.6 mmおよびF@15 mm 0.988を達成し、以前の最先端手法を上回った。
- アブレーションスタディの結果、MHMはPA-MPJPEを大幅に改善しており、自己教師あり学習における有効性を確認した。
- 増加するデータスケールで事前学習を実施した結果、ゼロショット性能が向上し、100%のデータで微調整なしにHuman3.6Mで58.4 PA-MPJPEを達成した。
- 本手法は手の再構成に対しても良好に一般化され、合成MoCapデータでのみ事前学習した状態で、FreiHANDでSOTA結果を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。