[論文レビュー] SMPLR: Deep SMPL reverse for 3D human pose and shape recovery
本稿では、3次元関節予測を中間表現として用いることで、1枚のRGB画像からSMPLボディモデルを逆方向に適用し、3次元人体ポーズと形状を回復する深層学習フレームワークSMPLRを提案する。SMPLRをCNNベースのエンコーダーとSMPLをデコーダーとするオートエンコーダーとして定式化することにより、複雑な正則化を回避し、最先端の性能を達成した。Human3.6Mでは3次元関節誤差を25mm、SURREALでは3.5mm低減し、従来のSMPLベースの手法に比べて顕著な向上を示した。
Current state-of-the-art in 3D human pose and shape recovery relies on deep neural networks and statistical morphable body models, such as the Skinned Multi-Person Linear model (SMPL). However, regardless of the advantages of having both body pose and shape, SMPL-based solutions have shown difficulties to predict 3D bodies accurately. This is mainly due to the unconstrained nature of SMPL, which may generate unrealistic body meshes. Because of this, regression of SMPL parameters is a difficult task, often addressed with complex regularization terms. In this paper we propose to embed SMPL within a deep model to accurately estimate 3D pose and shape from a still RGB image. We use CNN-based 3D joint predictions as an intermediate representation to regress SMPL pose and shape parameters. Later, 3D joints are reconstructed again in the SMPL output. This module can be seen as an autoencoder where the encoder is a deep neural network and the decoder is SMPL model. We refer to this as SMPL reverse (SMPLR). By implementing SMPLR as an encoder-decoder we avoid the need of complex constraints on pose and shape. Furthermore, given that in-the-wild datasets usually lack accurate 3D annotations, it is desirable to lift 2D joints to 3D without pairing 3D annotations with RGB images. Therefore, we also propose a denoising autoencoder (DAE) module between CNN and SMPLR, able to lift 2D joints to 3D and partially recover from structured error. We evaluate our method on SURREAL and Human3.6M datasets, showing improvement over SMPL-based state-of-the-art alternatives by about 4 and 25 millimeters, respectively.
研究の動機と目的
- SMPLベースの手法が多対一のマッピングとノイズへの感受性により、不自然なボディメッシュを生成する問題に対処し、単一のRGB画像から正確に3次元人体ポーズと形状を回復すること。
- SMPLパラメータ回帰に複雑な正則化項を必要としないために、3次元関節予測を中間で分離された表現として用いることで、それを回避すること。
- 特に遮蔽や奥行きの曖昧さに起因する構造的な誤差を伴う2次元から3次元関節リフトの問題に対する耐性を高めること。
- CNNを介してSMPL関連の誤差をバックプロパゲーション可能にするエンドツーエンドの深層ネットワークの訓練を可能にすること。
- 実世界の3次元アノテーションが限られている状況でも、合成モーショングラップデータ上でSMPLRを独立して学習することで、データセット間の一般化を可能にすること。
提案手法
- 本手法は、RGB画像から3次元関節位置とスパarsな3次元ランドマークを中間表現として予測するボリュメトリックスタックドアワーゲイズネットワーク(SHN)を用いる。
- 2次元またはノイズのある3次元関節予測を、対称性、骨の長さ比、人間の幾何学的整合性を強制することで洗練するため、SHNとSMPLRの間にノイズ除去オートエンコーダー(DAE)を導入する。
- DAEの出力を、3次元関節およびランドマークデータからSMPLポーズおよび形状パラメータを回帰する2本のブランチを持つマルチレイヤーパーセプトロン(MLP)ネットワークに供給する。
- SMPLモデルは、予測されたSMPLパラメータから完全な3次元ボディメッシュを生成する微分可能デコーダーとして機能し、エンドツーエンドの訓練を可能にする。
- SHN + DAE + MLP + SMPLの全パイプラインはエンドツーエンドで訓練され、メッシュおよび関節誤差がネットワーク全体にバックプロパゲーション可能になる。
- フレームワークは、SMPLRの学習に合成モーショングラップデータを用いるため、実世界のデータセット(SURREALやHuman3.6M)への一般化が可能であり、学習データに真のSMPLパラメータを含まなくてもよい。
実験結果
リサーチクエスチョン
- RQ1SMPLモデルを逆方向に適用する深層オートエンコーダー構造は、単一のRGB画像から3次元人体再構築を改善できるか?
- RQ23次元関節予測を中間表現として用いることで、直接SMPLパラメータ回帰に比べて、不自然なボディメッシュの生成リスクが低下するか?
- RQ3ノイズ除去オートエンコーダーは、特に遮蔽や奥行きの曖昧さに起因する2次元から3次元関節リフトの構造的誤差を効果的に是正できるか?
- RQ4合成モーショングラップデータで学習し、実画像でファインチューニングした場合、SMPLRはどの程度異なるデータセット間で一般化できるか?
- RQ5微分可能なSMPLレンダリングを用いたエンドツーエンド訓練は、非微分可能または弱教師ありの代替手法に比べ、3次元関節およびメッシュの精度を向上させるか?
主な発見
- Human3.6Mデータセットでは、プロトコル1において、SMPLRは従来の最先端のSMPLベース手法に比べて3次元関節誤差を25mm低減し、顕著な精度向上を示した。
- SURREALデータセットでは、マルチタスク学習を用いなくても、SMPL表面誤差を3.5mm低減した。
- DAEモジュールは、2次元から3次元関節リフトにおける構造的誤差を効果的に除去し、骨の長さと予測ポーズの対称性の整合性を向上させた。
- 評価されたすべてのデータセットで、シルエットの交差率(IoU)が0.7を超える結果を得ており、明示的な訓練なしに高品質なメッシュレンダリングを実現した。
- 最終的なエンドツーエンド訓練済みモデル({SHN}_{e2e}^{final})は、SURREALで40.8mmの最先端の3次元関節推定誤差を達成し、マルチタスク学習を用いない最良の手法と同等の性能を示した。
- GTX 1080Ti上で1秒間に3フレームの推論速度を達成し、真値の画像クロップではなく推定されたクロップを使用しても性能の低下が最小限に抑えられており、実世界の前処理誤差に対しても耐性があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。