Skip to main content
QUICK REVIEW

[論文レビュー] Human Mesh Recovery from Monocular Images via a Skeleton-disentangled Representation

Yu Sun, Yun Ye|arXiv (Cornell University)|Aug 20, 2019
Human Pose and Action Recognition参考文献 37被引用数 13
ひとこと要約

本論文は、単眼画像および動画からエンドツーエンドで3次元人体メッシュを回復するためのスケルトン分離表現フレームワークを提案する。プラグアンドプレイ可能なDSDモジュールを用いてスケルトンポーズをボディーシェイプの詳細から分離し、自己注意時系列ネットワーク(SATN)と非教師付き順序回復を活用することで、最先端の性能を達成し、Human3.6MでMPJPEが15.4%、PA-MPJPEが23.8%改善された。

ABSTRACT

We describe an end-to-end method for recovering 3D human body mesh from single images and monocular videos. Different from the existing methods try to obtain all the complex 3D pose, shape, and camera parameters from one coupling feature, we propose a skeleton-disentangling based framework, which divides this task into multi-level spatial and temporal granularity in a decoupling manner. In spatial, we propose an effective and pluggable "disentangling the skeleton from the details" (DSD) module. It reduces the complexity and decouples the skeleton, which lays a good foundation for temporal modeling. In temporal, the self-attention based temporal convolution network is proposed to efficiently exploit the short and long-term temporal cues. Furthermore, an unsupervised adversarial training strategy, temporal shuffles and order recovery, is designed to promote the learning of motion dynamics. The proposed method outperforms the state-of-the-art 3D human mesh recovery methods by 15.4% MPJPE and 23.8% PA-MPJPE on Human3.6M. State-of-the-art results are also achieved on the 3D pose in the wild (3DPW) dataset without any fine-tuning. Especially, ablation studies demonstrate that skeleton-disentangled representation is crucial for better temporal modeling and generalization.

研究の動機と目的

  • 重度のポーズ・シェイプの曖昧さと情報損失により、単一の2次元画像からの3次元人体メッシュ回復に内在する曖昧さと複雑さに対処する。
  • 共有特徴空間に3次元ポーズ、シェイプ、カメラパラメータを密に結合するエンドツーエンド手法の不安定さと一般化性能の低さを克服する。
  • スケルトン表現を分離することで、単眼動画シーケンスにおける時系列モデリングを向上させ、運動ダイナミクスのより良い学習を可能にする。
  • アーキテクチャの大幅な見直しが不要な軽量でプラグアンドプレイ可能なモジュールを開発し、単フレームおよび動画ベースの3次元メッシュ回復を向上させる。
  • フレーム順序回復を用いた非教師付き時系列監視を活用することで、制約のない、リアルな環境でも頑健な3次元メッシュ予測を実現する。

提案手法

  • スケルトンポーズ特徴をボディーシェイプおよび詳細特徴から、学習可能でプラグアンドプレイ可能な方法で分離するDSD(スケルトンを詳細から分離する)モジュールを導入する。
  • 自己注意を用いた長距離シーケンスモデリングとTCNによる効率的な短距離時系列特徴学習を統合した自己注意時系列畳み込みネットワーク(SATN)を適用する。
  • 時系列シャッフルと順序回復に基づく非教師付き対抗訓練戦略を設計し、真の時系列監視がなくても運動ダイナミクスを学習可能にする。
  • DSDモジュールが安定的かつ分離された特徴学習を可能にするため、2次元キーポイント監視と3次元メッシュ監視のみを用いて、ネットワーク全体をエンドツーエンドで学習する。
  • DSDモジュールにおける双方向畳み込み統合の前に、スケルトンと詳細特徴を別々に処理する2ストリーム特徴抽出ヘッドを設計する。
  • フレーム順序回復を事前学習タスクとして活用:シャッフルされた動画クリップをネットワークに入力し、識別器を用いて正しい時系列順序を予測するようにモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1スケルトンポーズをボディーシェイプの詳細から分離することで、単眼画像からの3次元人体メッシュ回復の精度と安定性が向上するか?
  • RQ2提案されたDSDモジュールは、特徴の結合を軽減し、多様なポーズやシェイプにわたる一般化性能を向上させるか?
  • RQ3自己注意機構をTCNと組み合わせることで、動画ベースの3次元メッシュ回復における長期的時系列モデリングが向上するか?
  • RQ4非教師付き時系列順序回復は、明示的な時系列監視が存在しない状況でも、運動ダイナミクスの学習を効果的に促進するか?
  • RQ5スケルトン分離は、動画シーケンスにおける時系列モデリング性能をどの程度向上させるか?

主な発見

  • 提案されたDSDモジュールは、Human3.6MデータセットにおいてHMRと比較してMPJPEを31.6%、PA-MPJPEを23.7%削減し、エンドツーエンドベースラインに対する顕著な改善を示した。
  • DSDモジュールはSTNと比較してMPJPEが14%、PA-MPJPEが27.9%優れているため、ポーズとシェイプの分離がより良いメッシュ回復に有効であることが確認された。
  • 単フレームDSDネットワークにSATNを追加すると、Human3.6MでMPJPEとPA-MPJPEがそれぞれ4.2%および7.3%改善され、3DPWではさらに大きな向上(PA-MPJPEで7.3%)を示した。
  • アブレーションスタディにより、スケルトン分離が不可欠であることが確認された:DSD+TCNに自己注意を追加しない場合、性能は低下するが、自己注意を追加することで性能が回復し、強力な長距離モデリングが可能になった。
  • フルモデル(DSD+SATN+対抗学習)は、バックボーンのみのベースラインと比較して、Human3.6MでMPJPEが26.6%、PA-MPJPEが27.5%改善された。
  • 定性的およびアブレーションスタディから、DSDは安定的で滑らかな予測を可能にし、スケルトンの置き換えに対しても適切に対応できることを示し、ポーズとシェイプ詳細の有効な分離が実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。