Skip to main content
QUICK REVIEW

[論文レビュー] NIKI: Neural Inverse Kinematics with Invertible Neural Networks for 3D Human Pose and Shape Estimation

Jiefeng Li, Siyuan Bian|arXiv (Cornell University)|May 15, 2023
Human Pose and Action Recognition被引用数 4
ひとこと要約

NIKIは、オcludionに強い性能とピクセルに整合した3次元人体ポーズおよび形状の正確性を両立させるために、逆可逆ニューラルネットワークに基づく逆運動学フレームワークを提案する。一対の誤差埋め込みとゼロ誤差境界条件を用いることで、ポーズ誤差と妥当な人体ポーズの多様体を分離し、標準的および重度のオクルージョンを伴うベンチマークで最先端の性能を達成し、精度と耐障害性の両面でSOTAを実現する。

ABSTRACT

With the progress of 3D human pose and shape estimation, state-of-the-art methods can either be robust to occlusions or obtain pixel-aligned accuracy in non-occlusion cases. However, they cannot obtain robustness and mesh-image alignment at the same time. In this work, we present NIKI (Neural Inverse Kinematics with Invertible Neural Network), which models bi-directional errors to improve the robustness to occlusions and obtain pixel-aligned accuracy. NIKI can learn from both the forward and inverse processes with invertible networks. In the inverse process, the model separates the error from the plausible 3D pose manifold for a robust 3D human pose estimation. In the forward process, we enforce the zero-error boundary conditions to improve the sensitivity to reliable joint positions for better mesh-image alignment. Furthermore, NIKI emulates the analytical inverse kinematics algorithms with the twist-and-swing decomposition for better interpretability. Experiments on standard and occlusion-specific benchmarks demonstrate the effectiveness of NIKI, where we exhibit robust and well-aligned results simultaneously. Code is available at https://github.com/Jeff-sjtu/NIKI

研究の動機と目的

  • 3次元人体ポーズおよび形状推定におけるメッシュ-画像整合性とオクルージョンへの耐障害性のトレードオフを解消すること。
  • 従来のピクセルに整合する手法はオクルージョン下で失敗するのに対し、直接回帰手法は整合性の精度に欠けるという限界を克服すること。
  • 逆可逆ニューラルネットワークを用いて前向き運動学と逆運動学の両方をモデル化する双方向学習フレームワークを開発すること。
  • ねじりとスイング分解を用いて解析的逆運動学を模倣することで解釈可能性を向上させること。
  • 非オクルージョンおよび極度のオクルージョン下の両方で最先端の性能を達成すること。

提案手法

  • 関節位置と3次元関節回転および誤差埋め込みの結合空間との間で一対一の写像を学習する逆可逆ニューラルネットワーク(INN)を採用する。
  • 逆プロセスにおいて、誤差を妥当な人体ポーズの多様体から分離し、誤差の周辺分布を監視することで、ノイズやオクルージョンによる関節検出の誤りに対する耐障害性を向上させる。
  • 前向きプロセスにおいて、ゼロ誤差境界条件を強制することで、予測された回転が信頼性の高い関節位置を正確に説明できることを保証し、メッシュ-画像整合性を向上させる。
  • 2段階の逆可逆ネットワークを用いて全身の回転をねじり成分とスイング成分に分解することで、解釈可能性とモデリングの忠実性を向上させる。
  • 前向きと逆向きの両方向でINNを同時に学習させ、前向き運動学の決定的性質を活用して学習の安定性を高める。
  • 推論時にヒートマップの条件付けを統合することで、キーポointの監視をさらに精緻化するが、深刻なオクルージョン下では性能がわずかに低下する。

実験結果

リサーチクエスチョン

  • RQ1統合されたフレームワークは、3次元人体ポーズおよび形状推定において、高いピクセルに整合した正確性とオクルージョンへの耐障害性を同時に達成できるか?
  • RQ2逆可逆ニューラルネットワークを活用することで、逆運動学における誤差の双方向伝搬をどのようにモデル化し、耐障害性を向上させられるか?
  • RQ3前向きプロセスでゼロ誤差境界条件を強制することで、耐障害性を損なうことなくメッシュ-画像整合性はどの程度向上するか?
  • RQ4ねじりとスイング分解を用いることで、エンドツーエンドの回転予測に比べ、神経的逆運動学における解釈可能性と性能は向上するか?
  • RQ5提案手法は、特に極端な状況下でも、さまざまなオクルージョンレベルでどの程度の性能を示すか?

主な発見

  • 標準的な3DPWベンチマークでは、71.3 mmのMPJPEおよび40.6 mmのPA-MPJPEを達成し、先行研究を上回る性能を示した。
  • 極度のオクルージョンを伴う挑戦的な3DPW-XOCCデータセットでは、110.7 mmのMPJPEおよび60.5 mmのPA-MPJPEを達成し、強い耐障害性を示した。
  • 3DPW-XOCCにおいてメッシュ衝突率を2.6%から1.0%に低減させ、より妥当で現実的な再構築を示した。
  • 中程度のオクルージョン(20–30%)下では、PAREに比べ13.3 mmのMPJPE改善を達成し、現実的なオクルージョン状況での有効性を示した。
  • 低オクルージョン(0–10%)下では6.5 mmのMPJPE改善を示し、高オクルージョン(70–80%)下でも10.2 mmの改善を維持した。これは、オクルージョン強度にかかわらず一貫した性能を発揮していることを示している。
  • ヒートマップの条件付けを追加しても、3DPW-XOCCでは性能がわずかに低下した。これは、深刻なオクルージョン下ではヒートマップの監視が信頼性が低い可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。