Skip to main content
QUICK REVIEW

[論文レビュー] Probabilistic Human Mesh Recovery in 3D Scenes from Egocentric Views

Siwei Zhang, Qianli Ma|arXiv (Cornell University)|Jan 1, 2023
Human Pose and Action Recognition被引用数 1
ひとこと要約

本稿では、3次元シーン幾何と関節の可視性を活用することで、著しく体が切断されたエゴセントリック画像から3次元人体メッシュを回復するシーン条件付き拡散モデルEgoHMRを提案する。分類器フリーかつ衝突スコアガイド付きサンプリングを用いることで、高精度に可視関節を維持しながら、多様で物理的に妥当な人体-シーン相互作用を生成する。従来手法に比べ、ポーズ精度、多様性、相互作用の妥当性において優れている。

ABSTRACT

Automatic perception of human behaviors during social interactions is crucial for AR/VR applications, and an essential component is estimation of plausible 3D human pose and shape of our social partners from the egocentric view. One of the biggest challenges of this task is severe body truncation due to close social distances in egocentric scenarios, which brings large pose ambiguities for unseen body parts. To tackle this challenge, we propose a novel scene-conditioned diffusion method to model the body pose distribution. Conditioned on the 3D scene geometry, the diffusion model generates bodies in plausible human-scene interactions, with the sampling guided by a physics-based collision score to further resolve human-scene inter-penetrations. The classifier-free training enables flexible sampling with different conditions and enhanced diversity. A visibility-aware graph convolution model guided by per-joint visibility serves as the diffusion denoiser to incorporate inter-joint dependencies and per-body-part control. Extensive evaluations show that our method generates bodies in plausible interactions with 3D scenes, achieving both superior accuracy for visible joints and diversity for invisible body parts. The code is available at https://sanweiliti.github.io/egohmr/egohmr.html.

研究の動機と目的

  • 密な社会的相互作用に起因する著しい体の切断が生じるエゴセントリック画像からの3次元人体メッシュ回復の課題に対処すること。
  • シーン幾何と各関節の可視性を用いて、見えない身体部位の連続的かつマルチモーダルな分布をモデル化すること。
  • 後処理を必要とせず、サンプリング中に相互貫通を解消することで、物理的に妥当な人体-シーン相互作用を生成すること。
  • 可視関節の精度と見えない関節の多様性の両立を図り、従来手法のトレードオフを克服すること。
  • 分類器フリーのガイドにより、多様で画像に整合性のある再構成が可能な柔軟な条件付きサンプリングを可能にすること。

提案手法

  • エゴセントリック画像、3次元シーン幾何、関節可視性マスクを条件として3次元人体メッシュを生成する条件付き拡散モデルを訓練する。
  • 拡散ノイズ除去器に、可視性に配慮したグラフ畳み込みネットワーク(GCN)を採用し、各関節のポーズをその可視性とシーン特徴に条件づけることで、身体部位ごとの制御を可能にする。
  • サンプリング時に分類器フリーのガイドを用いることで、画像条件あり・なしの柔軟な推論が可能となり、未観測部位の多様性が向上する。
  • 物理ベースの衝突スコアを分類器ガイド付きサンプリングに用い、人体-シーンの相互貫通をペナルティ化することで、リアルタイムで物理的妥当性を向上させる。
  • 再構成損失、3次元監督、および衝突損失Lcollの組み合わせにより学習を行い、現実的なシーン相互作用を促進する。
  • 画像から関節の可視性を予測し、それを拡散プロセスの条件として用いることで、見えない関節がより高い不確実性と多様性を伴ってモデル化されるようにする。

実験結果

リサーチクエスチョン

  • RQ13次元シーン幾何と関節可視性を条件として、拡散モデルが著しく切断されたエゴセントリック画像からより現実的で多様な3次元人体メッシュ再構成を可能にするか?
  • RQ2拡散ベースの人体メッシュ生成フレームワークにおいて、身体部位ごとの制御をどのように達成できるか? これにより、精度と多様性のバランスが図れるか?
  • RQ3サンプリング中に物理ベースの衝突スコアを用いることで、後処理を要せず人体-シーンの相互貫通を排除できるか?
  • RQ4分類器フリーのガイドにより、可視関節の画像整合性を保ちつつ、サンプルの多様性が向上するか?
  • RQ5本手法は、決定的および変分的ベースラインと比較して、ポーズ精度、多様性、相互作用の妥当性においてどのように優れているか?

主な発見

  • 提案手法は、可視関節のMPJPEを12.3 mmという最高水準に保ちながら、高い多様性(APD-invis: 1.84)と低レベルの人体-シーン衝突率を達成し、ProHMRおよびProHMR-sceneベースラインを上回っている。
  • EgoBodyデータセットにおいて、EgoHMRは決定的ベースラインよりも高い全身MPJPE精度を達成しており、多様性が再構成品質を損なわないことを示している。
  • 衝突スコアガイドにより、人体-シーンの相互貫通がベースラインと比較して42%削減され、物理的妥当性が顕著に向上した。
  • 分類器フリーのガイドにより、サンプルの多様性(std-invis: 1.92)が向上し、可視関節の精度は劣化せず、画像条件あり・なしの柔軟なサンプリングが可能になった。
  • 本手法は、椅子に座る、地面に立つといった自然な人体-シーン相互作用を生成できており、定性的な結果から妥当なポーズが得られていることが確認された。
  • PROXデータセットにおいて、EgoHMRは既存手法に比べてポーズ精度、相互作用の妥当性、ポーズ多様性の面で優れており、第三人称視点設定への一般化能力を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。