[論文レビュー] Capturing and Inferring Dense Full-Body Human-Scene Contact
本論文は、高精細な3Dシーンおよびボディスキャンを伴う4Kマルチビュー動画を用いて、ボディの頂点レベルでの密な人間-シーン接触を捉えた新しいデータセットRICHを紹介する。また、局所的でない画像間の関係をモデル化することで、隠蔽を克服し、1枚のRGB画像から3次元全身接触を推定するトランスフォーマー基盤のネットワークBSTROを提案。接触予測において70.8%のF1スコアを達成し、最先端の性能を実現した。
Inferring human-scene contact (HSC) is the first step toward understanding how humans interact with their surroundings. While detecting 2D human-object interaction (HOI) and reconstructing 3D human pose and shape (HPS) have enjoyed significant progress, reasoning about 3D human-scene contact from a single image is still challenging. Existing HSC detection methods consider only a few types of predefined contact, often reduce body and scene to a small number of primitives, and even overlook image evidence. To predict human-scene contact from a single image, we address the limitations above from both data and algorithmic perspectives. We capture a new dataset called RICH for "Real scenes, Interaction, Contact and Humans." RICH contains multiview outdoor/indoor video sequences at 4K resolution, ground-truth 3D human bodies captured using markerless motion capture, 3D body scans, and high resolution 3D scene scans. A key feature of RICH is that it also contains accurate vertex-level contact labels on the body. Using RICH, we train a network that predicts dense body-scene contacts from a single RGB image. Our key insight is that regions in contact are always occluded so the network needs the ability to explore the whole image for evidence. We use a transformer to learn such non-local relationships and propose a new Body-Scene contact TRansfOrmer (BSTRO). Very few methods explore 3D contact; those that do focus on the feet only, detect foot contact as a post-processing step, or infer contact from body pose without looking at the scene. To our knowledge, BSTRO is the first method to directly estimate 3D body-scene contact from a single image. We demonstrate that BSTRO significantly outperforms the prior art. The code and dataset are available at https://rich.is.tue.mpg.de.
研究の動機と目的
- トレーニングおよびベンチマークのための、高品質で頂点レベルの密な人間-シーン接触アノテーションを備えたデータセットの不足に対処すること。
- 全身の接触を1枚のRGB画像から推定する手法を開発し、画像全体のコンテキストを活用することで、隠蔽を克服すること。
- 現在の手法がほとんど無視しているシーン接触情報を統合することで、3次元ボディポーズおよびボディシェイプ推定を改善すること。
- シーン接触が単眼3次元ボディポーズ推定の難易度を顕著に高めることを示すこと、特に隠蔽状況下で顕著である。
- 将来的な共同ボディ-シェイプ-シーン接触推定および動的相互作用モデリングの基盤を提供すること。
提案手法
- RICHデータセットは、マルチビュー4Kカメラ、マーカーレスモーションキャプチャ、レーザースキャンによる3次元シーンを用いて収集され、頂点レベルの接触ラベル付けを可能にしている。
- 最小限の衣装での被験者に対する高解像度3次元ボディスキャンを用い、SMPL-Xボディモデルにフィットさせることで、真値のボディシェイプおよびポーズを提供している。
- 本手法では、画像全体にわたる長距離かつ非局所的な関係をモデル化するための、新規のボディ-シーン接触トランスフォーマー(BSTRO)を提案している。
- BSTROはRICH上でエンドツーエンドに訓練され、1枚のRGB画像からSMPL-Xボディメッシュの密な3次元接触を回帰する。隠蔽があっても画像の証拠を活用している。
- ネットワークアーキテクチャは、画像全体にわたるシーンコンテキストを活用し、隠蔽領域であっても接触を推論できるように設計されている。
- 評価には、正確度、再現度、F1、幾何誤差の指標を用い、シーン接触がポーズ推定に与える影響を評価するアブレーションスタディも実施している。
実験結果
リサーチクエスチョン
- RQ1グローバルな画像コンテキストを活用することで、隠蔽を克服し、1枚の画像から密な頂点レベルの人間-シーン接触を正確に予測できるか?
- RQ2意味のあるシーン接触の存在が、単眼3次元ボディポーズおよびシェイプ推定の性能に与える影響はいかほどか?
- RQ3ボディポーズやシーンジオメトリだけではなく、画像の証拠を用いることで、接触予測の正確性はどの程度向上するか?
- RQ4トランスフォーマー基盤のアーキテクチャは、複雑で隠蔽の多いシーンにおいて、非局所的な関係を効果的にモデル化できるか?
- RQ5接触検出およびボディポーズ推定の正確性において、本手法は先行研究と比較してどの程度優れているか?
主な発見
- BSTROはRICHテストセットにおいて70.8%の接触予測F1スコアを達成し、Zouら[105](35.9%)およびPOSA[28](真値ボディを前提に46.4%)といった先行手法を大きく上回った。
- 意味のあるシーン接触を伴う画像では、MPJPE(214.0mm TR-MPJPE)およびV2V(172.81mm TR-V2V)誤差が、接触なしのものよりも高くなった。これは、接触がポーズ推定の難易度を高めることを示している。
- 動くカメラの状況では、接触が存在する場合のPA-MPJPEおよびPA-V2V誤差はそれぞれ84.15mmおよび83.16mmであったのに対し、接触なしの場合は63.67mmおよび64.37mmであった。接触がもたらす課題の深刻さが裏付けられた。
- BSTROの性能はサブセットにわたりてきぱくである。訓練時、シーンおよび被験者が観測された場合に76.9%のF1を達成し、属性が一切観測されない場合でも72.1%のF1を達成しており、優れた一般化性能を示している。
- アブレーションスタディにより、シーン接触が単眼3次元ボディポーズ推定における主な誤差要因であることが確認された。これは、複雑な隠蔽と曖昧な手がかりを引き起こすからである。
- RICHデータセットは、高解像度画像、3次元シーンスキャン、頂点レベルの接触ラベルを備えることで、単眼3次元人間-シーン接触推定のための最初のベンチマークを可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。