Skip to main content
QUICK REVIEW

[論文レビュー] Putting People in their Place: Monocular Regression of 3D People in Depth

Yu Sun, Wu Liu|arXiv (Cornell University)|Dec 15, 2021
Human Pose and Action Recognition被引用数 5
ひとこと要約

本稿では、単一のRGB画像から3次元人体ポーズ、形状、相対的深度を直接回帰する1段階でエンドツーエンド微分可能な手法BEVを提案する。モノクロナル深度のあいまいさを解消するために、暗黙的な鳥瞰図(BEV)表現を導入した。新規に提案された3次元ヒートマップと3次元オフセットマップを用い、2次元画像上の位置と3次元深度を統合的に推論することで、弱教師付きの深度および年齢損失を用いた年齢に配慮した3次元ボディモデリングを統合し、相対的深度推論、子供の形状推定、オクルージョンに強い性能を達成した。これは、新たに導入されたRelative Human(RH)およびAGORAデータセットにおいて、先行手法を上回る最先端の性能を示した。

ABSTRACT

Given an image with multiple people, our goal is to directly regress the pose and shape of all the people as well as their relative depth. Inferring the depth of a person in an image, however, is fundamentally ambiguous without knowing their height. This is particularly problematic when the scene contains people of very different sizes, e.g. from infants to adults. To solve this, we need several things. First, we develop a novel method to infer the poses and depth of multiple people in a single image. While previous work that estimates multiple people does so by reasoning in the image plane, our method, called BEV, adds an additional imaginary Bird's-Eye-View representation to explicitly reason about depth. BEV reasons simultaneously about body centers in the image and in depth and, by combing these, estimates 3D body position. Unlike prior work, BEV is a single-shot method that is end-to-end differentiable. Second, height varies with age, making it impossible to resolve depth without also estimating the age of people in the image. To do so, we exploit a 3D body model space that lets BEV infer shapes from infants to adults. Third, to train BEV, we need a new dataset. Specifically, we create a "Relative Human" (RH) dataset that includes age labels and relative depth relationships between the people in the images. Extensive experiments on RH and AGORA demonstrate the effectiveness of the model and training scheme. BEV outperforms existing methods on depth reasoning, child shape estimation, and robustness to occlusion. The code and dataset are released for research purposes.

研究の動機と目的

  • さまざまな身長の人物における単眼深度推定の根本的なあいまいさを解消すること。特に、年齢が異なる多様な人物が混在する混雑したシーンにおいて。
  • 単一のRGB画像から複数人の3次元ポーズ、形状、相対的深度を統合的に回帰する統一的で1段階の手法を開発すること。
  • 従来の2次元のみの表現の限界を克服するため、明示的な3次元推論を可能にする暗黙的な鳥瞰図(BEV)表現を導入すること。
  • メトリック深度の教師信号なしに、相対的深度関係と年齢ラベルを備えた、実世界のデータセットであるRelative Human(RH)を新規に構築し、深度推論の学習と評価を可能にすること。
  • 年齢に配慮した3次元ボディモデリングと弱教師付き損失を統合することで、深刻なオクルージョンや多様なボディサイズに強い推定を実現すること。

提案手法

  • 3次元ボディの中心位置を深度方向に暗黙的にモデル化できる新しい鳥瞰図(BEV)表現を導入し、ネットワークが2次元画像上の位置と併せて深度を推論できるようにした。
  • フロントビューの2次元ヒートマップとBEVヒートマップを統合して3次元ヒートマップを構築し、複数人の同時2次元および3次元位置特定を可能にした。
  • 粗い検出の微調整と3次元トランスレーション予測の細分化を向上させるために、3次元オフセットマップ(OM)を採用した。
  • 2次元ボディ中心のヒートマップを注釈信号として用いるフロントビュー条件(FVC)モジュールを導入し、BEV推論中に深度推定を強化した。
  • 順序深度損失と比較して、妥当なペナルティを維持し、深度精度を向上させるために、区分的深度層損失($\boldsymbol{\mathcal{L}_{depth}}$)を適用した。
  • メトリック深度のアノテーションなしに、深度と年齢分類の損失($\boldsymbol{\mathcal{L}_{depth}}$, $\boldsymbol{\mathcal{L}_{age}}$)を用いた弱教師付き学習(WST)を実装し、深度と年齢を教師なしで学習可能にした。

実験結果

リサーチクエスチョン

  • RQ1メトリック深度の教師信号なしに、単一のRGB画像から3次元人体ポーズ、形状、相対的深度を1回の推論で効果的に回帰できるか。
  • RQ2混雑し、オクルージョンが生じるシーンにおいて、2次元のみの表現と比較して、暗黙的な鳥瞰図(BEV)表現を導入することで、深度推論がどの程度向上するか。
  • RQ3年齢に配慮した3次元ボディモデリングと弱教師付き損失を用いることで、単眼3次元人体推定における深度/身長のあいまいさはどの程度軽減できるか。
  • RQ4既存の順序深度損失と比較して、提案された区分的深度損失は、3次元トランスレーション精度をどの程度向上させるか。
  • RQ5相対的深度と年齢ラベルを用いた弱教師付き学習スキームは、実世界の屋外データセットで最先端の性能を達成できるか。

主な発見

  • BEVは、Relative Human(RH)データセットでPCDR 0.2が68.27に達し、CRMHと比較して深度推論精度が4.1%向上した。
  • AGORAデータセットでは、WSTを用いないBEVが、NMVE 108.3およびNMJE 113.2というすべての検出指標でROMPやSOTA手法を顕著に上回った。
  • アブレーションスタディにより、3次元オフセットマップ(OM)とフロントビュー条件(FVC)が3次元位置特定の細分化を向上させ、トランスレーション誤差を最大12.7%まで低減することが確認された。
  • 区分的深度損失($\boldsymbol{\mathcal{L}_{depth}}$)は、順序深度損失と比較して3次元トランスレーション誤差を15%低減し、特に深度誤差(0.509から0.423に)の改善が顕著であった。
  • 両方の損失($\boldsymbol{\mathcal{L}_{depth}}$ と $\boldsymbol{\mathcal{L}_{age}}$)を用いた弱教師付き学習(WST)が、特に若年層において最良の深度推論性能を達成した。
  • BEVはオクルージョンや多様なボディサイズに対しても強固であり、複雑なシーンにおいて重なった人物を異なる深度に正確に区別できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。