Skip to main content
QUICK REVIEW

[論文レビュー] Putting Humans in a Scene: Learning Affordance in 3D Indoor Environments

Xueting Li, Sifei Liu|arXiv (Cornell University)|Mar 13, 2019
Human Pose and Action Recognition参考文献 31被引用数 4
ひとこと要約

本稿では、室内シーンにおける3次元人間のアフォーダンス予測のための2段階フレームワークを提案する。まず、テレビドラマから得た2次元ポーズ分布とボクセル化されたシーンからの3次元幾何制約を統合する完全自動の3次元ポーズ合成器を用い、次に、1枚のRGB/RGB-D画像から意味的に妥当で物理的に可能である3次元人間ポーズを予測する生成モデルを構築する。本手法は最先端の性能を達成し、先行研究比で幾何スコアが27.6%向上した。

ABSTRACT

Affordance modeling plays an important role in visual understanding. In this paper, we aim to predict affordances of 3D indoor scenes, specifically what human poses are afforded by a given indoor environment, such as sitting on a chair or standing on the floor. In order to predict valid affordances and learn possible 3D human poses in indoor scenes, we need to understand the semantic and geometric structure of a scene as well as its potential interactions with a human. To learn such a model, a large-scale dataset of 3D indoor affordances is required. In this work, we build a fully automatic 3D pose synthesizer that fuses semantic knowledge from a large number of 2D poses extracted from TV shows as well as 3D geometric knowledge from voxel representations of indoor scenes. With the data created by the synthesizer, we introduce a 3D pose generative model to predict semantically plausible and physically feasible human poses within a given scene (provided as a single RGB, RGB-D, or depth image). We demonstrate that our human affordance prediction method consistently outperforms existing state-of-the-art methods.

研究の動機と目的

  • アフォーダンス学習のための、大規模かつ物理的に妥当な3次元人間ポーズアノテーションの不足に対処すること。
  • 2次元ベースの手法が人間-シーン相互作用における3次元幾何的妥当性を満たさないという限界を克服すること。
  • 2次元ポーズからの意味的知識と3次元ボクセル化シーンからの幾何制約を活用する完全自動の3次元ポーズ合成器を開発すること。
  • 1枚のシーン画像を条件として、妥当な3次元ポーズの位置と外観を同時に予測するエンドツーエンドの生成モデルを訓練すること。
  • 合成された物理的に妥当な人間ポーズを用いて、SUNCGデータセットにおける3次元アフォーダンス予測の新しいベンチマークを確立すること。

提案手法

  • カメラパラメータと3次元幾何を用いて、Sitcomデータセットの2次元人間ポーズをSUNCGのボクセル化されたシーンに移出することで、完全自動の3次元ポーズ合成器を開発した。
  • 衝突検出とサポート確認を用いて合成された3次元ポーズを精錬し、交差を排除し、適切な身体支持を確保することで物理的妥当性を確保した。
  • 2ストリーム生成モデルを提案し、'どこ'モジュールが仙骨関節の位置を予測し、'何'モジュールが位置を条件として全3次元ポーズの外観を生成する。
  • 入力が1枚のRGB画像であっても、3次元物理的一致性を強制する微分可能な幾何制約付きディスクラミネーターを用いた。
  • ポーズ分布を位置と外観のコンポonentに分解し、仙骨位置をモジュール間の微分可能なブリッジとして用いた。
  • リアルさと物理的妥当性を向上させるために、知覚的損失、幾何損失、 adversarial 損失の組み合わせを用いてエンドツーエンドで訓練した。

実験結果

リサーチクエスチョン

  • RQ12次元ポーズ分布と3次元シーン幾何を統合することで、完全自動の3次元ポーズ合成器が大規模かつ物理的に妥当な人間ポーズを生成できるか?
  • RQ21枚のRGBまたはRGB-D画像から、意味的に妥当で幾何的に整合性のある3次元人間ポーズを生成モデルが予測できるか?
  • RQ33次元幾何的推論を組み込むことで、2次元のみのベースラインと比較して予測された人間ポーズの物理的妥当性がどの程度向上するか?
  • RQ4モデルは1枚の2次元画像から深度と3次元構造を想起し、さまざまな深度に適したポーズを生成できるか?
  • RQ5幾何制約付きの監視が、生成された3次元人間ポーズのリアルさと正確性に与える影響は何か?

主な発見

  • RGB-D入力で、'何'モジュールの幾何スコアが78.43%に達し、ベースライン手法の56.29%と比較して27.6%の向上を達成した。
  • RGB入力のみの場合でも、ベースラインより6.66%高い幾何スコアを達成しており、2次元画像からの強力な3次元幾何の想起能力を示した。
  • 深度をd-0.5からd+0.5に補間した際、スケールや行動(立っているから座っているへ)の変化を示すポーズが正しく生成されたことから、深度に依存したポーズ生成が成功した。
  • ユーザースタディおよび訓練済みの真正性分類器の結果から、生成されたポーズは先行手法よりもより現実的かつ物理的に妥当であることが確認された。
  • 失敗事例から、主に意味的不一致(例:キャビネットに座っている)や幾何的違反(例:衝突)に起因するエラーが生じており、2次元入力からの3次元推論における課題が示された。
  • 幾何制約付きディスクラミネーターは物理的妥当性を顕著に向上させ、RGB入力でこれを使用しない場合に比べて幾何スコアの低下を4.59%削減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。