Skip to main content
QUICK REVIEW

[論文レビュー] Human-centric Indoor Scene Synthesis Using Stochastic Grammar

Siyuan Qi, Yixin Zhu|arXiv (Cornell University)|Aug 25, 2018
Advanced Vision and Imaging参考文献 48被引用数 12
ひとこと要約

本論文は、属性付き空間的And-Orグラフ(S-AOG)を用いた確率的文法モデルを用いて、物体、アフォーダンス、人的行動を統合的にモデル化する人間中心の3次元屋内シーン合成手法を提案する。マコフ確率場による文脈的関係とモンテカルロ・マコフ連鎖(MCMC)サンプリングを統合することで、完全なピクセル単位の真値を備えた多様で現実的なレイアウトを生成し、視覚的リアリズム、アフォーダンスの正確性、人的評価による機能性および自然さにおいて、最先端の手法を上回る性能を発揮する。

ABSTRACT

We present a human-centric method to sample and synthesize 3D room layouts and 2D images thereof, to obtain large-scale 2D/3D image data with perfect per-pixel ground truth. An attributed spatial And-Or graph (S-AOG) is proposed to represent indoor scenes. The S-AOG is a probabilistic grammar model, in which the terminal nodes are object entities. Human contexts as contextual relations are encoded by Markov Random Fields (MRF) on the terminal nodes. We learn the distributions from an indoor scene dataset and sample new layouts using Monte Carlo Markov Chain. Experiments demonstrate that our method can robustly sample a large variety of realistic room layouts based on three criteria: (i) visual realism comparing to a state-of-the-art room arrangement method, (ii) accuracy of the affordance maps with respect to groundtruth, and (ii) the functionality and naturalness of synthesized rooms evaluated by human subjects. The code is available at https://github.com/SiyuanQi/human-centric-scene-synthesis.

研究の動機と目的

  • 2D/3Dシーンデータセットにおける手動でのデータ収集の限界と、ノイズの多いセンサーベースのラベル付けの問題に対処すること。
  • AIモデルの学習に適した、完全なピクセル単位のアノテーションを備えた大規模かつ高品質な3次元屋内シーンを生成すること。
  • 統一された確率的枠組み内で、機能的グルーピング、支援関係、人-物体相互作用をモデル化すること。
  • アフォーダンス分布とアクティビティプランニングに基づき、物体と人的位置を同時にサンプリングできること。
  • 人間中心の空間的推論を反映した、現実的で機能的かつ自然な配置の屋内シーンを生成すること。

提案手法

  • 本手法は、屋内シーンを表現するための属性付き空間的And-Orグラフ(S-AOG)を用いる。端末ノードが物体を表し、内部/外部属性としてサイズ、位置、方向、人的相互作用が含まれる。
  • 機能的グルーピングや支持関係といった、物体間の文脈的関係は、端末ノード上にマコフ確率場(MRF)を用いてモデル化され、人間中心の制約が符号化される。
  • シーンの同時確率分布は、実際の屋内シーンデータセットから最尤推定法を用いて学習される。
  • 学習済みS-AOGに基づき、人的位置と物体配置を交互にサンプリングすることで、モンテカルロ・マコフ連鎖(MCMC)サンプリングを用いて新しいレイアウトを生成する。
  • 家具間の軌道をモデル化することで、動的な人的行動計画が可能となり、レイアウトの自然さが向上する。
  • 合成されたシーンはレンダリングされ、深度、表面法線、セマンティックセグメンテーションのピクセル単位の真値を備えた2次元画像が生成される。

実験結果

リサーチクエスチョン

  • RQ1確率的文法モデルは、人間中心の屋内シーンの構造的・文脈的複雑さを効果的に捉えることができるか?
  • RQ2提案されたS-AOGモデルは、従来の最適化ベース手法と比較して、多様で現実的かつ機能的に妥当な部屋レイアウトをどれほど効果的に生成できるか?
  • RQ3合成されたシーンは、実世界のデータと比較して、どの程度正確なアフォーダンス分布を保持しているか?
  • RQ4人間被験者は、提案手法が生成するシーンとベースライン手法のシーンを、機能性および自然さの観点でどのように評価するか?
  • RQ5本手法は複数の部屋カテゴリに一般化可能であり、構造的・意味的整合性を維持できるか?

主な発見

  • 提案手法は、上位ビューのセグメンテーションマップを用いたResNet-152分類器を用いて、合成シーンとSUNCGシーンを区別する際の正確度が76.18%に達し、最先端の最適化手法(Yuらの87.49%)を上回る視覚的リアリズムを示した。
  • 合成シーンからのアフォーダンスマップは、SUNCGと比較して、トータル・バリエーションとヘリンジャー距離が非常に低く(ほぼ0)、特に機能的部屋において強い分布類似性を示した。
  • 人間被験者の評価では、機能性および自然さの両面で、提案手法が平均4.3/5のスコアを獲得し、ランダムサンプリングやオブジェクト単位の関係モデリングを上回った。
  • 本手法は、10種類の部屋カテゴリにわたり、多様なレイアウトを生成可能であり、変動するオブジェクト数を有する複雑な機能的グルーピングも成功裏に再現した。
  • 1シーンのサンプリングに20〜40分(20,000回のMCMCイテレーション)を要し、640×480解像度の画像のレンダリングに12〜20分を要したが、標準PCでも実行可能であることが示され、計算コストは考慮されるが実用的である。
  • 本フレームワークは、完全なピクセル単位の真値を備えた大規模な2D/3次元データセットの生成を可能とし、ビジョン、ロボット工学、3次元コンテンツ作成の分野における下流タスクを支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。