Skip to main content
QUICK REVIEW

[論文レビュー] Visual Graphs from Motion (VGfM): Scene understanding with object geometry reasoning

Stuart James, Alessio Del Bue|arXiv (Cornell University)|Jul 16, 2018
Multimodal Machine Learning Applications参考文献 29被引用数 3
ひとこと要約

本稿では、動画シーケンスからのマルチビュー幾何学を活用して3次元オブジェクト関係を推定し、正確なシーングラフを構築する、Visual Graphs from Motion (VGfM) を提案する。RNNベースのフレームワークにより幾何学的特徴と視覚的特徴を統合することで、複雑な空間配置におけるシーン理解が向上し、新たに作成されたマルチビュー3次元シーングラフデータセットにおいて最先端の結果を達成した。

ABSTRACT

Recent approaches on visual scene understanding attempt to build a scene graph -- a computational representation of objects and their pairwise relationships. Such rich semantic representation is very appealing, yet difficult to obtain from a single image, especially when considering complex spatial arrangements in the scene. Differently, an image sequence conveys useful information using the multi-view geometric relations arising from camera motion. Indeed, in such cases, object relationships are naturally related to the 3D scene structure. To this end, this paper proposes a system that first computes the geometrical location of objects in a generic scene and then efficiently constructs scene graphs from video by embedding such geometrical reasoning. Such compelling representation is obtained using a new model where geometric and visual features are merged using an RNN framework. We report results on a dataset we created for the task of 3D scene graph generation in multiple views.

研究の動機と目的

  • 単一画像からの正確で意味的に豊かなシーングラフの構築、特に複雑な空間配置においての課題に取り組むこと。
  • 動画シーケンスからのマルチビュー幾何的関係を活用して3次元シーン構造とオブジェクト関係を推定すること。
  • 幾何的推論と視覚的特徴を統合する統一フレームワークを構築し、シーン理解を向上させること。
  • 今後の研究を支援するため、マルチビュー3次元シーングラフ生成のための新しいベンチマークデータセットを構築・公開すること。

提案手法

  • システムはまず、動画入力からのマルチビュー幾何学を用いて、シーン内のオブジェクトの3次元幾何的位置を推定する。
  • フレーム間で視覚的特徴と幾何的制約を共同でモデル化するために、RNNベースのアーキテクチャを採用する。
  • カメラの運動と3次元再構成から得られる幾何的関係を用いて、空間的推論が可能になる。
  • フレームから視覚的特徴を抽出し、幾何的埋め込みと統合することで、シーングラフの構築が豊かになる。
  • モデルは3次元空間的構造に基づいたオブジェクトの識別子、属性、および対ごとの関係を予測することで、シーングラフを生成する。
  • 複数のビューにおける3次元シーングラフ生成の評価を目的として、新しいデータセットを収集・アノテートした。

実験結果

リサーチクエスチョン

  • RQ1単一画像手法と比較して、マルチビュー動画シーケンスは、シーングラフ構築の正確性を向上させるか?
  • RQ2カメラの運動からの幾何的推論は、オブジェクト間の空間的関係のモデリングにどの程度効果的か?
  • RQ3RNNを用いた幾何的特徴と視覚的特徴の統合は、複雑なシーンにおけるシーングラフ品質をどの程度向上させるか?
  • RQ4提案手法は、多様な3次元シーン構成やオブジェクト配置にどの程度一般化可能か?

主な発見

  • 提案されたVGfMフレームワークは、新たに作成されたマルチビュー3次元シーングラフデータセットにおいて最先端のパフォーマンスを達成した。
  • RNNを用いた幾何的特徴と視覚的特徴の統合は、視覚的特徴のみを用いた場合よりも、より正確で一貫性のあるシーングラフ予測を可能にした。
  • マルチビュー幾何学の活用は、特に隠蔽されたり位置が曖昧なオブジェクトの関係モデリングにおいて顕著に向上効果を示した。
  • 密なオブジェクト配置を有する複雑なシーンにおいても、ベースラインの単一ビュー手法を上回る頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。