Skip to main content
QUICK REVIEW

[論文レビュー] Recognizing Scenes from Novel Viewpoints

Shengyi Qian, Alexander Kirillov|arXiv (Cornell University)|Dec 2, 2021
Advanced Vision and Imaging参考文献 65被引用数 4
ひとこと要約

本稿では、RGB画像とカメラポーズの少数から3次元シーン表現を学習するエンドツーエンドモデルであるViewSegを提案する。これにより、新しい視点からのセマンティックセグメンテーションと深度推定をゼロショットで実行可能であり、新視点のRGB画像にアクセスせずに可能となる。本手法は、2次元マルチビューのアノテーションとカメラポーズのみを用いて、セマンティクスとジオメトリを同時に最適化することで、HypersimおよびReplicaデータセットで最先端の性能を達成し、複雑で未観測の屋内シーンへの強力な一般化能力を示している。

ABSTRACT

Humans can perceive scenes in 3D from a handful of 2D views. For AI agents, the ability to recognize a scene from any viewpoint given only a few images enables them to efficiently interact with the scene and its objects. In this work, we attempt to endow machines with this ability. We propose a model which takes as input a few RGB images of a new scene and recognizes the scene from novel viewpoints by segmenting it into semantic categories. All this without access to the RGB images from those views. We pair 2D scene recognition with an implicit 3D representation and learn from multi-view 2D annotations of hundreds of scenes without any 3D supervision beyond camera poses. We experiment on challenging datasets and demonstrate our model's ability to jointly capture semantics and geometry of novel scenes with diverse layouts, object types and shapes.

研究の動機と目的

  • AIエージェントが、2次元画像とカメラポーズの少数のみを用いて、新規の視点からシーンを認識・理解できるようにすること。
  • カメラポーズ以外の明示的な3次元アノテーションがなく、セマンティクスと3次元ジオメトリを同時に学習すること。
  • 複雑な屋内環境における2次元シーン理解、3次元シーン再構築、新規視点合成のギャップを埋めること。
  • 実世界のシーンにおける多様なレイアウト、物体タイプ、形状に一般化可能なモデルを開発すること。

提案手法

  • ViewSegは、RGB画像、セマンティックセグメンテーション、カメラポーズを入力とするマルチビュー2次元監視設定を採用する。
  • NeRFスタイルのボリュームレンダリングに基づく3次元暗黙的ニューラル表現を用いて、シーンのジオメトリとセマンティクスを暗黙的に符号化する。
  • ターゲットカメラのポーズを用いて3次元表現をクエリすることで、新規のターゲットビューに対するセマンティックセグメンテーションと深度を予測する。
  • 2次元アノテーションとカメラポーズのみを用いて、セマンティックセグメンテーションと深度予測を統合したマルチタスク損失でエンドツーエンドに訓練する。
  • 特徴抽出に2次元バックボーン(例:DeepLabV3+)と、微分可能なビュー生成に3次元レンダリングヘッドを統合したアーキテクチャを採用する。
  • Replicaなどのターゲットデータセットでのファインチューニングにより性能が向上し、Hypersimでの事前学習からの強いゼロショット一般化能力を示している。

実験結果

リサーチクエスチョン

  • RQ12次元画像とカメラポーズのみを用いて、3次元の監視情報が一切ない状態で、新規視点からのセマンティックセグメンテーションを学習できるか?
  • RQ2セマンティクスとジオメトリを同時に最適化することで、分離的または逐次的なアプローチと比較して、3次元理解とセグメンテーション精度が向上するか?
  • RQ3多様なレイアウトと物体タイプを有する複雑で現実世界の屋内シーンに、どの程度一般化できるか?
  • RQ4訓練時に真値深度が利用できない状況下で、セマンティクスの監視が深度推定精度にどの程度寄与するか?

主な発見

  • ファインチューニング後、ReplicaテストセットでmIoUが30.2に達し、ベースライン手法を顕著に上回った。
  • Hypersimデータセットでは、mIoUが30.2、深度のRel(相対誤差)が0.130を達成し、挑戦的で多様なシーンにおいて優れた性能を示した。
  • セマンティクスの監視があると深度推定精度が向上し、セマンティクスが幾何的理解を強化することが示された。
  • Replicaでのファインチューニングにより、mIoUが13.2(ファインチューニングなし)から30.2に向上し、新しいシーンの統計に強い適応能力を示した。
  • オラクルモデル(Replicaで監視されたもの)はmIoUが56.2を達成しており、3次元監視が一切ない状態でもViewSegのゼロショット性能が競争力を持っていることが示された。
  • アブレーションスタディにより、セマンティクスの監視が深度推定を向上させることを確認した。セマンティクス損失を含めると、深度誤差(Rel)が40%低減(0.222 → 0.130)した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。