Skip to main content
QUICK REVIEW

[論文レビュー] OpenScene: 3D Scene Understanding with Open Vocabularies

Songyou Peng, Kyle Genova|arXiv (Cornell University)|Nov 28, 2022
Advanced Image and Video Retrieval Techniques被引用数 10
ひとこと要約

OpenScene は、CLIP の視覚言語特徴空間において 3D ポイントクラウド特徴量とテキストおよび画像ピクセルを同時に埋め込むことで、ラベルなし 3D データに依存せずにゼロショットでタスクに依存しない 3D レンダリング理解を実現する。これにより、『柔らかい』表面、『機能』、『部屋の種別』といったオープンボキャブラリーのクエリ—例えば、ラベルなし 3D データを用いずに、状態を凌駕するゼロショット 3D 領域分類を達成し、テキストベースの 3D オブジェクト検索 やシーン探索といった新しい応用が可能になる。

ABSTRACT

Traditional 3D scene understanding approaches rely on labeled 3D datasets to train a model for a single task with supervision. We propose OpenScene, an alternative approach where a model predicts dense features for 3D scene points that are co-embedded with text and image pixels in CLIP feature space. This zero-shot approach enables task-agnostic training and open-vocabulary queries. For example, to perform SOTA zero-shot 3D semantic segmentation it first infers CLIP features for every 3D point and later classifies them based on similarities to embeddings of arbitrary class labels. More interestingly, it enables a suite of open-vocabulary scene understanding applications that have never been done before. For example, it allows a user to enter an arbitrary text query and then see a heat map indicating which parts of a scene match. Our approach is effective at identifying objects, materials, affordances, activities, and room types in complex 3D scenes, all using a single model trained without any labeled 3D data.

研究の動機と目的

  • ラベルなし 3D データセットに依存せずに、オープンボキャブラリーの 3D レンダリング理解を可能にすること。
  • ユーザーが任意のテキストまたは画像プロンプトを用いて、意味、素材、機能、アフォーダンスをクエリ可能にすること。
  • 単一のゼロショットフレームワークで多様なシーン理解タスクをサポートする統合モデルを開発すること。
  • 固定された閉じたカテゴリに制限される従来の教師あり 3D 分割モデルの限界を克服すること。
  • 事前学習済み CLIP 特徴量を活用して、強固で汎用性の高い 3D レンダリング理解が可能であることを実証すること。

提案手法

  • 2D-3D ハイブリッドネットワークアーキテクチャを用いて、CLIP の共有特徴空間において 3D ポイント特徴量と画像ピクセル、テキストを同時に埋め込む。
  • 3D ポイントを姿勢付き RGB イメージにバックプロジェクションし、マルチビューのピクセル特徴量を集約することで、3D から 2D への対応関係を確立する。
  • 対照的損失を用いて、集約された 2D ピクセル特徴量と整合するように、スパース 3D コンボリューションネットワークを訓練し、3D ポイント特徴量を予測する。
  • 最終的な 3D ポイント特徴量は、統合された 2D 特徴量と 3D ネットワークの出力のアンサンブルであり、幾何的および外観的手がかりを統合する。
  • 特徴抽出後、3D ポイント特徴量とテキストまたは画像クエリの CLIP 特徴量とのコサイン類似度を計算することで、オープンボキャブラリークエリを実行する。
  • 本アプローチは、再トレーニングなしに、'柔らかい'、'熱い'、'遊べる' などの属性を含む任意のテキストまたは画像クエリに対してゼロショット推論をサポートする。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み CLIP 特徴量のみを用いて、ラベルなし 3D データで 3D レンダリング理解が達成可能か?
  • RQ21 つのモデルが、素材の性質、アフォーダンス、機能といった多様なオープンボキャブラリークエリをサポートできるか?
  • RQ3多数のクラスラベルを持つタスクにおいて、このゼロショットアプローチのパフォーマンスは、完全に教師ありモデルと比較してどうか?
  • RQ4再トレーニングなしに、異なるラベルセットを持つ新しいデータセットに対しても汎用性を示せるか?
  • RQ5テキストベースの 3D オブジェクト検索 やインタラクティブなシーン探索といった新しい応用が可能か?

主な発見

  • OpenScene は、標準ベンチマークにおいて、40、80、160 クラスのタスクで、完全に教師ありモデルを上回る、最先端のゼロショット 3D 領域分類パフォーマンスを達成した。
  • 『柔らかい』、『キッチン』、『作業』といった任意のテキストクエリに対して、正確なマッチング領域のヒートマップを生成するなど、3D ポイントの検索に成功した。
  • 10 個のレアオブジェクトカテゴリにおいて、最初の誤りが発生するまでの段階で、正解インスタンスの 8 個をすべて検出(100% 精度)、強力なオープンボキャブラリー検索能力を示した。
  • 正解ラベルに正しくラベル付けされていなかった 26 個のインスタンス(うち 13 個が電話)を同定したため、手動ラベリングよりレアまたは曖昧なインスタンスをよりよく検出できる可能性を示した。
  • 画像ベースの 3D オブジェクト検出が成功裏に実装され、プールテーブル やダイニングテーブルといったオブジェクトが画像クエリに基づき正しく同定された。
  • 従来の教師あり手法では不可能な、物理的性質(例:'熱い'、'快適')、素材、潜在的行動(例:'遊べる')といったクエリを可能にし、新しい応用を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。