Skip to main content
QUICK REVIEW

[論文レビュー] OpenIns3D: Snap and Lookup for 3D Open-vocabulary Instance Segmentation

Zhening Huang, Xiaoyang Wu|arXiv (Cornell University)|Sep 1, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

OpenIns3D は、2D イメージ入力を必要とせず、'マスク・スナップ・ルックアップ'パイプラインを用いて3次元オープンボリュームインスタンスセグメンテーションを実行するフレームワークを提案する。3次元点群からクラスに依存しないマスク候補を生成し、2次元ビジョン・ランゲージモデル向けにマルチスケールのシーン画像を合成し、マスク2ピクセル対応関係を介して結果を3次元に戻す。この手法は、屋内および屋外のベンチマークで最先端の性能を達成し、ODISE や LISA といった高度な2次元モデルと再トレーニングなしに即座に統合可能である。

ABSTRACT

In this work, we introduce OpenIns3D, a new 3D-input-only framework for 3D open-vocabulary scene understanding. The OpenIns3D framework employs a "Mask-Snap-Lookup" scheme. The "Mask" module learns class-agnostic mask proposals in 3D point clouds, the "Snap" module generates synthetic scene-level images at multiple scales and leverages 2D vision-language models to extract interesting objects, and the "Lookup" module searches through the outcomes of "Snap" to assign category names to the proposed masks. This approach, yet simple, achieves state-of-the-art performance across a wide range of 3D open-vocabulary tasks, including recognition, object detection, and instance segmentation, on both indoor and outdoor datasets. Moreover, OpenIns3D facilitates effortless switching between different 2D detectors without requiring retraining. When integrated with powerful 2D open-world models, it achieves excellent results in scene understanding tasks. Furthermore, when combined with LLM-powered 2D models, OpenIns3D exhibits an impressive capability to comprehend and process highly complex text queries that demand intricate reasoning and real-world knowledge. Project page: https://zheninghuang.github.io/OpenIns3D/

研究の動機と目的

  • 2D イメージが入手不可能または3次元点群とアライメントされていない状況において、3次元オープンボリュームインスタンスセグメンテーションを可能にすること。
  • 2D-3D データペアが良好にアライメントされている必要があるという、従来の3次元オープンボリューム手法の制限を克服すること。
  • 3次元入力用に再トレーニングを必要とせず、強力な事前学習済み2次元ビジョン・ランゲージモデルを活用できる柔軟なフレームワークを開発すること。
  • クラスラベルなしの3次元点群のみを入力として用いながら、高品質な3次元インスタンスセグメンテーションを実現し、複雑で推論を要するテキストクエリと互換性を保つこと。

提案手法

  • マスクモジュールは、マスクプロポーザルモジュール(MPM)を用いて、トレーニング時にクラスラベルを必要とせず、3次元点群からクラスに依存しないマスク候補を生成する。
  • マスクスコアリングモジュールはマスク品質を評価し、マスクフィルタリング技術により低品質または断片的な候補を除去する。
  • スナップモジュールは最適化されたカメラポーズと内部パrameters を用いて、すべてのマスク候補をカバーする複数スケールのシーンレベル2次元画像を合成する。
  • 2次元オープンボリュームモデル(例:ODISE、LISA)が合成画像を処理し、物体を検出・分類し、カテゴリとピクセル位置データを含むクラスルックアップテーブル(CLT)を出力する。
  • ルックアップモジュールは事前に計算済みのマスク2ピクセルマップを用いて、3次元マスク候補を合成2次元画像上に投影し、空間的対応関係を介して正確なカテゴリ割り当てを実現する。
  • フレームワークはモジュラーであり、3Dバックボーンを再トレーニングすることなく、任意の2次元検出器やビジョン・ランゲージモデルと即座に統合可能である。

実験結果

リサーチクエスチョン

  • RQ12D イメージ入力や2D-3D アライメントに依存せずに、3次元オープンボリュームインスタンスセグメンテーションを達成できるか?
  • RQ2ペaired 2D イメージが存在しない状況で、強力な2次元ビジョン・ランゲージモデルの能力を3次元点群に効果的に転送できるか?
  • RQ32D入力フリーな柔軟なフレームワークが、多様な3次元ベンチマークで最先端の性能を達成できるか?
  • RQ4フレームワークの性能は、下位の2次元モデルの推論力および一般化能力にどのように依存するか?
  • RQ52D監視なしでも、世界知識や推論を要する複雑なオープンエンドテキストクエリを処理できるか?

主な発見

  • OpenIns3D は、屋内(S3DIS、ScanNetv2)および屋外(STPLS3D)データセットにおいて、オープンボリュームインスタンスセグメンテーションで最先端の性能を達成し、先行手法を大きく上回っている。
  • S3DIS データセットでは、ODISE を用いる際 39.5% の平均マスクAPを達成し、LISA を用いる際は 41.8% に達しており、以前の最先端手法を著しく上回っている。
  • ScanNetv2 では、ODISE を用いる際 38.7%、LISA を用いる際 40.1% の平均マスクAPを達成し、ドメインをまたいで優れた一般化性能を示している。
  • LISA と統合した場合、OpenIns3D は '青いゴミ箱の近くの赤い自転車を見つけよ' といった、推論を要する複雑なクエリを効果的に処理でき、強力なゼロショット一般化性能を示している。
  • 小さなマスクやスパarsely点群領域に対しても高い性能を維持しているが、極めて小さな領域や断片的な領域では性能がわずかに低下する。
  • 新しい2次元モデルへの切り替えも容易で、ODISE から LISA に切り替える際も再トレーニングが不要であり、モジュラリティと適応性の高さが顕著に表れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。