Skip to main content
QUICK REVIEW

[論文レビュー] LERF: Language Embedded Radiance Fields

Justin Kerr, Chung Min Kim|arXiv (Cornell University)|Mar 16, 2023
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

LERFは、CLIP言語特徴をNeural Radiance Fields (NeRF)に直接埋め込み、マルチスケールで3次元連続的な言語フィールドとして実現することで、微調整や領域提案を必要とせず、多様な視覚的および抽象的概念に対してリアルタイムでピクセルに整合したゼロショット言語クエリを可能にする手法を提案する。主な貢献は、2Dベースラインを上回る、3次元整合的かつ視点に整合した関連度マップを生成するシステムであり、実世界のシーンにおけるオープンボリュームロケライゼーションで優れた性能を示す。

ABSTRACT

Humans describe the physical world using natural language to refer to specific 3D locations based on a vast range of properties: visual appearance, semantics, abstract associations, or actionable affordances. In this work we propose Language Embedded Radiance Fields (LERFs), a method for grounding language embeddings from off-the-shelf models like CLIP into NeRF, which enable these types of open-ended language queries in 3D. LERF learns a dense, multi-scale language field inside NeRF by volume rendering CLIP embeddings along training rays, supervising these embeddings across training views to provide multi-view consistency and smooth the underlying language field. After optimization, LERF can extract 3D relevancy maps for a broad range of language prompts interactively in real-time, which has potential use cases in robotics, understanding vision-language models, and interacting with 3D scenes. LERF enables pixel-aligned, zero-shot queries on the distilled 3D CLIP embeddings without relying on region proposals or masks, supporting long-tail open-vocabulary queries hierarchically across the volume. The project website can be found at https://lerf.io .

研究の動機と目的

  • 言語埋め込みをNeRFに直接統合することで、3次元シーンに対するオープンエンドで自然な言語インタラクションを可能にすること。
  • NeRFが意味的意味を持たないという制限を、汎用的なCLIP埋め込みを3次元連続フィールドに統合することで克服すること。
  • データセット固有の微調整や領域提案を必要とせず、抽象的・視覚的・長尾的・テキストベースの多様な言語クエリをサポートすること。
  • 複数の視点とスケールでCLIP埋め込みのボリュームレンダリングを用いて、マルチスケールで3次元整合的な関連度マップを生成すること。
  • ハンドヘルドデバイスで撮影された3次元シーンに対して、自然言語を用いたリアルタイムでインタラクティブなクエリを可能にすること。ただし、NeRFの学習速度にほとんど影響を与えないこと。

提案手法

  • LERFは、3次元空間座標と物理的スケール $s$ を入力として、CLIP埋め込みを出力する3次元言語フィールド $F_{\text{lang}}(x,y,z,s)$ を最適化する。これにより、マルチスケールでの言語のグランドイングが可能になる。
  • 学習段階では、各訓練ビューのマルチスケールクロップからCLIP埋め込みを抽出し、NeRFの光線に整合した特徴ピラミッドを用いて監視信号として用いる。
  • 言語フィールドは、各光線に沿って予測された埋め込みと真値のCLIP埋め込み間のコサイン類似度を最大化するように対照的損失を用いて学習する。
  • 共有ボトルネックを介して自己教師付きDINO特徴を統合し、言語フィールドの滑らかさと境界定義を向上させる。
  • ボリュームレンダリングを用いて光線に沿ってCLIP埋め込みを集約し、レンダリング重みはNeRF密度フィールドから得る。
  • 推論段階では、任意の言語プロンプトを3次元フィールドに埋め込み、リアルタイムで3次元連続な関連度マップを生成し、インタラクティブなクエリを可能にする。

実験結果

リサーチクエスチョン

  • RQ1微調整や領域提案を一切行わず、CLIP埋め込みを3次元NeRFに効果的にグランドイングできるか?
  • RQ23次元でマルチスケールの言語フィールドは、2Dベースラインに比べてオープンボリュームクエリにおけるロケライゼーション精度と整合性を向上させられるか?
  • RQ3マルチスケールの監視は、抽象的・長尾的・視覚的など多様なクエリに対する言語埋め込みの一般化性能をどのように向上させるか?
  • RQ4DINO特徴を統合することで、3次元関連度マップの品質とシャープネスはどの程度向上するか?
  • RQ5LERFは、ハンドヘルドデバイスで撮影された3次元シーンにおいて、リアルタイムでゼロショットかつピクセルに整合した言語クエリを可能にするか?

主な発見

  • LERFは、抽象的概念(例:'electricity')や長尾オブジェクト(例:'Waldo')を含む多様な言語クエリに対して、リアルタイムでインタラクティブな3次元関連度マップ生成を可能にする。
  • LERFは、2Dオープンボリューム検出器LSeGとOWL-ViTに比べ、特に長尾的・細分化されたクエリにおいて3次元ロケライゼーション精度が優れている。
  • DINO監視の導入により、特に低視点数や複雑な幾何形状領域において、関連度マップの滑らかさと境界定義が顕著に向上する。
  • マルチスケール学習は不可欠である:これを除去すると、粗い(例:'espresso machine')および細分化された(例:'creamer pods')クエリの両方で性能が低下する。
  • LERFはシーン全体にわたって視点に整合した3次元関連度マップを生成する。定性的な結果から、意味的および視覚的キーポイントと強く整合していることが示されている。
  • 失敗事例としては、視覚的または意味的に類似した物体(例:'zucchini'が他の緑色野菜に誤検出)の誤検出や、空間的推論の限界(例:'table'が縁のみに反応)がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。