Skip to main content
QUICK REVIEW

[論文レビュー] GNeSF: Generalizable Neural Semantic Fields

Hanlin Chen, Li Chen|arXiv (Cornell University)|Oct 24, 2023
Advanced Vision and Imaging被引用数 4
ひとこと要約

本論文では、2次元の監視情報のみを用いて、新しいシーンの3次元セマンティックセグメンテーションを可能にする汎用的なニューラルセマンティックフィールド、GNeSFを提案する。マルチビュー画像特徴、視点差分符号化を用いたソフト投票機構、可視性モジュールを活用することで、各シーンの最適化を回避し、3次元の監視情報が不要な状態でも最先端の性能を達成する。

ABSTRACT

3D scene segmentation based on neural implicit representation has emerged recently with the advantage of training only on 2D supervision. However, existing approaches still requires expensive per-scene optimization that prohibits generalization to novel scenes during inference. To circumvent this problem, we introduce a generalizable 3D segmentation framework based on implicit representation. Specifically, our framework takes in multi-view image features and semantic maps as the inputs instead of only spatial information to avoid overfitting to scene-specific geometric and semantic information. We propose a novel soft voting mechanism to aggregate the 2D semantic information from different views for each 3D point. In addition to the image features, view difference information is also encoded in our framework to predict the voting scores. Intuitively, this allows the semantic information from nearby views to contribute more compared to distant ones. Furthermore, a visibility module is also designed to detect and filter out detrimental information from occluded views. Due to the generalizability of our proposed method, we can synthesize semantic maps or conduct 3D semantic segmentation for novel scenes with solely 2D semantic supervision. Experimental results show that our approach achieves comparable performance with scene-specific approaches. More importantly, our approach can even outperform existing strong supervision-based approaches with only 2D annotations. Our source code is available at: https://github.com/HLinChen/GNeSF.

研究の動機と目的

  • 既存のニューラルセマンティックフィールドが各シーンの最適化を必要としているという制限を解消し、新しいシーンへの一般化を可能にすること。
  • 再トレーニングや3次元監視情報なしに、未観測のシーンにおける高品質な3次元セマンティックセグメンテーションを実現すること。
  • シーン固有の幾何学的・セマンティック的詳細への過学習を回避することで、一般化性能を向上させること。
  • 2次元セマンティックマップとマルチビュー特徴を活用したフレームワークを構築し、3次元セマンティック予測のロバスト性を高めること。

提案手法

  • シーン固有の幾何学的・セマンティック的特徴への過学習を防ぐために、位置符号化の代わりにマルチビュー画像特徴を用いる。
  • 視点の関連性で重み付けされた、複数のビューからの2次元セマンティック確率を統合するソフト投票機構を採用し、3次元点のセマンティックを予測する。
  • 投票プロセスにおいて、近い視点を遠くの視点よりも優先するため、視点差分符号化を導入する。
  • 可視性モジュールにより、遮蔽されたり信頼性が低い視点からのセマンティック情報を検出し、フィルタリングする。
  • 3次元MLPを用いて、ジオメトリエンコードボリューム内の補間特徴から3次元ジオメトリ(密度またはSDF)を予測する。
  • 最終的なセマンティック予測は、予測されたジオメトリから導かれる重み付き組み合わせとして計算される。

実験結果

リサーチクエスチョン

  • RQ1各シーンの最適化を必要とせず、新しいシーンに一般化可能なニューラルセマンティックフィールドを学習できるか?
  • RQ23次元アノテーションが不要な状態で、2次元セマンティック監視情報を効果的に活用し、3次元セマンティックフィールドを予測できるか?
  • RQ3視点の近接性は、3次元予測のためのマルチビューのセマンティック情報統合において、どのような役割を果たすか?
  • RQ4可視性モジュールを導入することで、遮蔽された視点からの寄与をフィルタリングし、ロバスト性を向上させられるか?
  • RQ5位置符号化の代わりに画像特徴を用いることで、一般化性能と性能にどのような影響が生じるか?

主な発見

  • GNeSFは、Replicaデータセットにおいて3次元mIoUが43.8%を達成し、2次元監視情報のみを用いた先行研究をすべて上回った。
  • ScanNetでは、GNeSFが55.1%のmIoUを達成し、3次元監視情報が必要な前例最高の手法(51.5%)を上回った。
  • アブレーションスタディの結果、可視性モジュールを追加することで、ベースラインからmIoUが0.9%向上し、その有効性が確認された。
  • ロジットではなく確率分布を用いることで、ロジットベースの投票と比較してmIoUが0.6%向上した。
  • GNeSFはS4R(36.9% mIoU)を大きく上回り、ソフト投票機構の優位性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。