[論文レビュー] NeRF-SOS: Any-View Self-supervised Object Segmentation on Complex Scenes
NeRF-SOS は、共同コントラスト損失を通じて外観と幾何の手がかりを統合的に活用することで、複雑な現実世界のシーンにおける任意視点物体セグメンテーションのための自己教師ありフレームワークを提案する。この手法は、NeRFに基づく物体セグメンテーションにおいて最先端の性能を達成し、セグメンテーション品質と視点一貫性の両面で、2Dの自己教師あり手法および教師あり手法を上回っている。
Neural volumetric representations have shown the potential that Multi-layer Perceptrons (MLPs) can be optimized with multi-view calibrated images to represent scene geometry and appearance, without explicit 3D supervision. Object segmentation can enrich many downstream applications based on the learned radiance field. However, introducing hand-crafted segmentation to define regions of interest in a complex real-world scene is non-trivial and expensive as it acquires per view annotation. This paper carries out the exploration of self-supervised learning for object segmentation using NeRF for complex real-world scenes. Our framework, called NeRF with Self-supervised Object Segmentation NeRF-SOS, couples object segmentation and neural radiance field to segment objects in any view within a scene. By proposing a novel collaborative contrastive loss in both appearance and geometry levels, NeRF-SOS encourages NeRF models to distill compact geometry-aware segmentation clusters from their density fields and the self-supervised pre-trained 2D visual features. The self-supervised object segmentation framework can be applied to various NeRF models that both lead to photo-realistic rendering results and convincing segmentation maps for both indoor and outdoor scenarios. Extensive results on the LLFF, Tank & Temple, and BlendedMVS datasets validate the effectiveness of NeRF-SOS. It consistently surpasses other 2D-based self-supervised baselines and predicts finer semantics masks than existing supervised counterparts. Please refer to the video on our project page for more details:https://zhiwenfan.github.io/NeRF-SOS.
研究の動機と目的
- 密なアノテーションや各視点ごとのアノテーションを一切必要としない、複雑な現実世界のシーンにおける自己教師あり 3D 物体セグメンテーションを可能にすること。
- 高価な人手によるアノテーションデータや合成データに依存する既存手法の限界を克服すること。
- 2D の自己教師あり視覚特徴と NeRF の 3D 幾何を統合し、強固で視点一貫性のあるセグメンテーションを実現すること。
- 屋内・屋外・オブジェクト中心のシーンを含む、さまざまな NeRF 変種に適用可能な汎用性の高いフレームワークを開発すること。
提案手法
- 物体セグメンテーションのための外観レベルと幾何レベルの監督を同時に最適化する共同コントラスト損失を提案する。
- 自己教師あり 2D 視覚バックボーン(例:DINO-ViT)を活用して外観特徴を抽出し、複数の視点にわたるセグメンテーションクラスタを構築する。
- NeRF の密度フィールドを活用して 3D 構造的認識をセグメンテーションクラスタに組み込む幾何に配慮したコントラスト損失を導入する。
- 2段階訓練戦略を採用する:まず NeRF を事前学習し、その後コントラスト損失を用いてセグメンテーションヘッドを微調整することで、最適化の競合を回避する。
- 精錬されたセグメンテーション特徴空間に非教師ありクラスタリングを適用し、最終的な物体マスクを生成する。
- さまざまなデータセットにおいて、ヴァナイル NeRF、NeRF++、その他の NeRF 変種に対してエンドツーエンドの学習をサポートする。
実験結果
リサーチクエスチョン
- RQ1各視点のアノテーションなしで、自己教師あり 2D 視覚特徴を効果的に活用して NeRF における 3D 物体セグメンテーションを実現できるか?
- RQ2NeRF が内蔵する 3D 幾何(密度フィールドを介して)をどのように活用すれば、セグメンテーションの一貫性と正確性を向上させられるか?
- RQ3外観と幾何の手がかりを統合した共同コントラスト損失は、単一モodal の監督よりも物体セグメンテーションで優れた性能を発揮するか?
- RQ4提案されたフレームワークは、無限大の屋外環境を含む多様な現実世界のシーンに一般化可能か?
- RQ52段階訓練戦略は、NeRF とセグメンテーション損失を同時に最適化する手法と比較して、レンダリング品質およびセグメンテーション品質の面で優れているか?
主な発見
- LLFF、BlendedMVS、CO3Dv2、Tank & Temples データセットにおいて、NeRF-SOS は最先端の 2D ベースの自己教師ありオブジェクト共同セグメンテーション手法を一貫して上回っている。
- CO3Dv2 データセットでは、NeRF-SOS は mIoU 0.9686 を達成し、教師ありの Semantic-NeRF ベースラインを顕著に上回っている。
- NeRF++ に含まれる無限大の Truck シーンにおいて、NeRF-SOS は教師ありの Semantic-NeRF++ よりも細分化されたセグメンテーションを生成し、サイドミラー やスラットの間の開口部といった小さな構造的詳細を正しく同定している。
- アブレーションスタディの結果、外観または幾何のコントラスト損失のいずれかを削除すると、破断したまたは一貫性のないセグメンテーションクラスタが生成されることが確認され、両方のコンポonent の必要性が裏付けられた。
- NeRF とコントラスト損失を同時に最適化すると、レンダリングとセグメンテーションの両方の性能が劣化するため、2段階訓練戦略が最適化の安定性にとって不可欠であることが示された。
- DINO-ViT を 2D バックボーンとして使用した場合、ResNet50 よりも優れたセグメンテーション品質が得られ、ViT ベースの自己教師あり特徴が 3D シーン理解において優位性を発揮することを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。