Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Multi-View Object Segmentation Using Radiance Field Propagation

Xinhang Liu, Jiaben Chen|arXiv (Cornell University)|Oct 2, 2022
Computer Graphics and Visualization Techniques被引用数 6
ひとこと要約

本稿では、神経放射場を用いたマルチビュー3次元オブジェクトセグメンテーションのための教師なし手法であるRFP(Radiance Field Propagation)を提案する。本手法は、双方向の光度損失を活用して自己教師付きでセマンティックフィールド学習を実現する。RFPは、アノテーションや事前知識が一切不要であり、3次元シーンセグメンテーションにおいて最先端の教師なし性能を達成するとともに、個々のオブジェクトのレンダリングと編集を可能にする。

ABSTRACT

We present radiance field propagation (RFP), a novel approach to segmenting objects in 3D during reconstruction given only unlabeled multi-view images of a scene. RFP is derived from emerging neural radiance field-based techniques, which jointly encodes semantics with appearance and geometry. The core of our method is a novel propagation strategy for individual objects' radiance fields with a bidirectional photometric loss, enabling an unsupervised partitioning of a scene into salient or meaningful regions corresponding to different object instances. To better handle complex scenes with multiple objects and occlusions, we further propose an iterative expectation-maximization algorithm to refine object masks. RFP is one of the first unsupervised approach for tackling 3D real scene object segmentation for neural radiance field (NeRF) without any supervision, annotations, or other cues such as 3D bounding boxes and prior knowledge of object class. Experiments demonstrate that RFP achieves feasible segmentation results that are more accurate than previous unsupervised image/scene segmentation approaches, and are comparable to existing supervised NeRF-based methods. The segmented object representations enable individual 3D object editing operations.

研究の動機と目的

  • アノテーション、3次元バウンディングボックス、クラス事前知識が一切ない状況下で、教師なしマルチビュー3次元オブジェクトセグメンテーションを実現すること。
  • 神経放射場に内在する3次元幾何と外観の一貫性を活用し、自己教師付きセマンティックフィールド学習を実現すること。
  • 遮蔽や複数オブジェクトを含む複雑なシーンにおいても、正確で一貫性のある3次元オブジェクトセグメンテーションを実現すること。
  • ラベルなしマルチビュー画像のみを用いて、個々の3次元オブジェクトのレンダリングや編集を可能とする、下流の応用を支援すること。
  • 2Dに限定されたセグメンテーションの限界を乗り越え、3次元シーン表現とボリュームレンダリングを活用すること。

提案手法

  • 本手法はレイヤードシーン表現を用い、各オブジェクトとバックグラウンドを独立した放射場としてモデル化する。
  • オブジェクト領域から非オブジェクト領域へ外観統計を伝搬させる、新しい放射場伝搬戦略を導入し、セマンティックフィールド学習を支援する。
  • 誤ってレンダリングされた画像の誤差を最大化し、正しくレンダリングされたものの誤差を最小化する双方向光度損失を提案し、自己教師付き学習を実現する。
  • 複数オブジェクトと遮蔽を含むシーンにおいて、オブジェクトマスクを改善するために反復的な期待最大化(EM)アルゴリズムを適用する。
  • 訓練中にアノテーションデータを一切使用せず、事前学習済み特徴抽出器を初期化に用いる。
  • 最終出力として、学習済みでセグメンテーションされたNeRFを用いて、自由視点レンダリングと個々の3次元オブジェクトの編集が可能になる。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしマルチビュー画像とキャリブレーション済みカメラポーズのみを用いて、実際のシーンにおける3次元オブジェクトセグメンテーションが可能か?
  • RQ2アノテーションや事前知識が一切ない状況下で、3次元シーン理解における自己教師付き学習を効果的に活用できるか?
  • RQ3双方向光度損失を用いた放射場伝搬により、遮蔽を伴う複雑なシーンにおけるセグメンテーション精度が向上するか?
  • RQ4教師なしマルチビューセグメンテーションは、3次元シーン理解において、既存の教師なし2D画像セグメンテーション手法をどの程度上回るか?
  • RQ5得られたセグメンテーション済NeRFは、オブジェクトの複製、平行移動、回転といった実用的な3次元編集操作をサポートできるか?

主な発見

  • RFPは、表1に示すすべての指標で、先行する教師なし手法を上回り、3次元マルチビューオブジェクトセグメンテーションにおいて最先端の教師なし性能を達成した。
  • 新規視点評価では、98.5%のN-Accと94.1%のN-mIoUを達成し、他のすべての教師なし手法を上回った。
  • 3Dに適応した双方向光度損失のおかげで、ベースラインと比較して、ざらついたエッジ、穴、誤検出が顕著に減少した。
  • EMに基づく精練により、複数オブジェクトと遮蔽を含む複雑なシーンにおいてもマスク品質が向上し、より明確で正確な境界が得られた。
  • RFPは、手動アノテーションなしで、高品質な個別オブジェクトレンダリングと自由視点編集(複製、平行移動、回転など)を可能にした。
  • アブレーションスタディの結果、放射場伝搬と双方向光度損失の両方が、頑健な性能を発揮するために不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。