[논문 리뷰] Decomposing 3D Scenes into Objects via Unsupervised Volume Segmentation
ObSuRF는 하나의 이미지를 다중 부피 NeRF로 분해하여 각 객체를 표현하고, RGB-D 입력으로 감독 없이 3D 객체 분할을 가능하게 한다.
We present ObSuRF, a method which turns a single image of a scene into a 3D model represented as a set of Neural Radiance Fields (NeRFs), with each NeRF corresponding to a different object. A single forward pass of an encoder network outputs a set of latent vectors describing the objects in the scene. These vectors are used independently to condition a NeRF decoder, defining the geometry and appearance of each object. We make learning more computationally efficient by deriving a novel loss, which allows training NeRFs on RGB-D inputs without explicit ray marching. After confirming that the model performs equal or better than state of the art on three 2D image segmentation benchmarks, we apply it to two multi-object 3D datasets: A multiview version of CLEVR, and a novel dataset in which scenes are populated by ShapeNet models. We find that after training ObSuRF on RGB-D views of training scenes, it is capable of not only recovering the 3D geometry of a scene depicted in a single input image, but also to segment it into objects, despite receiving no supervision in that regard.
연구 동기 및 목표
- 감독 없이 동역학, 추론 등의 다운스트림 작업을 위한 물체 중심의 3D 표현 학습을 촉진한다.
- 잠재 슬롯에 조건화된 NeRF 집합으로 장면을 분해하기 위해 ObSuRF를 도입한다.
- 명시적 레이 행진 없이도 RGB-D 감독을 활용해 NeRF를 효율적으로 학습한다.
- 여러 NeRF를 일관된 장면 함수로 구성하는 체계적인 방법을 제시한다.
제안 방법
- 슬롯 기반 인코더를 통해 하나의 RGB 이미지를 객체 슬롯 집합으로 인코딩한다.
- 각 슬롯에 대해 공유 NeRF 디코더를 조건화하여 기하 및 외관을 나타내는 객체별 NeRF를 얻는다.
- 레이 마칭의 깊이 기반 감독(RGB-D 학습)을 가능하게 하는 충분한 포아송 프로세스 형식으로 NeRF 렌더링을 재구성한다.
- 깊이 및 객체 구성요소를 주변화하여 색상을 계산하고 다객체 장면의 공동 렌더링을 가능하게 한다.
- 학습 중 겹치지 않는 객체 부피를 촉진하는 중첩 손실을 도입한다.
- 표현당 두 번의 NeRF 평가로 RGB-D 손실을 사용해 렌더링하고 최적화하며 표준 레이 행진에 비해 계산을 줄인다.
실험 결과
연구 질문
- RQ1슬롯 기반 인코더가 감독 없이도 한 장면을 개별 객체를 위한 독립적인 NeRF들로 의미 있게 분해하는 것을 학습할 수 있는가?
- RQ2명시적 레이 행진 없이 RGB-D 데이터를 어떻게 활용하여 NeRF 기반 객체 분해를 효율적으로 학습할 수 있는가?
- RQ3객체 중심의 NeRF 분해가 2D 벤치마크를 넘은 새로운 다객체 3D 장면들(CLEVR-3D, MultiShapeNet 등)에도 일반화되는가?
- RQ4객체 부피의 비중복성을 강제하는 것이 비지도 3D 분할 및 기하 복구에 어떤 영향을 미치는가?
주요 결과
- ObSuRF는 CLEVR, dSprites, Sprite 데이터 세트에서 최첨단 2D 비지도 분할 벤치마크에 부합하거나 이를 능가한다.
- 3D 벤치마크인 CLEVR-3D와 MultiShapeNet에서 RGB-D 감독으로 학습했을 때 단일 RGB 뷰에서 객체별 기하 및 분할을 정확히 복원한다.
- 슬롯 기반의 객체 중심 NeRF 분해는 단일 모놀리식 NeRF 오토인코더 베이스라인(NeRF-AE)보다 재구성 오차가 더 낮다.
- 포아송 프로세스 기반의 레이 마칭 관점과 RGB-D 감독을 사용하면 픽셀당 두 번의 NeRF 평가가 가능해 학습 비용을 크게 줄인다.
- 중첩 손실은 퇴행적 해를 방지하고 3D 장면에서 객체 분리를 개선하는 데 도움을 준다(학습 중 신중한 스케줄링 필요).
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.