[논문 리뷰] Gaussian Grouping: Segment and Edit Anything in 3D Scenes
Gaussian Grouping은 3D Gaussian Splatting을 확장하여 가우시안들을 객체 인스턴스와 스태프 세그먼트로 그룹화하는 학습 가능한 아이덴티티 인코딩을 도입함으로써, 오직 SAM의 2D 마스크와 3D 공간 일관성 정규화만을 사용하여 병행되는 3D 재구성과 세분화 가능한 분할을 가능하게 한다. 이 방법은 최소한의 감독으로도 고해상도 편집 가능한 3D 시각화를 달성하며, 재학습 없이도 효율적인 국소 편집을 지원한다.
The recent Gaussian Splatting achieves high-quality and real-time novel-view synthesis of the 3D scenes. However, it is solely concentrated on the appearance and geometry modeling, while lacking in fine-grained object-level scene understanding. To address this issue, we propose Gaussian Grouping, which extends Gaussian Splatting to jointly reconstruct and segment anything in open-world 3D scenes. We augment each Gaussian with a compact Identity Encoding, allowing the Gaussians to be grouped according to their object instance or stuff membership in the 3D scene. Instead of resorting to expensive 3D labels, we supervise the Identity Encodings during the differentiable rendering by leveraging the 2D mask predictions by Segment Anything Model (SAM), along with introduced 3D spatial consistency regularization. Compared to the implicit NeRF representation, we show that the discrete and grouped 3D Gaussians can reconstruct, segment and edit anything in 3D with high visual quality, fine granularity and efficiency. Based on Gaussian Grouping, we further propose a local Gaussian Editing scheme, which shows efficacy in versatile scene editing applications, including 3D object removal, inpainting, colorization, style transfer and scene recomposition. Our code and models are at https://github.com/lkeab/gaussian-grouping.
연구 동기 및 목표
- 비용이 많이 드는 3D 레이블링이 필요 없이 오픈 월드 환경에서 정교한 인스턴스 수준의 3D 시각화 이해를 가능하게 하기 위해.
- 재구성과 분할을 모두 지원하는 아이덴티티 인식 표현을 갖춘 3D Gaussian Splatting을 확장하기 위해.
- 직접적으로 그룹화된 3D 가우시안에서 나온 편집 기능(예: 객체 제거, 인painting, 재구성)을 가능하게 하기 위해.
- 3D 레이블링 없이도 제로샷 2D 분할(SAM)과 3D 공간 일관성 정규화를 활용하여 3D 그룹화를 감독하기 위해.
- 효율적인 훈련과 렲영을 통해 암시적 NeRF 기반 방법보다 편집 가능성과 속도에서 뛰어난 고해상도 3D 재구성과 분할을 달성하기 위해.
제안 방법
- 각 3D 가우시안에 16차원의 학습 가능한 아이덴티티 인코딩을 추가하여 객체 인스턴스 또는 스태프 소속을 표현한다.
- 3D 가우시안을 2D 뷰로 투영하고 공유된 선형 레이어를 사용해 스플래터드 임베딩을 분류함으로써, 가우시안을 2D 뷰에서의 분류 기반으로 학습 가능한 아이덴티티 인코딩을 최적화한다.
- SAM이 생성한 마스크에 기반한 2D 교차 엔트로피 손실과, 기능 공간에서 상위-K 근접한 가우시안 간의 일치를 강화하는 3D 공간 일관성 정규화 손실을 사용하여 아이덴티티 그룹화를 감독한다.
- 3D 가우시안의 효율적인 엔드 투 엔드 훈련을 위해 CUDA 최적화된 전방 및 역방향 전달을 갖춘 유사 구면 조화 함수와 유사한 미분 가능 레스터라이제이션 파이프라인을 사용한다.
- 기본적인 가우시안 스플래터링 최적화에 더해, 정제 과정 동안 아이덴티티 인코딩을 유지하면서 프루닝과 디퓨전을 통한 개선을 수행한다.
- 편집 가능한 국소 편집을 위해 그룹화된 가우시안을 직접 조작할 수 있도록 하며, 제거, 색상화, 재배치 등의 작업을 최소한의 피팅으로 수행한다.

실험 결과
연구 질문
- RQ1학습 가능한 아이덴티티 인코딩을 갖춘 3D 가우시안은 3D 감독 없이도 병행되는 3D 재구성과 세분화 가능한 분할을 가능하게 할 수 있는가?
- RQ2SAM에서 유도된 2D 마스크 감독과 3D 공간 일관성 정규화 손실이 정확한 3D 그룹화를 달성하는 데 얼마나 효과적인가?
- RQ3이산적이고 그룹화된 3D 가우시안은 객체 제거, 인painting, 재구성과 같은 효율적이고 고품질의 3D 시각화 편집을 지원할 수 있는가?
- RQ4Gaussian Grouping의 성능은 암시적 NeRF 기반 방법과 비교해 재구성 품질, 분할 정확도, 편집 가능성 측면에서 어떻게 비교되는가?
- RQ5이 방법은 다양한 객체 유형과 복잡한 구성이 포함된 오픈 월드 3D 시각화 환경에 얼마나 일반화되는가?
주요 결과
- Gaussian Grouping은 오직 SAM의 2D 마스크와 3D 공간 일관성 정규화만을 사용하여 높은 시각적 품질의 3D 신규 뷰 합성과 조밀한 3D 분할을 달성한다.
- 이 방법은 그룹화된 가우시안의 구성적 특성을 활용하여, 훈련 없이도 직접적인 3D 편집(예: 객체 제거, 색상화, 위치 교환)을 가능하게 한다.
- 3D 객체 인painting은 단 몇 분의 피팅만으로도 수행 가능하여 편집 작업에 대한 효율적인 적응 능력을 보여준다.
- 3D 공간 일관성 정규화 손실은 특히 가림되거나 시야가 낮은 가우시안의 경우, 인접한 점들 간의 기능 일관성을 강화함으로써 그룹화 정확도를 향상시킨다.
- 1개의 A100 GPU에서 30K 반복 훈련을 수행함으로써 최신 기술 수준의 재구성 및 분할 성능를 달성하며, 빠른 추론과 렌더링을 제공한다.
- 그룹화된 3D 가우시안의 명시적, 이산적, 분해 가능한 성질 덕분에, 이는 암시적 NeRF 기반 방법보다 편집 가능성과 효율성에서 뛰어난 성능을 보인다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.