[논문 리뷰] GaussianEditor: Editing 3D Gaussians Delicately with Text Instructions
GaussianEditor는 3D 가우시안 스플래터링을 사용하여 정교하고 텍스트 유도형 3D 시점 편집을 위한 새로운 프레임워크입니다. 텍스트 기반의 관심 영역(RoI)을 추출하고, 이미지 스페이스 기반 정렬을 통해 3D 가우시안에 대응시켜 국소적 편집을 정밀하게 적용합니다. 이로 인해 훨씬 뛰어난 편집 품질과 20분 이내의 훈련 속도를 달성하였으며, 기존의 Instruct-NeRF2NeRF와 같은 방법들을 능가합니다.
Recently, impressive results have been achieved in 3D scene editing with text instructions based on a 2D diffusion model. However, current diffusion models primarily generate images by predicting noise in the latent space, and the editing is usually applied to the whole image, which makes it challenging to perform delicate, especially localized, editing for 3D scenes. Inspired by recent 3D Gaussian splatting, we propose a systematic framework, named GaussianEditor, to edit 3D scenes delicately via 3D Gaussians with text instructions. Benefiting from the explicit property of 3D Gaussians, we design a series of techniques to achieve delicate editing. Specifically, we first extract the region of interest (RoI) corresponding to the text instruction, aligning it to 3D Gaussians. The Gaussian RoI is further used to control the editing process. Our framework can achieve more delicate and precise editing of 3D scenes than previous methods while enjoying much faster training speed, i.e. within 20 minutes on a single V100 GPU, more than twice as fast as Instruct-NeRF2NeRF (45 minutes -- 2 hours).
연구 동기 및 목표
- 자연어 지시에 따라 세밀하고 국소적인 3D 시점 편집을 가능하게 하기 위해.
- 2D 디퓨전 모델이 3D 시점에 적용되었을 때 편집 영역을 정확히 국소화하는 데에 한계를 극복하기 위해.
- 3D 가우시안의 명시적이고 점별적인 특성을 활용해 정밀하고 개별화된 편집 제어를 가능하게 하기 위해.
- 기존의 NeRF 기반 편집 방법에 비해 훈련 시간을 단축시키면서도 편집 정확도를 향상시키기 위해.
- 다중모odal 구성 요소(Large Language Model, 정렬 모델, 3D 가우시안)를 통합하여 유일하고 상호작용 가능한 편집 파이프라인을 구축하기 위해.
제안 방법
- 대규모 언어 모델(LLM)을 사용해 텍스트 지시에서 관심 영역(RoI)을 추출하여 주요 편집 대상을 식별합니다.
- 정렬 세그멘테이션 모델을 활용해 2D 이미지 스페이스에서 RoI를 국소화하고, 이미지 수준의 RoI 마스크를 생성합니다.
- RoI 리프팅 모듈을 적용해 2D 이미지 RoI를 3D 가우시안 스페이스로 다시 투영함으로써 누출과 노이즈를 최소화합니다.
- 텍스트 및 공간 제약 조건에 조건부된 디퓨전 모델을 사용해 정밀하게 개선된 RoI 내부의 3D 가우시안에서 국소적 편집을 수행합니다.
- 사용자가 제공한 3D 상자나 점 선택을 통해 상호작용적 정밀 조정을 지원하여 편집 영역을 추가로 개선합니다.
- 공간 관계 이해를 향상시켜 지시 정렬의 정확도를 높이기 위해 시점 기술 생성 기능을 통합합니다.
실험 결과
연구 질문
- RQ1텍스트 유도형 지시에 따라 3D 가우시안 스플래터링 기반 접근이 암묵적 NeRF 기반 방법보다 더 정밀하고 국소적인 3D 시점 편집을 가능하게 할 수 있는가?
- RQ2텍스트 기반의 관심 영역을 효과적으로 3D 공간에서 국소화하여 전반적 또는 노이즈가 많은 편집을 방지할 수 있는가?
- RQ3LLM, 정렬 모델, 3D 가우시안 조작을 결합한 다단계 파이프라인은 종단 간 디퓨전 기반 접근보다 더 빠르고 정확한 편집을 달성할 수 있는가?
- RQ4시점 기술 생성이 편집 작업에 있어 공간 관계 이해의 정확도를 향상시키는 데 어떤 역할을 하는가?
- RQ5RoI 리프팅 모듈이 불완전한 2D 세그멘테이션으로 인한 노이즈로 인한 편집 누출을 어떻게 효과적으로 줄이는가?
주요 결과
- GaussianEditor는 Instruct-NeRF2NeRF에 비해 훨씬 더 정교하고 정밀한 편집을 달성하였으며, 특히 특정 물체 부위에 변화를 국소화하는 데서 두각을 나타냈습니다.
- 단일 V100 GPU에서 훈련을 20분 이내로 완료하여 Instruct-NeRF2NeRF(45분 – 2시간)보다 2배 이상 빠릅니다.
- 절단 실험 결과 모든 구성 요소—가우시안 RoI, 텍스트 RoI, RoI 리프팅—이 필수적임을 확인하였으며, 어느 하나라도 누락되면 심각한 편집 누출이나 실패가 발생했습니다.
- 시점 기술 생성 기능 덕분에 공간 관계 이해가 정확해져, 자전거 옆에 앉는 벤치 같은 물체의 정확한 편집이 가능해졌으며, 이는 기준 설정에서 실패한 바 있습니다.
- RoI 리프팅 모듈은 불완전한 2D 세그멘테이션으로 인한 노이즈와 누출을 효과적으로 줄여 3D 편집의 정밀도를 향상시켰습니다.
- 사용자 상호작용 제어(예: 3D 상자, 점 선택)를 통해 다중 라운드의 세밀한 편집이 가능해져 사용성 향상에 기여했습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.