[논문 리뷰] Edit-DiffNeRF: Editing 3D Neural Radiance Fields using 2D Diffusion Model
Edit-DiffNeRF는 실세계 3D NeRF 시각을 냉동된 2D 확산 모델과 학습 가능한 델타 모듈을 사용해 잠재 의미 공간을 편집함으로써, 텍스트 프롬프트에 따라 세밀하고 다중 시점 일致하는 편집을 가능하게 하는 새로운 프레임워크를 제안한다. 이는 기존의 Instruct-NeRF2NeRF와 같은 방법보다 25% 높은 텍스트 지시어와의 일치도를 달성한다.
Recent research has demonstrated that the combination of pretrained diffusion models with neural radiance fields (NeRFs) has emerged as a promising approach for text-to-3D generation. Simply coupling NeRF with diffusion models will result in cross-view inconsistency and degradation of stylized view syntheses. To address this challenge, we propose the Edit-DiffNeRF framework, which is composed of a frozen diffusion model, a proposed delta module to edit the latent semantic space of the diffusion model, and a NeRF. Instead of training the entire diffusion for each scene, our method focuses on editing the latent semantic space in frozen pretrained diffusion models by the delta module. This fundamental change to the standard diffusion framework enables us to make fine-grained modifications to the rendered views and effectively consolidate these instructions in a 3D scene via NeRF training. As a result, we are able to produce an edited 3D scene that faithfully aligns to input text instructions. Furthermore, to ensure semantic consistency across different viewpoints, we propose a novel multi-view semantic consistency loss that extracts a latent semantic embedding from the input view as a prior, and aim to reconstruct it in different views. Our proposed method has been shown to effectively edit real-world 3D scenes, resulting in 25% improvement in the alignment of the performed 3D edits with text instructions compared to prior work.
연구 동기 및 목표
- 사전 훈련된 확산 모델과 NeRF를 사용할 때 발생하는 다중 시점 일관성 부족 및 3D 일관성 부족 문제를 해결하기 위해.
- 각 시각마다 확산 모델을 미세조정하지 않고도 세밀하고 제어 가능한 3D 시각 편집을 가능하게 하기 위해.
- 새로운 다중 시점 의미 일관성 손실을 통해 3D 편집 중에 여러 시점 간 의미 일관성을 보장하기 위해.
- 기존 방법들인 Instruct-NeRF2NeRF를 초월하여 텍스트 지시어와 렌더링된 3D 시각 편집 간의 일치도를 향상시키기 위해.
- 냉동된 확산 사전 지식을 활용하여 실물 촬영된 NeRF 시각에서 사진 수준의 사실적인 일관성 있는 3D 편집을 달성하기 위해.
제안 방법
- 프레임워크는 각 NeRF 시각에 대해 냉동된 사전 훈련된 2D 확산 모델을 사용해 잠재 임베딩을 생성한다.
- CLIP 거리 손실을 지침으로 사용하여, 텍스트 프롬프트에 기반해 확산 모델의 잠재 공간을 편집하는 학습 가능한 델타 모듈을 훈련시킨다.
- 편집된 잠재 임베딩은 2D 이미지로 디코딩되며, 이를 바탕으로 NeRF를 훈련시켜 3D 시각 재구성한다.
- 다중 시점 의미 일관성 손실을 도입하여, 서로 다른 시점 간에 공통된 잠재 사전 지식을 재구성함으로써 3D 일관성을 확보한다.
- CLIP 기반 손실과 일관성 손실을 조합하여 델타 모듈을 NeRF와 함께 엔드 투 엔드로 최적화한다.
- 각 시각마다 확산 모델을 미세조정하지 않고, 효율적이고 일관성 있는 편집을 위해 잠재 공간에서 델타를 학습하는 데 집중한다.
실험 결과
연구 질문
- RQ1각 시각마다 확산 모델을 미세조정하지 않고도 세밀하고 텍스트 유도 3D 시각 편집을 달성할 수 있는가?
- RQ2냉동된 2D 확산 사전 지식을 활용할 때, 3D 편집 중에 여러 시점 간 의미 일관성을 어떻게 확보할 수 있는가?
- RQ3냉동된 확산 모델의 잠재 공간에서 델타 모듈이 텍스트 지시어를 3D 시각 편집으로 효과적으로 전달할 수 있는가?
- RQ4제안된 다중 시점 의미 일관성 손실이 3D 일관성과 편집 정확도를 크게 향상시키는가?
- RQ5Instruct-NeRF2NeRF와 같은 최신 기법들과 비교했을 때, Edit-DiffNeRF는 텍스트-이미지 및 텍스트-3D 일치도에서 어떻게 성능을 내는가?
주요 결과
- CLIP 텍스트-이미지 유사도 측정 기준으로, Edit-DiffNeRF는 Instruct-NeRF2NeRF보다 25% 높은 텍스트-3D 편집 일치도를 달성한다.
- 기존 방법에서 관찰된 다중 시점 일관성 문제와 블러, 노이즈 등의 렌더링 아티팩트를 크게 감소시킨다.
- 다중 시점 의미 일관성 손실을 제거할 경우 3D 일관성이 떨어지며, 이는 시나리오의 일관성을 유지하는 데 있어 이 손실의 핵심적 역할을 증명한다.
- 제거 실험 결과 델타 모듈 자체만으로도 베이스라인 방법보다 향상되지만, 일관성 손실이 포함된 전체 프레임워크가 가장 우수한 성능을 낸다.
- Edit-DiffNeRF는 실물 촬영된 NeRF 시각에서 사진 수준의 사실적이고 일관성 있는 3D 편집을 생성하며, 시각적 품질과 일치도 모두 CLIP-NeRF 및 Instruct-NeRF2NeRF를 능가한다.
- 색상 변경(예: 눈 오는 효과), 객체 제거(예: 곰 조각상 제거), 복잡한 수정(예: 체크 무늬 자켓 추가) 등 다양한 편집에 대해 강력한 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.