[논문 리뷰] Instruct-NeRF2NeRF: Editing 3D Scenes with Instructions
Instruct-NeRF2NeRF는 InstructPix2Pix를 사용해 입력 이미지를 반복적으로 개선하고 NeRF를 재학습시켜 자연어 지시를 통해 3D 시점 편집을 가능하게 하며, 다양한 시점에서 일관되고 고품질의 편집을 달성한다. 이 방법은 객체 교체나 스타일 전이와 같은 다양한 편집을 유지하면서도 3D 일관성을 확보한다.
We propose a method for editing NeRF scenes with text-instructions. Given a NeRF of a scene and the collection of images used to reconstruct it, our method uses an image-conditioned diffusion model (InstructPix2Pix) to iteratively edit the input images while optimizing the underlying scene, resulting in an optimized 3D scene that respects the edit instruction. We demonstrate that our proposed method is able to edit large-scale, real-world scenes, and is able to accomplish more realistic, targeted edits than prior work.
연구 동기 및 목표
- 특수 3D 편집 도구나 전문 지식 없이도 사전 촬영된 NeRF 시점을 자연어 기반으로 직관적으로 편집할 수 있도록 하는 것.
- 2D 확산 기반 편집에서 발생하는 3D 일관성 문제를 해결하기 위해 반복적 이미지 편집과 NeRF 재학습을 통합하는 것.
- 사전 학습된 시각-언어 모델과 확산 모델을 활용해 자연어 제어를 통해 3D 편집의 접근성을 넓히는 것.
- 지시 기반 편집이 실제 대규모 실세계 시점에서 현실적이고 타겟된, 일관된 3D 시점 수정을 달성할 수 있음을 보여주는 것.
제안 방법
- 각 학습 시점에서 NeRF에서 렌더링된 이미지를 기반으로 이미지 조건부 확산 모델인 InstructPix2Pix를 사용해 이미지 편집을 수행한다.
- 반복적 데이터셋 업데이트(Iterative DU) 전략을 적용: 렌더링된 이미지를 편집하고, 원본을 교체한 후 NeRF를 재학습시킨다.
- 현재 NeRF에서 시점을 렌더링하고, InstructPix2Pix를 통해 자연어 지시에 따라 이미지를 편집한 후, 편집된 이미지를 사용해 NeRF를 업데이트한다.
- 모든 시점에서 편집이 전파되는 방식으로 NeRF 최적화 과정을 통해 3D 일관성을 유지한다.
- 편집된 이미지를 점진적으로 활용해 NeRF를 반복적으로 개선하는 학습 루프를 운영하여 기하학적 및 외관 일관성을 유지한다.
- 대규모 3D 학습 데이터가 필요 없도록 사전 학습된 확산 모델을 활용해 형태와 외관 사전 지식을 추출한다.
실험 결과
연구 질문
- RQ1특수 3D 편집 도구 없이도 자연어 지시를 사용해 실세계 NeRF 시점에서 일관되고 3D 인식 편집을 수행할 수 있는가?
- RQ2확산 모델을 사용한 반복적 이미지 편집이 스코어 디스틸레이션 샘플링(SDS) 기반 종단간 최적화와 비교할 때 3D 일관성과 품질 측면에서 어떻게 다를까?
- RQ3지시 기반 편집이 객체 교체, 텍스처 변경, 전반적 스타일 전이와 같은 복잡한 편집을 어느 정도 처리할 수 있는가?
- RQ4기반 확산 모델이 일관된 2D 편집을 생성하지 못할 경우, 이 방법의 실패 모드는 어떠한가?
- RQ5NeRF-Art나 CLIP 기반 지시 편집과 같은 이전 방법들과 비교해, 이 방법은 다양한 대규모 실세계 시점에서 어떻게 성능을 발휘하는가?
주요 결과
- 이 방법은 실세계 NeRF 시점에서 객체 교체, 텍스처 수정, 전반적 스타일 전이 등 다양한 편집을 높은 3D 일관성으로 성공적으로 수행한다.
- 정량적 평가 결과, 텍스트 지시와 3D 편집 간의 일치도가 기준 모델보다 향상되었으며, 방향 유사도 지표를 통해 새로운 시점에서도 강력한 일관성이 확인되었다.
- 반복적 데이터셋 업데이트(Iterative DU) 전략은 이미지 조건부가 없는 SDS 기반 최적화보다 우수한 성능을 보였으며, 이미지 조건부가 부족해 발생하는 불안정성과 뿌연 결과 문제를 피할 수 있었다.
- StableDiffusion 대비 InstructPix2Pix를 사용함으로써 3D 일관성이 크게 향상되었으며, 후자는 이미지 조건부가 없어 뿌연, 일관성 없는 출력을 생성한다.
- 이 방법은 InstructPix2Pix의 한계를 그대로 이어받으며, 특히 비어 있거나 복잡한 영역에서 객체 추가 또는 제거를 일관되게 수행하지 못하는 경우가 있다.
- 실패 사례로는 2D 편집 실패(예: InstructPix2Pix가 모자를 추가하지 못함)와 2D 편집의 일관성 없음이 3D로 전파되는 경우가 있으며, 이는 이 방법이 2D 모델의 신뢰성에 크게 의존한다는 점을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.