[논문 리뷰] InseRF: Text-Driven Generative Object Insertion in Neural 3D Scenes
InseRF는 명시적인 3D 공간 입력 없이도 텍스트 및 2D 경계 상자 기반의 3D 일관성 있는 생성형 객체 삽입을 가능하게 하며, 단일 기준 시점에서 2D 디퓨전 편집을 통해 객체 생성을 정렬하고, 단일 시점 복원을 사용해 결과를 3D로 업라이프링하며, 깊이 유도 배치와 NeRF 융합을 통해 3D 일관성을 확보한다. 이는 局소화된, 현실적인 객체 삽입에서 베이스라인을 능가한다.
We introduce InseRF, a novel method for generative object insertion in the NeRF reconstructions of 3D scenes. Based on a user-provided textual description and a 2D bounding box in a reference viewpoint, InseRF generates new objects in 3D scenes. Recently, methods for 3D scene editing have been profoundly transformed, owing to the use of strong priors of text-to-image diffusion models in 3D generative modeling. Existing methods are mostly effective in editing 3D scenes via style and appearance changes or removing existing objects. Generating new objects, however, remains a challenge for such methods, which we address in this study. Specifically, we propose grounding the 3D object insertion to a 2D object insertion in a reference view of the scene. The 2D edit is then lifted to 3D using a single-view object reconstruction method. The reconstructed object is then inserted into the scene, guided by the priors of monocular depth estimation methods. We evaluate our method on various 3D scenes and provide an in-depth analysis of the proposed components. Our experiments with generative insertion of objects in several 3D scenes indicate the effectiveness of our method compared to the existing methods. InseRF is capable of controllable and 3D-consistent object insertion without requiring explicit 3D information as input. Please visit our project page at https://mohamad-shahbazi.github.io/inserf.
연구 동기 및 목표
- 명시적인 3D 공간 가이던스 없이도 복잡한 3D 시점에서 3D 일관성 있고 생성형 객체 삽입을 해결하는 열린 과제를 다루기 위해.
- 기존 3D 편집 방법이 2D 편집 일관성 부족과 공간 제어 부족으로 인해 객체 삽입에 실패하는 한계를 극복하기 위해.
- 최소한의 사용자 입력을 통해 시점의 외관, 기하학적 구조, 공간적 맥락을 존중하는 국소화되고 시점 인식 가능한 객체 생성을 가능하게 하기 위해.
- 2D 디퓨전 사전 지식과 단일 시점 3D 복원을 통합해 강력한 3D 객체 삽입을 위한 방법을 개발하기 위해.
제안 방법
- NeRF로 재구성된 시점의 기준 시점에서 2D 편집을 통해 3D 객체 삽입 작업을 정의하고, 텍스트 프롬프트와 2D 경계 상자를 공간적 및 의미적 가이던스로 사용한다.
- 목표 객체를 기준 시점 내에서 생성하기 위해 2D 텍스트-이미지 디퓨전 모델을 적용하여 프롬프트와 의미적·시각적 일치를 보장한다.
- 기준 시점에서의 형태와 구조를 유지하면서 단일 시점에서 3D로의 복원 방법을 사용해 2D로 생성된 객체를 3D로 업라이프링한다.
- 단일 시점에서의 깊이 추정을 통해 삽입된 객체의 깊이를 추정하고, 이를 3D 배치 유도 및 다중 시점 간 기하학적 일관성 확보에 활용한다.
- 객체 크기와 깊이를 고려한 밀도 스케일링 전략을 사용해 재구성된 객체 NeRF와 원본 시점 NeRF를 융합하여 시각적 조화를 확보한다.
- 최종 3D 시점에서 조명, 텍스처, 시점 일관성 향상을 위해 Instruct-NeRF2NeRF를 사용한 선택적 보정 단계를 적용한다.
실험 결과
연구 질문
- RQ1명시적인 3D 공간 입력 없이도 단일 2D 경계 상자와 텍스트 프롬프트만을 사용해 복잡한 3D 시점에서 3D 일관성 있는 객체 삽입이 가능한가?
- RQ22D 디퓨전 모델은 다중 시점 간 기하학적·시각적 일관성을 확보한 3D 객체 생성에 어떻게 기여할 수 있는가?
- RQ3단일 2D 기준 시점만 제공될 경우 깊이 추정이 삽입된 객체의 정확한 3D 배치에 어떤 역할을 하는가?
- RQ4시점과 객체 NeRF 표현을 융합하는 제안된 전략은 시각적 현실감과 일관성에 어떤 영향을 미치는가?
- RQ5이러한 방법은 국소화된 생성형 객체 삽입에서 기존의 2D 기반 및 3D 기반 편집 베이스라인을 얼마나 능가하는가?
주요 결과
- InseRF는 텍스트 프롬프트와 단일 2D 경계 상자만을 사용해 다양한 3D 일관성 있는 객체를 복잡한 3D 시점에 삽입하여 국소화된 편집을 수행하면서도 전반적인 시점 왜곡 없이 성공적으로 수행한다.
- Instruct-NeRF2NeRF 및 다중 시점 인painting 베이스라인 대비 객체 삽입에서 성능을 뛰어넘으며, 전반적인 시점 변경과 3D 플로ater를 방지한다.
- 스케일 및 반지름 최적화가 객체 배치 정확도를 크게 향상시켜 기준 시점과의 깊이 및 크기 일치를 더욱 현실적으로 구현한다.
- NeRF 융합 과정에서 객체 밀도 스케일링을 통해 시각적 아티팩트를 방지하고 삽입된 객체의 적절한 렌더링을 보장한다.
- 선택적 보정 단계는 텍스처 세부 정보와 조명을 향상시켜 현실감과 시점과의 조화를 개선한다.
- 시각적 아블레이션 결과는 제안된 2D 기반 정렬 전략이 일관되고 국소화된 삽입을 가능하게 하며, 베이스라인은 일관성 없는 2D 편집과 3D 제어 부족으로 실패함을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.