[논문 리뷰] CLIP-NeRF: Text-and-Image Driven Manipulation of Neural Radiance Fields
CLIP-NeRF는 CLIP의 공동 임베딩 공간을 활용하여 텍스트 및 이미지 기반 신경 렌디언스 필드(네루프) 조작을 위한 통합 프레임워크를 제안한다. 분리 조건부 네루프 아키텍처를 사용하며, 별도의 형태 및 외관 코드를 갖추고, CLIP 임베딩을 잠재 편집으로 변환하는 피드포워드 코드 매핑기로 안내하여, 실사 이미지 역전치와 시점 일致성 결과를 얻는 빠르고 제어 가능하며 고해상도의 3D 편집을 가능하게 한다.
We present CLIP-NeRF, a multi-modal 3D object manipulation method for neural radiance fields (NeRF). By leveraging the joint language-image embedding space of the recent Contrastive Language-Image Pre-Training (CLIP) model, we propose a unified framework that allows manipulating NeRF in a user-friendly way, using either a short text prompt or an exemplar image. Specifically, to combine the novel view synthesis capability of NeRF and the controllable manipulation ability of latent representations from generative models, we introduce a disentangled conditional NeRF architecture that allows individual control over both shape and appearance. This is achieved by performing the shape conditioning via applying a learned deformation field to the positional encoding and deferring color conditioning to the volumetric rendering stage. To bridge this disentangled latent representation to the CLIP embedding, we design two code mappers that take a CLIP embedding as input and update the latent codes to reflect the targeted editing. The mappers are trained with a CLIP-based matching loss to ensure the manipulation accuracy. Furthermore, we propose an inverse optimization method that accurately projects an input image to the latent codes for manipulation to enable editing on real images. We evaluate our approach by extensive experiments on a variety of text prompts and exemplar images and also provide an intuitive interface for interactive editing. Our implementation is available at https://cassiepython.github.io/clipnerf/
연구 동기 및 목표
- 자연어 또는 기준 이미지를 사용하여 사용자 친화적인 네루프 3D 콘텐츠 조작을 가능하게 하기 위해.
- 각 씬 별 최적화 및 다중 시점 의존성로 인해 수정이 어려운 암묵적 네루프 표현을 편집하는 데 도전하기 위해.
- 조건부 잠재 공간 아키텍처를 사용하여 네루프에서 형태와 외관 제어를 분리하기 위해.
- 실사 이미지를 조건부 네루프 모델의 잠재 공간으로 역전치하여 실세계 데이터의 편집을 가능하게 하기 위해.
- 지표 없이 CLIP 기반 손실을 사용하여 고해상도, 시점 일치 편집을 달성하기 위해.
제안 방법
- 형태는 위치 인코딩에 적용되는 학습된 변형 필드를 통해 제어되고, 외관은 체적 렌더링 중에 조절되는 분리 조건부 네루프 아키텍처를 제안한다.
- 텍스트 또는 이미지에서 온 CLIP 임베딩을 형태 및 외관 잠재 코드로 매핑하는 두 개의 피드포워드 코드 매핑기를 설계하여, 빠른 추론을 가능하게 한다.
- 입력 프롬프트 또는 이미지의 의미적 내용과 렌더링 결과를 일치시키기 위해 CLIP 기반 매칭 손실을 사용하여 편집 일관성을 보장한다.
- 단일 실사 이미지에서 형태 및 외관 잠재 코드를 추론하기 위한 역최적화 방법을 도입하여, 실세계 데이터의 편집을 가능하게 한다.
- 지속적인 편집을 위해 잠재 공간에서 형태와 외관을 순차적으로 수정할 수 있으며, 잠재 공간 내 편집 방향에 따라 보간 및 스케일링이 가능하다.
- 학습 중에 CLIP 손실을 계산하기 위해 패치 기반 레이 샘플러를 사용하여 생성된 뷰와 입력 제약 조건 간의 일치도를 향상시킨다.
실험 결과
연구 질문
- RQ1통합 프레임워크가 고해상도 및 시점 일치성을 갖춘 네루프의 텍스트 및 이미지 기반 편집을 가능하게 할 수 있는가?
- RQ2조건부 네루프 아키텍처에서 형태와 외관을 효과적으로 분리하여 독립적인 조작이 가능한가?
- RQ3fine-tuning 없이 CLIP 임베딩을 잠재 코드로 효과적으로 매핑하여 정확하고 일반화 가능한 3D 편집이 가능한가?
- RQ4실사 이미지를 조건부 네루프의 잠재 공간으로 역전치하여 실세계 3D 콘텐츠의 편집이 가능한가?
- RQ5잠재 공간 내 스케일링 및 보간이 직관적이고 점진적인 편집 효과를 생성하는가?
주요 결과
- 텍스트 프롬프트 또는 예시 이미지만으로도 고품질의 시점 일치 3D 편집을 달성하며, 결과는 의미적 일치도와 시각적 타당성을 보여준다.
- CLIP 기반 손실을 통해 지표 없이도 네루프의 외관 및 형태를 제로샷 편집이 가능하며, LLFF 데이터셋에서 검증되었다.
- 피드포워드 코드 매핑기가 빠른 추론을 가능하게 하여, 동일 카테고리의 다수 객체에 대한 편집에서 최적화 기반 베이스라인보다 빠른 성능을 보였다.
- 역전치 방법은 실사 이미지를 성공적으로 잠재 공간으로 투영하여, 일관된 기하학적 구조와 외관을 갖춘 실세계 3D 콘텐츠의 편집을 가능하게 하였다.
- 편집 방향에 따라 스케일링은 점진적이고 직관적인 편집 효과를 생성하였고, 잠재 공간 내 보간은 형태와 외관 간의 부드러운 전이를 얻는 데 성공하였다.
- 절단 실험 결과, 잠재 공간 제약 없이 단일 네루프를 직접 편집하는 것은 형태 편집에 실패하는 것으로 나타나, 분리된 잠재 표현의 필요성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.