[논문 리뷰] Learning Object-Compositional Neural Radiance Field for Editable Scene Rendering
이 논문은 오직 정렬된 이미지와 근사적인 2D 인스턴스 마스크만을 사용하여 실세계 환경에서 고해상도의 새로운 시점 합성과 편집 가능한 시cene 렲링을 가능하게 하는 객체 조합형 신경 렌디언스 필드를 제안한다. 두 가지 경로 아키텍처를 도입하여 배경 렌더링을 위한 시cene 브랜치와 학습 가능한 활성화 코드에 조건화된 객체 브랜치를 결합하고, 시cene 유도 학습과 3D 가드 마스크를 통해 음영의 모호성을 해결하고 날카로운 객체 경계를 생성함으로써 정적 시점 합성 및 동적 편집 작업에서 최신 기술 수준의 성능을 달성한다.
Implicit neural rendering techniques have shown promising results for novel view synthesis. However, existing methods usually encode the entire scene as a whole, which is generally not aware of the object identity and limits the ability to the high-level editing tasks such as moving or adding furniture. In this paper, we present a novel neural scene rendering system, which learns an object-compositional neural radiance field and produces realistic rendering with editing capability for a clustered and real-world scene. Specifically, we design a novel two-pathway architecture, in which the scene branch encodes the scene geometry and appearance, and the object branch encodes each standalone object conditioned on learnable object activation codes. To survive the training in heavily cluttered scenes, we propose a scene-guided training strategy to solve the 3D space ambiguity in the occluded regions and learn sharp boundaries for each object. Extensive experiments demonstrate that our system not only achieves competitive performance for static scene novel-view synthesis, but also produces realistic rendering for object-level editing.
연구 동기 및 목표
- 기존의 신경 렌더링 방법이 객체 수준 조작을 지원하지 못하는 실세계의 혼잡한 환경에서 고품질의 편집 가능한 시cene 렌더링을 가능하게 하기 위해.
- 훈련 중에 부분 관찰에서 기인한 객체 경계 학습이 어려운 음영 영역에서 3D 공간의 모호성을 해결하기 위해.
- 실제적인 외관과 기하학을 유지하면서 시cene를 객체 조합형 구성 요소로 분해할 수 있는 신경 렌더링 시스템을 설계하기 위해.
- 정밀한 3D 애너테이션이나 개별 객체 훈련 데이터 없이도 정확한 경계를 가지며 피하기 없는 객체 렌더링을 달성하기 위해.
제안 방법
- 두 경로 아키텍처를 가진 신경 렌디언스 필드: 시cene 브랜치는 전반적인 기하학과 외관을 인코딩하고, 객체 브랜치는 학습 가능한 객체 활성화 코드에 조건화되어 개별 객체를 렌더링한다.
- 편향된 레이 샘플링과 온라인 깊이 예측을 통한 시cene 유도 학습으로 음영 영역에서의 3D 모호성을 해결하여, 네트워크가 음영된 객체 부분을 빈 공간으로 간주하지 않도록 한다.
- 3D 가드 마스크 메커니즘은 객체 바voxels 주변의 공간 경계를 강제로 적용하여 객체의 통합성을 유지함으로써 렌더링 정확도를 향상시킨다.
- 변형된 객체(예: 이동, 회전, 복제)를 객체 브랜치에서, 배경은 시cene 브랜치에서 공동으로 렌더링하여 동적 시cene 편집을 가능하게 한다.
- 2D 인스턴스 마스크를 감독으로 사용하며, 다중 시점 일致성은 훈련 중에 객체 경계를 노이즈 제거하고 정밀하게 다듬는 데 기여한다.
- 객체 브랜치는 국소 표현 능력을 향상시키고 조합형 렌더링 품질을 향상시키기 위해 3D 바voxel 특징을 통합한다.

실험 결과
연구 질문
- RQ1오직 정렬된 이미지와 근사적인 2D 인스턴스 마스크만을 사용하여 실세계의 혼잡한 환경에서 편집 가능한 시cene 렌더링을 지원하는 신경 렌디언스 필드를 훈련시킬 수 있는가?
- RQ2음영 영역에서의 3D 공간 모호성을 어떻게 해결하여 객체 경계의 번짐을 방지하고 날카로운 렌더링을 확보할 수 있는가?
- RQ3어떤 아키텍처 설계가 통합된 프레임워크에서 고해상도 정적 시점 합성과 동적 객체 수준 편집을 모두 가능하게 하는가?
- RQ4시cene 유도 및 3D 가드 마스크는 부분 음영 상태에서 객체 렌더링 품질을 얼마나 향상시키는가?
- RQ5정밀한 3D 애너테이션 없이도 노이즈가 많은 2D 인스턴스 마스크에서 정확하고 매끄러운 객체 경계를 학습할 수 있는가?
주요 결과
- 제안된 방법은 실세계 ScanNet 환경에서 최신 기술 수준의 방법들과 비교해 표준 신규 시점 합성 메트릭(PSNR, SSIM, LPIPS)에서 경쟁력 있거나 뛰어난 성능을 달성한다.
- 시cene 유도와 3D 가드 마스크를 적용한 결과, ScanNet 0038의 음영된 객체에서 PSNR가 34.435에 도달하여 기준 설정보다 뚜렷이 뛰어나다.
- ε = 0.05인 3D 가드 마스크가 가장 뛰어난 렌더링 품질을 보였으며, 다양한 ε 값에 대해 결과가 안정적이어서 하이퍼파라미터 선택에 대해 낮은 민감도를 보였다.
- 객체 바voxel 특징(f_obj)은 렌더링 품질을 향상시켜 학습 가능한 3D 특징이 객체 특수 세부 정보를 표현하는 데 모델의 능력을 향상시킨다는 것을 입증한다.
- 정확한 3D 애너테이션 없이도 근사적인 2D 인스턴스 마스크만을 사용함에도 불구하고, 매끄럽고 고해상도의 2D 객체 세그멘테이션과 날카로운 객체 렌더링을 생성하여 2D 감독에서 3D 구조를 효과적으로 추론할 수 있음을 시사한다.
- 시각화 결과는 입력 마스크가 노이즈가 많거나 진동이 심한 경우에도 모델이 정확한 객체 경계와 세부 정보(예: 의자 손잡이)를 성공적으로 학습했음을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.