[논문 리뷰] Non-Rigid Neural Radiance Fields: Reconstruction and Novel View Synthesis of a Dynamic Scene From Monocular Video
NR-NeRF는 레이 굴절을 통해 장면 기하학을 정준 신경 렌디언스 필드와 시간에 따라 변하는 변형 필드로 분리하여 단일 단안 영상에서 일반적인 비정형 동적 장면의 고해상도 재구성과 새로운 시점 합성을 가능하게 한다. 이 방법은 정확하고 시점 일致성 있는 렌더링을 달성하며, 명시적 지도 학습 없이도 운동 과장 및 배경 안정화와 같은 고급 편집 기능을 제공한다.
We present Non-Rigid Neural Radiance Fields (NR-NeRF), a reconstruction and novel view synthesis approach for general non-rigid dynamic scenes. Our approach takes RGB images of a dynamic scene as input (e.g., from a monocular video recording), and creates a high-quality space-time geometry and appearance representation. We show that a single handheld consumer-grade camera is sufficient to synthesize sophisticated renderings of a dynamic scene from novel virtual camera views, e.g. a `bullet-time' video effect. NR-NeRF disentangles the dynamic scene into a canonical volume and its deformation. Scene deformation is implemented as ray bending, where straight rays are deformed non-rigidly. We also propose a novel rigidity network to better constrain rigid regions of the scene, leading to more stable results. The ray bending and rigidity network are trained without explicit supervision. Our formulation enables dense correspondence estimation across views and time, and compelling video editing applications such as motion exaggeration. Our code will be open sourced.
연구 동기 및 목표
- 단일 단안 영상만을 사용하여 일반적인 비정형 동적 장면의 자유 시점 렌더링 문제를 해결한다.
- 단안 영상의 심각한 과소약속 조건을 극복하기 위해 시간에 따라 변하는 변형에서 장면 기하학을 분리한다.
- 명시적 지도 학습 없이도 고품질의 새로운 시점 합성과 영상 편집(예: 운동 과장, 배경 안정화)을 가능하게 한다.
- 정준 볼륨과 변형 모델링을 통해 시간과 시점 간 기하학적 및 외관 일致성을 유지한다.
- 어려운 새로운 카메라 궤적과 가림 영역에서도 안정적이고 아티팩트 없는 렌더링을 달성한다.
제안 방법
- 동적 장면을 정준 신경 렌디언스 필드(정적 MLP)와 시간에 따라 변하는 레이 굴절을 통해 비정형적으로 변형시키는 변형 필드로 표현한다.
- 3D 점 샘플과 영상별 잠재 코드를 입력으로 받아 비정형 레이 이동을 계산하는 레이 굴절 MLP를 사용해 변형을 모델링한다.
- 정점별 강성 점수를 할당하여 지도 학습 없이도 정적 영역를 유지하는 강성 네트워크를 도입한다.
- 단일 단안 RGB 관측과 가시화 가능한 렌더링을 사용하여 정준 볼륨과 변형 필드를 함께 학습한다.
- 변형 크기와 국소 형태 유지에 대한 정규화를 적용하여, 특히 가림 영역에서의 안정성을 확보한다.
- 변형 스케일 조작(과장/감쇠), 시간 간섭, 강성 임계값을 통한 강제적 배경 안정화를 통해 편집을 가능하게 한다.
실험 결과
연구 질문
- RQ1단일 단안 영상로 일반적인 비정형 동적 장면의 공간-시간 일관성 있는 고해상도 표현을 재구성하는 데 충분한가?
- RQ2단안 영상에서 자율 지도 학습 방식으로 변형과 기하학을 어떻게 분리할 수 있는가?
- RQ3강성 인식 변형 모델링이 동적 장면의 새로운 시점 합성에서 안정성 향상과 아티팩트 감소에 기여하는가?
- RQ4학습된 표현이 운동 과장 및 시간 초해상도와 같은 고급 영상 편집 작업을 어느 정도 지원할 수 있는가?
- RQ5어려운 새로운 카메라 궤적과 가림 영역 존재 조건에서 이 방법은 어떻게 성능을 발휘하는가?
주요 결과
- NR-NeRF는 단안 영상에서 고해상도의 새로운 시점 합성을 달성하여 '버블 타임' 효과와 새로운 시공간 궤적을 따라 안정적인 렌더링을 가능하게 한다.
- 전경-배경 애너테이션 없이도 강성 점수를 학습하여 배경 렌더링을 안정적으로 구현한다.
- 변형 오프셋 스케일 조정을 통해 운동 과장 및 감쇠를 성공적으로 달성하여 표현력 있는 영상 편집을 가능하게 한다.
- 시간별 잠재 코드의 선형 간섭을 통해 시간 초해상도가 가능해지며, 추가 데이터 없이도 프레임 레이트 향상을 달성한다.
- 기본 모델인 Naïve NR-NeRF와 Neural Volumes에 비해 어려운 새로운 시점 조건에서 배경 안정성과 선명도 면에서 뛰어난 성능을 발휘한다.
- 다양한 동적 장면, 특히 인간 운동과 복잡한 변형에 대해 잘 일반화되며, 대부분의 경우 최소한의 아티팩트로 우수한 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.