Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Scene Flow Fields for Space-Time View Synthesis of Dynamic Scenes

Zhengqi Li, Simon Niklaus|arXiv (Cornell University)|2020. 11. 26.
Advanced Vision and Imaging참고 문헌 76인용 수 32
한 줄 요약

본 논문은 Neural Scene Flow Fields를 소개하며, monocular 비디오를 위한 시간 변화 신경 표현으로 외관, 기하학, 3D 장면 운동을 함께 모델링하여 시공간에서 새로운 시점을 합성한다.

ABSTRACT

We present a method to perform novel view and time synthesis of dynamic scenes, requiring only a monocular video with known camera poses as input. To do this, we introduce Neural Scene Flow Fields, a new representation that models the dynamic scene as a time-variant continuous function of appearance, geometry, and 3D scene motion. Our representation is optimized through a neural network to fit the observed input views. We show that our representation can be used for complex dynamic scenes, including thin structures, view-dependent effects, and natural degrees of motion. We conduct a number of experiments that demonstrate our approach significantly outperforms recent monocular view synthesis methods, and show qualitative results of space-time view synthesis on a variety of real-world videos.

연구 동기 및 목표

  • 동기: 알려진 카메라 포즈를 가진 단일 단안 비디오에서 새로운 뷰 합성과 시간 보간을 가능하게 한다.
  • 목표: 3D 운동(장면 흐름)과 외관/밀도를 포함하는 공간과 시간의 연속 함수로 동적 장면을 모델링한다.
  • 목적: 비가시화(disocclusions)와 운동 경계 처리를 하면서 입력 뷰에 맞도록 신경 표현을 최적화한다.

제안 방법

  • 동적 장면을 색상, 밀도, 순방향 및 역방향 3D 장면 흐름, 그리고 비가시화 가중치를 출력하는 Neural Scene Flow Fields로 표현한다.
  • 시간 확장된 MLP를 사용해 (x, d, i)를 (c, sigma, F_i, W_i)로 매핑한다.
  • 예측된 장면 흐름을 통해 이웃 시점 뷰를 대상 시점으로 왜곡하여 시간적 광도 일관성 손실을 최적화한다.
  • 운동 경계를 다루기 위해 비가시화 가중치를 포함하고, 장면 흐름에 대한 L1 정규화 및 사이클 일관성을 적용한다.
  • 정적 영역에서 렌더링 품질을 높이기 위해 학습된 블렌딩 가중치 v로 동적 및 정적 장면 표현을 결합한다.
  • 예측된 흐름으로 시점 i와 i+1을 결합하는 스플래팅 기반 평면 스윕 볼륨 렌더링으로 시공간 보간을 가능하게 한다.
  • COLMAP에서 도출된 카메라 파라미터로 씬당 학습하고, 초기화에 대한 선택적 데이터 기반 사전 정보, 데이터 사전 정보 및 기하학적 일관성을 포함한 다항적 손실을 사용한다.

실험 결과

연구 질문

  • RQ1알려진 카메라 포즈가 있는 단안 비디오를 사용하여 동적 장면의 새로운 시점뿐만 아니라 새로운 시간도 합성할 수 있는가?
  • RQ2신경망 기반의 조밀한 3D 장면 흐름 필드가 정적 또는 순수 뷰 기반 방법보다 운동 경계와 비가시화를 더 잘 포착하는가?
  • RQ3정적 및 동적 장면 표현을 통합하면 정적 영역의 렌더링 품질이 향상되면서도 동적 충실도가 보존되는가?
  • RQ4간단한 프레임 블렌딩 대신 예측된 3D 장면 흐름과 스플랫 렌더링으로 시간 보간을 달성할 수 있는가?

주요 결과

  • 제안된 동적 표현은 Nvidia Dynamic Scenes 데이터셋에서 단안 및 다중 뷰의 최첨단 베이스라인을 상회하며 새로운 시점 합성 및 시점-시간 합성에 대해 우수하다.
  • 정적 장면 구성요소를 추가하면 렌더링 품질이 향상되며 특히 정적 영역에서 최대 약 30%의 개선을 보인다.
  • 절단 실험에서 정적 통합과 모든 손실을 포함한 전체 모델이 동적 및 전체 장면 평가에서 최상의 SSIM/PSNR/LPIPS를 달성한다.
  • 장면 흐름 기반 워핑을 이용한 시공간 렌더링은 간단한 2D 프레임 보간이나 순수 정적 방법에 비해 중간 시간에서 우수한 결과를 낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.