Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Rerendering in the Wild

Moustafa Meshry, Dan B Goldman|ArXiv.org|2019. 04. 08.
Advanced Vision and Imaging참고 문헌 45인용 수 9
한 줄 요약

이 논문은 인터넷 사진만을 사용하여 관광 명소를 현실적으로, 외관 제어가 가능한 렌더링을 가능하게 하는 신경망 렌더링 프레임워크를 제안한다. 3D 포인트 클러스터 프록시를 재구성하고, 외관 및 의미 조건을 갖춘 지연 렌더링 버퍼에 조건부 GAN을 훈련시킴으로써, 다양한 조명 및 일시적 조건에서도 고해상도의 시점 및 외관 보간을 달성하며, 트레비 및 파나소니언을 포함한 여러 데이터셋에서 이전 방법들을 능가한다.

ABSTRACT

We explore total scene capture -- recording, modeling, and rerendering a scene under varying appearance such as season and time of day. Starting from internet photos of a tourist landmark, we apply traditional 3D reconstruction to register the photos and approximate the scene as a point cloud. For each photo, we render the scene points into a deep framebuffer, and train a neural network to learn the mapping of these initial renderings to the actual photos. This rerendering network also takes as input a latent appearance vector and a semantic mask indicating the location of transient objects like pedestrians. The model is evaluated on several datasets of publicly available images spanning a broad range of illumination conditions. We create short videos demonstrating realistic manipulation of the image viewpoint, appearance, and semantic labeling. We also compare results with prior work on scene reconstruction from internet photos.

연구 동기 및 목표

  • 공개된 인터넷 사진만을 사용하여 어떤 외관 조건에서도 장면을 기록하고 재렌더링할 수 있는 총합 장면 캡처를 가능하게 하기 위해.
  • 기존 3D 재구성 기법의 한계를 해결하기 위해, 현실적이지 않은 렌더링과 외관 다양성이 결여된 결과를 낳는 기존 방법의 문제를 해결하기 위해.
  • 명시적인 3D 프록시를 사용하여 입력 이미지를 시점, 외관, 의미적 콘텐츠로 분해함으로써 제어력과 현실감을 향상시키기 위해.
  • 프록시 스타일 손실을 사용해 외관 인코더를 사전 훈련함으로써 잠재 공간의 품질과 모델 일반화 능력을 향상시키는 단계적 훈련 전략을 개발하기 위해.

제안 방법

  • 논문은 인터넷 사진에서 3D 재구성을 시작하여 조밀하고 노이지가 많은 포인트 클러스터를 3D 프록시로 생성한다.
  • 각 입력 이미지에 대해, 포인트 클러스터에서 깊이, 색상, 의미 레이블을 저장하는 딥 프레임버퍼(지연 렌더링 버퍼)가 렌더링된다.
  • 조건부 GAN 기반의 재렌더링 네트워크는 딥 프레임버퍼, 잠재 외관 벡터, 의미 마스크를 입력으로 받아 현실적인 이미지를 생성한다.
  • 재렌더링 네트워크를 조건화하기 위해, 외관 인코더는 프록시 스타일 기반 손실(예: 인지적 손실)을 사용해 사전 훈련된 후 동결되어 사용된다.
  • 단계적 훈련은 외관 인코더를 사전 훈련한 후 고정된 임베딩을 사용해 재렌더링 네트워크를 훈련하고, 이후 두 네트워크를 공동으로 미세조정하는 방식이다.
  • 의미 마스크는 네트워크가 일시적 객체(예: 보행자)를 무시하거나 제거하도록 조건화하여 강건성 향상과 사람 없는 렌더링을 가능하게 한다.

실험 결과

연구 질문

  • RQ1무질서한 인터넷 사진만을 사용하여 신경망 재렌더링 시스템이 다양한 외관 조건에서 장면의 사진 수준의 현실적인 이미지를 생성할 수 있는가?
  • RQ2프록시 외관 손실을 사용한 단계적 훈련이 종단 간 훈련에 비해 분리된 의미 있는 외관 잠재 공간을 학습하는 데 얼마나 효과적인가?
  • RQ3의미 조건화가 약한 재구성된 장면에서 일시적 객체와 기하학적 아티팩트를 처리하는 데 모델의 능력을 얼마나 향상시킬 수 있는가?
  • RQ4다양한 조명, 날씨, 일출/일몰 조건에서 시점 및 외관 보간 성능은 어떻게 되는가?
  • RQ5특수한 획득 장비 없이 3D 포인트 클러스터 프록시만을 사용할 때, 이전 작업보다 더 나은 결과를 달성할 수 있는가?

주요 결과

  • 모델은 트레비, 파나소니언, 두브로브니크 데이터셋에서 바이클리검(BicycleGAN) 기준선을 능가하는 높은 수준의 시점 및 외관 보간 성능을 달성한다. 특히 추정된 세그먼테이션 마스크를 사용하는 상황에서도 성능이 유지된다.
  • 외관 사전 훈련을 통한 단계적 훈련 방식은 t-SNE 시각화를 통해 복잡한 구조를 가진 더 의미 있는 잠재 공간을 만들어내며, 미세조정 후 군집이 형성되는 것으로 확인되었다.
  • 실제 환경에서의 추정 세그먼테이션 마스크를 사용하더라도 모델은 강력한 성능을 유지하며, 트레비에서 PSNR 17.90, 파나소니언에서 PSNR 17.29를 기록했다.
  • 초기 렌더링에서 내부 구조가 명확하게 드러나 있음에도 불구하고, 신경망 재렌더링 네트워크는 도색된 영역을 정확히 추론하고 아티팩트를 피하는 데 성공했다. 이는 그림 11에서 확인할 수 있다.
  • 의미 조건화를 통해 시점, 외관, 의미 콘텐츠를 포함한 비디오 스타일의 조작이 가능하며, 사람 없는 렌더링까지 가능하다.
  • 사전 훈련을 통해 학습된 외관 잠재 공간은 초기 단계 대비 품질과 군집화가 향상되었으며, 바이클리검 기준선 수준에 가까워졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.