Skip to main content
QUICK REVIEW

[논문 리뷰] Continuous Object Representation Networks: Novel View Synthesis without Target View Supervision

Nicolai Häni, Selim Engin|arXiv (Cornell University)|2020. 07. 30.
Advanced Vision and Imaging참고 문헌 10인용 수 7
한 줄 요약

이 논문은 연속적이고 미분 가능한 3D 장면 표현을 학습함으로써, 단 두 장의 입력 이미지에서만 새로운 시점의 영상을 합성하는 자기지도 학습 신경망인 연속적 객체 표현 네트워크(CORN)를 제안한다. 변환 체인과 3D 특징 일관성을 자기지도 학습으로 활용함으로써, 3D 진짜값 또는 목표 시점 지도 없이도 최신 기술 수준의 성능을 달성하며, 이전 방법보다 훈련 이미지 수를 50배 줄였다.

ABSTRACT

Novel View Synthesis (NVS) is concerned with synthesizing views under camera viewpoint transformations from one or multiple input images. NVS requires explicit reasoning about 3D object structure and unseen parts of the scene to synthesize convincing results. As a result, current approaches typically rely on supervised training with either ground truth 3D models or multiple target images. We propose Continuous Object Representation Networks (CORN), a conditional architecture that encodes an input image's geometry and appearance that map to a 3D consistent scene representation. We can train CORN with only two source images per object by combining our model with a neural renderer. A key feature of CORN is that it requires no ground truth 3D models or target view supervision. Regardless, CORN performs well on challenging tasks such as novel view synthesis and single-view 3D reconstruction and achieves performance comparable to state-of-the-art approaches that use direct supervision. For up-to-date information, data, and code, please see our project page: https://nicolaihaeni.github.io/corn/.

연구 동기 및 목표

  • 3D 진짜값이나 다중 시점 지도 없이도 객체 인스턴스 간에 일반화 가능한 새로운 시점 영상 합성 방법을 개발하는 것.
  • 각 객체당 두 장의 이미지로만 훈련함으로써 3D 장면 표현 학습의 데이터 의존도를 줄이는 것.
  • 고해상도의 다중 시점 일관성 렌더링을 지원하는 엔드 투 엔드 트레이너블이고 연속적인 3D 장면 표현을 가능하게 하는 것.
  • 제한된 지도 정보에서 자기지도 학습을 통한 3D 재구성과 도메인 외 일반화의 가능성에 대한 실현 가능성을 입증하는 것.

제안 방법

  • CORN은 두 입력 이미지에서 국소적 및 전반적 특징을 인코딩하여 공간적 특징 맵으로 표현함으로써 연속적이고 미분 가능한 3D 표현을 학습한다.
  • 모델은 한 소스 시점에서 다른 시점으로 특징을 매핑하기 위해 변환 체인을 사용하며, 이를 통해 3D 특징 일관성을 자기지도 학습으로 강제한다.
  • 차별 가능한 신경 렌더러를 통해 은닉 3D 표현에서 새로운 시점을 렌더링함으로써 엔드 투 엔드 학습을 가능하게 한다.
  • 다중 시점 일관성은 순환 일관성 방식으로 강제된다: 특징이 시점 A에서 B로, 다시 A로 변환되며 재구성 오차를 최소화한다.
  • 아키텍처는 조건부이므로 테스트 시 잠재 변수 최적화 없이도 단일 이미지에서 빠른 추론이 가능하다.
  • 비어 있는 표현(예: 볼륨 또는 점군)을 피함으로써 임의의 공간 해상도를 지원하고 메모리 오버헤드를 감소시킨다.

실험 결과

연구 질문

  • RQ13D 지도 없이도 단 두 장의 이미지에서만 3D 일관성 있는 장면 표현을 학습할 수 있는가?
  • RQ2특징 일관성과 변환 체인을 통한 자기지도 학습이 지도 학습 방법과 비교해 유사한 성능을 달성할 수 있는가?
  • RQ3학습 중에 볼 수 없었던 도메인 외의 자세나 실제 세계 이미지에서 새로운 시점으로 일반화할 수 있는가?
  • RQ4단일 입력 이미지와 학습된 표현만으로도 고품질의 단일 시점 3D 재구성을 수행할 수 있는가?

주요 결과

  • CORN은 각 객체당 단 두 장의 훈련 이미지만으로도 최신 기술 수준의 성능을 달성하며, 수십 장의 이미지와 직접적인 목표 시점 지도가 필요한 기존 방법들을 능가한다.
  • 모델은 합성 ShapeNet 데이터로 훈련된 후에도 Cars 데이터셋의 실제 세계 이미지에 잘 일반화되어 도메인 전이 능력을 입증했다.
  • 단일 입력 이미지에서의 단일 시점 3D 재구성은 전반적인 형태와 세부 구조를 정확히 포착하는 고품질의 3D 재구성을 제공한다.
  • 원천 이미지가 유사하거나 겹치지 않는 시점에서조차도 기하학적 및 광학적 일관성이 강하게 유지된다.
  • 최신 기술 수준의 지도 학습 방법보다 데이터 요구량을 50배 줄였지만 성능은 이를 맞추거나 초월한다.
  • 변환 체인과 3D 특징 일관성에 기반한 자기지도 학습 방식은 지나친 해법을 피하고 안정적이며 의미 있는 3D 표현 학습을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.