Skip to main content
QUICK REVIEW

[논문 리뷰] im2nerf: Image to Neural Radiance Field in the Wild

Mi Lu, Abhijit Kundu|arXiv (Cornell University)|2022. 09. 08.
Advanced Vision and Imaging인용 수 7
한 줄 요약

im2nerf는 단일의 포즈가 지정되지 않은 외부 환경 이미지에서, 분리된 형태, 외관 및 카메라 자세 코드를 사용하여 연속적인 신경 렌디언스 필드(네RF)를 예측하는 자기지도 학습 프레임워크를 제안한다. 적대적 손실, 대칭성, 시나리오 박스 제약 조건 및 사이클 자세 일致성과 같은 기법들을 활용하여, 다중 시점 감독 또는 3D 애너테이션 없이도 최신 기술 수준의 새로운 시점 합성 성능을 달성한다.

ABSTRACT

We propose im2nerf, a learning framework that predicts a continuous neural object representation given a single input image in the wild, supervised by only segmentation output from off-the-shelf recognition methods. The standard approach to constructing neural radiance fields takes advantage of multi-view consistency and requires many calibrated views of a scene, a requirement that cannot be satisfied when learning on large-scale image data in the wild. We take a step towards addressing this shortcoming by introducing a model that encodes the input image into a disentangled object representation that contains a code for object shape, a code for object appearance, and an estimated camera pose from which the object image is captured. Our model conditions a NeRF on the predicted object representation and uses volume rendering to generate images from novel views. We train the model end-to-end on a large collection of input images. As the model is only provided with single-view images, the problem is highly under-constrained. Therefore, in addition to using a reconstruction loss on the synthesized input view, we use an auxiliary adversarial loss on the novel rendered views. Furthermore, we leverage object symmetry and cycle camera pose consistency. We conduct extensive quantitative and qualitative experiments on the ShapeNet dataset as well as qualitative experiments on Open Images dataset. We show that in all cases, im2nerf achieves the state-of-the-art performance for novel view synthesis from a single-view unposed image in the wild.

연구 동기 및 목표

  • 다중 시점 일致성과 3D 감독이 제공되지 않는 외부 환경의 단일 포즈가 지정되지 않은 이미지에서 3D 신경 렌디언스 필드를 학습하는 문제를 해결하기 위해.
  • 세그멘테이션과 이미지 수준의 감독만을 사용하여 단일 이미지에서 형태, 외관 및 카메라 자세를 분리된 3D 표현으로 학습하기 위해.
  • 보조 메타감독 신호(예: 대칭성, 시나리오 구조, 자세 일치성 등)를 도입하여, 매우 제약이 많은 조건에서도 일반화 능력과 현실감 있는 새로운 시점 합성 성능를 향상시키기 위해.
  • 풍부한 레이블이 없는 데이터를 활용하여 1%의 자세 애너테이션만을 사용하는 약한 감독 학습을 통해 전체 감독 학습 성능에 근접한 성능를 달성하기 위해.

제안 방법

  • 모델은 오토인코더 기반 아키텍처를 사용한다: 인코더는 입력 이미지를 형태 코드, 외관 코드 및 예측된 카메라 자세로 분리한다.
  • 네RF 유사 디코더는 부피 렌더링을 사용하여 예측된 형태 코드, 외관 코드 및 카메라 자세를 조건으로 하여 새로운 시점을 합성한다.
  • 학습 과정에서는 입력 시점에 대한 재구성 손실, 새로운 시점 렌더링에 대한 적대적 손실, 기하학적 일관성 향상을 위한 대칭성 정규화를 적용한다.
  • 렌더링된 새로운 시점을 재인코딩하여 원래의 카메라 자세를 예측함으로써 사이클 일관성 손실을 적용하여 기하학적 타당성을 강화한다.
  • 시나리오 박스 제약 조건을 사용하여 3D 형태 및 카메라 자세 예측이 타당한 공간 범위 내에 유지되도록 정규화한다.
  • ShapeNet 및 Open Images와 같은 대규모 데이터셋에서 3D 감독 또는 다중 시점 입력 없이도 엔드 투 엔드로 프레임워크를 학습한다.

실험 결과

연구 질문

  • RQ1다중 시점 감독 없이, 외부 환경의 단일 포즈가 지정되지 않은 이미지를 사용하여 연속적인 3D 신경 렌디언스 필드를 예측할 수 있는가?
  • RQ2세계 지식(예: 대칭성, 시나리오 구조, 자세 일치성 등)에서 유도된 메타감독 신호는 단일 이미지에서의 3D 복원에 어떻게 기여하는가?
  • RQ3적대적 학습과 사이클 일관성 손실은 새로운 시점 합성의 현실감과 기하학적 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4Open Images와 같은 실제 세계 데이터셋에서 자세 애너테이션을 최소로 사용할 경우, 모델은 얼마나 잘 일반화되는가?

주요 결과

  • im2nerf는 ShapeNet 3D-R2N2 데이터셋에서 최신 기술 수준의 새로운 시점 합성 성능를 달성하였으며, 항공기 카테고리에서 PSNR가 22.2로 이전 방법들보다 뚜렷이 뛰어나다.
  • Open Images 데이터셋에서의 정성적 결과는, Ye 등 [48] 및 PrGAN과 같은 베이스라인 대비 im2nerf가 더 현실적이고 일관성 있는 새로운 시점을 생성한다는 것을 보여준다.
  • 절단 실험 결과, 적대적 손실, 시나리오 박스, 사이클 자세 일관성은 성능 향상에 핵심적인 역할을 하며, 각각 현실감과 기하학적 일관성 향상에 기여한다.
  • 약한 감독 설정에서 1%의 자세 애너테이션만을 사용할 경우, im2nerf는 전체 감독 학습 성능에 근접한 성능를 달성하여 뛰어난 데이터 효율성을 입증한다.
  • 자동차 및 항공기와 같은 다양한 객체 카테고리에 대해 우수한 일반화 능력을 보이며, ShapeNet 및 Open Images에서의 정성적 결과를 통해 이를 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.