Skip to main content
QUICK REVIEW

[논문 리뷰] Do 2D GANs Know 3D Shape? Unsupervised 3D shape reconstruction from 2D Image GANs

Xingang Pan, Bo Dai|arXiv (Cornell University)|2020. 11. 02.
Generative Adversarial Networks and Image Synthesis참고 문헌 43인용 수 51
한 줄 요약

이 논문은 RGB 이미지에서 훈련된 일반 2D GAN이 잠재적인 3D 기하학 신호를 포함하고 있어, 약한 형태 사전과 미분 가능 렌더링으로 GAN 이미지 매니폴드를 반복적으로 탐색함으로써 단일 이미지로부터의 비지도 3D 형태 재구성을 가능하게 한다.

ABSTRACT

Natural images are projections of 3D objects on a 2D image plane. While state-of-the-art 2D generative models like GANs show unprecedented quality in modeling the natural image manifold, it is unclear whether they implicitly capture the underlying 3D object structures. And if so, how could we exploit such knowledge to recover the 3D shapes of objects in the images? To answer these questions, in this work, we present the first attempt to directly mine 3D geometric cues from an off-the-shelf 2D GAN that is trained on RGB images only. Through our investigation, we found that such a pre-trained GAN indeed contains rich 3D knowledge and thus can be used to recover 3D shape from a single 2D image in an unsupervised manner. The core of our framework is an iterative strategy that explores and exploits diverse viewpoint and lighting variations in the GAN image manifold. The framework does not require 2D keypoint or 3D annotations, or strong assumptions on object shapes (e.g. shapes are symmetric), yet it successfully recovers 3D shapes with high precision for human faces, cats, cars, and buildings. The recovered 3D shapes immediately allow high-quality image editing like relighting and object rotation. We quantitatively demonstrate the effectiveness of our approach compared to previous methods in both 3D shape reconstruction and face rotation. Our code is available at https://github.com/XingangPan/GAN2Shape.

연구 동기 및 목표

  • 사전에 사전 학습된 2D GAN이 본질적으로 3D 기하를 포착하는지 확인한다.
  • 2D 키포인트나 3D 주석 없이 단일 2D 이미지로부터 3D 형태를 재구성하는 비지도 파이프라인을 개발한다.
  • GAN에서 도출된 3D 형태를 이용한 회전 및 재조명과 같은 3D 인식 이미지 조작을 가능하게 한다.
  • 기존의 비지도 3D 재구성 방법과 비교하고 교차 카테고리 적용 가능성을 시연한다.

제안 방법

  • 대상 이미지의 깊이를 초기화하기 위해 약한 볼록 형태 사전(타원체)을 사용한다.
  • 현재 깊이/반사율을 이용해 임의의 시점과 조명으로 의사 샘플을 렌더링한 뒤, 이 샘플들을 GAN 역화를 통해 GAN 매니폴트 내부의 투영 샘플로 얻는다.
  • 투영된 샘플이 재구성된 투영과 일치하도록 깊이, 반사율, 시점, 광원을 함께 최적화하는 시각-기하 자동인코딩 파이프라인으로 3D 형상을 학습한다.
  • 더 미세한 디테일을 포착하도록 3D 형상과 네트워크를 사이클 간에 반복적으로 다듬는다.
  • GAN의 잠재 코드가 중간 잠재 공간에 머물도록 제약된 잠재 오프셋 전략을 도입해 재구성 품질을 향상시킨다.
  • 원한다면 상대 잠재 오프셋을 사용하여 더 나은 일반화로 다중 인스턴스 공동 학습으로 확장한다.

실험 결과

연구 질문

  • RQ1RGB 이미지에서 학습된 2D GAN이 얼굴, 자동차, 건물과 같은 객체의 3D 기하를 암묵적으로 인코딩하는가?
  • RQ2비지도 파이프라인이 GAN 이미지 매니폴드와 약한 형태 사전을 활용하여 단일 2D 이미지로부터 정확한 3D 형태를 재구성할 수 있는가?
  • RQ3형태 사전과 잠재 규제가 3D 재구성 품질 및 대칭 가정에 어떠한 영향을 미치는가?
  • RQ4복원된 3D 형태가 회전 및 재조명과 같은 3D 인식 조작을 얼마나 잘 가능하게 하는가?
  • RQ5제안된 방법이 표준 벤치마크에서 기존의 비지도 3D 형태 학습 방법과 어떻게 비교되는가?

주요 결과

  • 이 방법은 단일 이미지로부터 얼굴, 고양이, 자동차 및 건물의 3D 형태를 높은 충실도로 재구성한다.
  • Unsup3d와 비교하여 비대칭성 및 큰 시점 변화에 더 잘 대응하고 대칭성 가정에 의존하지 않는다.
  • BFM에서의 정량적 결과는 베이스라인 대비 SIDE 및 MAD 지표가 유리하며, 키포인트나 3D 감독 없이도 3D 재구성이 향상됨을 보여준다.
  • 회전 및 재조명과 같은 현실적인 3D 인식 조작이 가능하며, 이는 기초 3D 기하학과 밀접하게 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.