Skip to main content
QUICK REVIEW

[논문 리뷰] SharinGAN: Combining Synthetic and Real Data for Unsupervised Geometry Estimation

Koutilya Pnvr, Hao Zhou|arXiv (Cornell University)|2020. 06. 07.
Advanced Vision and Imaging참고 문헌 50인용 수 11
한 줄 요약

SharinGAN은 합성 이미지와 실재 이미지를 공유되는 작업에 관련된 표현으로 매핑함으로써 비지도 기하 추정을 향상시키는 새로운 도메인 적응 프레임워크를 제안한다. 작업에 관련된 도메인 특화 특징을 유지하면서도 이러한 특징들에서의 도메인 갭을 최소화하도록 생성자를 훈련시킴으로써, 레이블이 부여된 실재 데이터가 필요 없이도 단일 영상 깊이 추정과 얼굴 법선 추정에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We propose a novel method for combining synthetic and real images when training networks to determine geometric information from a single image. We suggest a method for mapping both image types into a single, shared domain. This is connected to a primary network for end-to-end training. Ideally, this results in images from two domains that present shared information to the primary network. Our experiments demonstrate significant improvements over the state-of-the-art in two important domains, surface normal estimation of human faces and monocular depth estimation for outdoor scenes, both in an unsupervised setting.

연구 동기 및 목표

  • 비지도 기하 추정에서 전이 학습을 방해하는 합성 이미지와 실재 이미지 간의 도메인 갭을 해결하기 위해.
  • 비용이 많이 드는 실재 데이터 애너테이션을 요구하지 않고도 딥 네트워크의 실세계 기하 추정 작업 성능을 향상시키기 위해.
  • 모든 도메인을 공통 표현으로 매핑함으로써 작업에 관련된 특징만 정렬하고, 관련이 없는 도메인 특화 세부 정보는 유지하기 위한 방법을 개발하기 위해.
  • 작업 관련 특징의 분포적 차이를 줄임으로써 합성 및 실재 데이터를 조합하여 주 회귀 모델의 효과적인 훈련을 가능하게 하기 위해.

제안 방법

  • 공통 생성자 네트워크인 SharinGAN을 사용하여 실재 이미지와 합성 이미지를 공통 잠재 공간으로 매핑함으로써 작업에 관련된 특징이 정렬되도록 훈련한다.
  • 정합 손실을 사용하여 생성자를 오토에코더로 사전 훈련함으로써 신뢰성 있는 정체성 매핑을 유지하고, 작업과 관련이 없는 도메인 특화 세부 정보를 유지한다.
  • 주 작업 네트워크와 함께 적대적 프레임워크에서 생성자를 공동 훈련시키며, 도메인 불변 표현을 강제하기 위해 판별기를 사용한다.
  • 정합 손실, 적대적 손실, 작업 특화 회귀 손실을 결합한 훈련 목표를 통해 생성자와 주 네트워크를 종합적으로 최적화한다.
  • 작업과 관련 없는 특징(예: 헤어 컬러, 텍스처 등)을 명시적으로 제거하지 않음으로써 주 네트워크가 이를 무시하도록 학습할 수 있도록 한다.
  • 주 작업과 관련된 도메인 특화 특징(예: 깊이 신호, 표면 법선)만 공통 표현으로 매핑되도록 하여 불필요한 변환을 최소화한다.

실험 결과

연구 질문

  • RQ1도메인 적응을 통해 합성 및 실재 이미지를 결합함으로써 현재 최신 기술 수준의 방법을 초월하는 비지도 기하 추정 성능 향상을 달성할 수 있는가?
  • RQ2작업에 관련된 도메인 특화 특징만 공통 공간으로 매핑하는 것이 전체 도메인 간 번역과 비교해 더 나은 일반화를 이끌어내는가?
  • RQ3사전 테스트 도메인에 일반화하기 위해 정합 손실이 얼마나 중요한가?
  • RQ4작업과 관련 없는 도메인 특화 특징을 유지하도록 훈련된 생성자도 여전히 주 작업을 위한 효과적인 도메인 정렬을 가능하게 하는가?
  • RQ5제안된 방법이 단일 영상 깊이 추정과 얼굴 법선 추정 양쪽에서 성능 향상에 얼마나 기여하는가?

주요 결과

  • KITTI eigen 테스트 분할에서 SharinGAN은 이전 최신 기술 수준의 방법 대비 단일 영상 깊이 추정의 절대 오차를 23.77% 감소시켰다.
  • Make3D 데이터셋에서, 이 방법은 가장 강력한 베이스라인 대비 절대 오차를 6.45% 상대적으로 감소시켰다.
  • Photoface 데이터셋에서 얼굴 법선 추정을 수행한 결과, 참값과 20도 이내의 정확도가 4.3个百分点 향상되어 43.6%에서 47.88%로 상승했다.
  • 제거 실험 결과에서 SharinGAN 모듈과 정합 손실이 최적 성능을 내기 위해 필수적임을 확인했으며, 특히 미리 보지 않은 도메인에서 특히 그렇다.
  • 정성적 결과에서는 테스트 세트에서의 피지테이닝 없이도 SfSNet보다 더 우수한 일반화 성능을 보였다.
  • 작업과 관련 없는 도메인 특화 시각적 세부 정보를 유지하면서도 뚜렷한 성능 향상을 달성함으로써, 강인성과 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.