Skip to main content
QUICK REVIEW

[논문 리뷰] T2Net: Synthetic-to-Realistic Translation for Solving Single-Image Depth Estimation Tasks

Chuanxia Zheng, Tat‐Jen Cham|arXiv (Cornell University)|2018. 08. 04.
Advanced Vision and Imaging참고 문헌 32인용 수 10
한 줄 요약

T2Net는 단일 이미지 깊이 추정을 위한 엔드 투 엔드 학습 가능한 프레임워크를 제안하며, 합성 이미지-깊이 쌍과 쌍방향으로 매칭되지 않은 실사 이미지만을 사용한다. 합성 입력에 대해 생성적 적대적 손실(GAN loss)을 적용하고 실사 입력에 대해 재구성 손실을 적용하는 합성에서 실사로의 변환 네트워크를 활용하여, 실사 이미지-깊이 쌍이나 스테레오 데이터가 필요 없이 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Current methods for single-image depth estimation use training datasets with real image-depth pairs or stereo pairs, which are not easy to acquire. We propose a framework, trained on synthetic image-depth pairs and unpaired real images, that comprises an image translation network for enhancing realism of input images, followed by a depth prediction network. A key idea is having the first network act as a wide-spectrum input translator, taking in either synthetic or real images, and ideally producing minimally modified realistic images. This is done via a reconstruction loss when the training input is real, and GAN loss when synthetic, removing the need for heuristic self-regularization. The second network is trained on a task loss for synthetic image-depth pairs, with extra GAN loss to unify real and synthetic feature distributions. Importantly, the framework can be trained end-to-end, leading to good results, even surpassing early deep-learning methods that use real paired data.

연구 동기 및 목표

  • 특수 깊이 감지 장비가 필요한 데서 비롯해 수집에 시간과 비용이 많이 드는 대규모 실사 이미지-깊이 쌍 데이터셋을 확보하는 데 도전한다.
  • 단일 이미지 깊이 추정에서 합성 이미지와 실사 이미지 간의 도메인 차이를 극복하기 위해, 실사 쌍방향 데이터가 없는 조건에서도 효과적인 도메인 적응을 가능하게 한다.
  • 합성 이미지와 실사 이미지를 모두 공통의 번역 및 예측 파이프라인의 입력으로 간주하는 통합 프레임워크를 개발하여, 다양한 도메인 간의 강건성을 확보한다.
  • 자기 정규화와 같은 히우리스틱 정규화 손실(예: 자기 정규화)에 의존하지 않고, 실사 이미지에 대해 체계적인 재구성 손실과 합성 이미지에 대해 GAN 손실을 도입함으로써 이를 대체한다.
  • 실사 깊이 애너테이션이나 스테레오 쌍이 전혀 필요 없이, 합성 훈련 데이터와 쌍방향으로 매칭되지 않은 실사 이미지만을 사용하여 경쟁적인 깊이 추정 성능을 달성한다.

제안 방법

  • 합성 이미지에 대해 생성적 적대적 손실(GAN loss)을 적용하여, 합성 이미지를 실사 이미지 분포로 매핑하는 합성에서 실사로의 이미지 변환 네트워크를 훈련한다.
  • 실사 이미지에 대해 재구성 손실을 적용하여, 변환 네트워크가 실사 입력에 대해 항등 함수 기능을 수행하도록 보장함으로써, 그들의 콘텐츠와 기하학적 특성을 유지한다.
  • 합성 이미지-깊이 쌍을 사용하여 작업 손실(L1/L2 손실 등 깊이 맵에 대한 손실)을 적용하여 훈련하는 깊이 예측 네트워크와 변환 네트워크를 결합한다.
  • 실사 이미지와 합성 이미지의 특징 분포를 정렬하기 위해 깊이 예측 네트워크에 특징 수준의 GAN 손실을 도입함으로써, 도메인 일반화 능력을 향상시킨다.
  • 전체 T2Net 아키텍처를 엔드 투 엔드로 훈련하여 번역 및 깊이 예측 구성 요소의 공동 최적화를 가능하게 한다.
  • 실사 이미지를 최소한으로 수정하면서도 합성 이미지를 실사적으로 변환하는 광범위한 스펙트럼의 입력 변환기(translator)를 사용하여, 다양한 입력 도메인 간의 일관성을 확보한다.

실험 결과

연구 질문

  • RQ1합성 이미지-깊이 쌍과 쌍방향으로 매칭되지 않은 실사 이미지만을 사용하여 훈련된 도메인 적응 프레임워크가 실사 쌍방향 데이터가 없는 조건에서도 경쟁 가능한 깊이 추정 성능을 달성할 수 있는가?
  • RQ2합성 이미지에 대해 생성적 적대적 손실, 실사 이미지에 대해 재구성 손실을 적용하는 것이 히우리스틱 정규화 방법보다 더 나은 도메인 정렬을 이끌어낼 수 있는가?
  • RQ3번역 네트워크와 깊이 예측 네트워크를 동시에 훈련하는 엔드 투 엔드 학습 방식이, 두 단계 또는 분리된 훈련 방식보다 성능이 뛰어나게 되는가?
  • RQ4실사 이미지에 재구성 손실을 포함시키는 것이 변환된 이미지의 품질과 후속 깊이 예측의 기하학적 정확성에 어떤 영향을 미치는가?
  • RQ5실사 깊이 감독 없이 오직 합성 데이터로만 훈련된 모델이 KITTI나 NYUDv2와 같은 실세계 벤치마크에 얼마나 잘 일반화되는가?

주요 결과

  • T2Net는 실사 쌍방향 데이터가 없이도 합성 데이터와 쌍방향으로 매칭되지 않은 실사 이미지만을 사용하여 KITTI 데이터셋에서 절대 상대 오차(Abs Rel) 0.169의 테스트 오차를 기록하며, 실사 쌍방향 데이터로만 훈련된 베이스라인 모델(0.278 Abs Rel)을 능가한다.
  • 전체 T2Net 모델은 KITTI에서 RMSE 4.717을 기록하여 실사 데이터 전용 훈련 모델(6.268 RMSE)보다 유의미하게 낮은 오차를 기록함으로써, 보다 높은 회귀 정확도를 확보한다.
  • 엔드 투 엔드 훈련을 통해 얻은 모델은 번역 네트워크와 깊이 예측 네트워크를 별도로 훈련한 경우보다 성능이 뛰어나며, 이는 작업 손실이 번역 네트워크에 효과적인 감독을 제공함을 시사한다.
  • 실사 이미지에 대한 재구성 손실을 제거하면 초기 훈련 단계(예: 3번째 에포크)에서 성능 저하가 발생함을 확인하여, 이 손실이 이미지 품질과 안정성을 유지하는 데 중요한 역할을 함을 입증한다.
  • 특징 수준의 GAN 손실과 전체 훈련을 적용한 모델은 KITTI에서 δ < 1.25 3 점수 0.965를 기록하여 깊이 추정의 강력한 일반화 능력과 높은 정확도를 입증한다.
  • T2Net는 이전의 딥 러닝 방법들(실사 이미지-깊이 쌍 또는 스테레오 데이터로 훈련된 방법들)을 뛰어넘으며, 제안된 도메인 적응 전략의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.