Skip to main content
QUICK REVIEW

[논문 리뷰] Pseudo Supervised Monocular Depth Estimation with Teacher-Student Network

Huan Liu, Junsong Yuan|arXiv (Cornell University)|2021. 10. 22.
Advanced Vision and Imaging참고 문헌 45인용 수 5
한 줄 요약

이 논문은 이원화 학습된 교사 네트워크가 가짜 진값으로서 고품질의 시차 맵을 생성하여 단안 깊이 추정을 위한 학생 네트워크를 지도학습으로 감독하는 교사-학생 정착 프레임워크를 사용하는 가짜 지도 학습 단안 깊이 추정 방법을 제안한다. 이 방법은 도메인 특화된 오clusion 맵과 의미론적 감독을 통합하여 일반화 능력을 향상시키고 어려운 영역을 효과적으로 처리함으로써 KITTI 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Despite recent improvement of supervised monocular depth estimation, the lack of high quality pixel-wise ground truth annotations has become a major hurdle for further progress. In this work, we propose a new unsupervised depth estimation method based on pseudo supervision mechanism by training a teacher-student network with knowledge distillation. It strategically integrates the advantages of supervised and unsupervised monocular depth estimation, as well as unsupervised binocular depth estimation. Specifically, the teacher network takes advantage of the effectiveness of binocular depth estimation to produce accurate disparity maps, which are then used as the pseudo ground truth to train the student network for monocular depth estimation. This effectively converts the problem of unsupervised learning to supervised learning. Our extensive experimental results demonstrate that the proposed method outperforms the state-of-the-art on the KITTI benchmark.

연구 동기 및 목표

  • 단안 깊이 추정에서 고품질의 픽셀 단위 깊이 레이블이 부족한 문제를 가짜 지도 학습을 통해 해결하고자 한다.
  • 무 supervision 이원화 깊이 추정의 강점과 지도 학습 기반 단안 학습의 장점을 융합하여 성능을 향상시키고자 한다.
  • 광학적 손실을 통한 간접적 지도 학습 및 약한 스테레오 일致성에 기인한 순수 무 supervision 단안 방법의 한계를 완화하고자 한다.
  • 오clusion 맵과 의미론적 감독을 통합하여 오clusion 영역에서의 모델 강인성을 향상시키고자 한다.
  • 정착을 통한 가짜 지도 학습이 직접적인 깊이 지도 학습 없이도 경쟁 가능한 성능을 달성할 수 있음을 입증하고자 한다.

제안 방법

  • 이원화 이미지 쌍을 대상으로 무 supervision 방식으로 학습된 교사 네트워크가 정확한 시차 맵을 생성하며, 이를 가짜 진값으로 활용한다.
  • 교사의 시차 맵을 감독 신호로 사용하여 지도 학습 방식으로 학습되는 학생 네트워크를 설계하여, 무 supervision 학습을 지도 학습 문제로 전환한다.
  • 학습 중에 오clusion 맵을 생성하고, 교사의 예측이 신뢰할 수 없는 영역를 나타내는 데 사용한다.
  • 오clusion 경계 근처에서 교사 네트워크의 성능을 향상시키기 위해 의미론적 표현을 활용하여 가짜 진값의 품질을 개선한다.
  • 광학적 손실, 스무딩 손실, 일치성 손실을 조합한 다중 구성 요소 손실을 활용하여 지식 정착을 적용함으로써 학생 예측을 가짜 레이블과 일치시킨다.
  • 학습 중에 가짜 진값, 오clusion 마스크, 의미론적 임bedding을 조합하여 학생 네트워크를 엔드 투 엔드로 학습함으로써 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1이원화 교사 네트워크에서 파생된 가짜 지도 학습이 단안 깊이 추정 성능 향상에 기여하는가?
  • RQ2학습 중 오clusion 맵을 통합할 경우, 모호하거나 오clusion된 영역에서의 성능에 어떤 영향을 미치는가?
  • RQ3의미론적 감독이 교사 네트워크가 신뢰할 수 있는 가짜 진값을 생성하는 데 얼마나 기여하는가?
  • RQ4제안된 정착 프레임워크가 기존의 무 supervision 및 준 supervision 단안 깊이 추정 방법보다 우월한가?
  • RQ5실제 깊이 지도 없이 학습된 학생 네트워크가 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 KITTI 2015 eigen 분할에서 δ<1.25 점수 0.912를 기록하여, 실제 깊이 지도를 사용하는 Guo 등 [27]의 성능을 초월한다.
  • 가짜 진값, 오clusion 맵, 의미론적 감독의 전체 조합은 KITTI 2012에서 절대 상대 오차(Abs Rel)를 0.127에서 0.115로 감소시켜 성능 향상을 입증한다.
  • 의미론적 감독을 통한 교사 네트워크의 Abs Rel 오차는 0.089에서 0.077로 감소하여 의미론적 강화의 효과를 입증한다.
  • 가짜 지도 학습을 통해 학습된 학생 네트워크는 원본 Monodepth ResNet-50 베이스라인 대비 KITTI 2012에서 RMSE를 5.533에서 5.236으로 감소시켜 성능 향상을 보였다.
  • 정성적 결과에서는 차량 및 교통 표지판과 같은 물체의 경계가 더 명확하고, 깊이 예측 실패율이 감소한 것으로 관찰되었다.
  • 절단 분석 결과, 각 구성 요소인 가짜 진값, 오clusion 맵, 의미론적 감독이 성능 향상에 긍정적인 기여를 하며, 전체 모델이 최고의 성능을 기록함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.