Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Generative Adversarial Network for Depth Estimation in Laparoscopic Images

Baoru Huang, Jian-Qing Zheng|arXiv (Cornell University)|2021. 07. 09.
Advanced Vision and Imaging참고 문헌 34인용 수 4
한 줄 요약

이 논문은 스테레오 쌍을 입력으로 사용하여 복강경 영상에서 깊이 추정을 위한 자기지도 학습 기반 생성 적대 신경망인 SADepth를 제안한다. 적대적 훈련과 다중 해상도 감시를 활용하여 재구성 품질과 일반화 능력을 향상시킨다. 지도 학습이 필요한 깊이 진짜값 레이블 없이도 두 개의 공개 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Dense depth estimation and 3D reconstruction of a surgical scene are crucial steps in computer assisted surgery. Recent work has shown that depth estimation from a stereo images pair could be solved with convolutional neural networks. However, most recent depth estimation models were trained on datasets with per-pixel ground truth. Such data is especially rare for laparoscopic imaging, making it hard to apply supervised depth estimation to real surgical applications. To overcome this limitation, we propose SADepth, a new self-supervised depth estimation method based on Generative Adversarial Networks. It consists of an encoder-decoder generator and a discriminator to incorporate geometry constraints during training. Multi-scale outputs from the generator help to solve the local minima caused by the photometric reprojection loss, while the adversarial learning improves the framework generation quality. Extensive experiments on two public datasets show that SADepth outperforms recent state-of-the-art unsupervised methods by a large margin, and reduces the gap between supervised and unsupervised depth estimation in laparoscopic images.

연구 동기 및 목표

  • 복강경 영상에서 픽셀 단위 깊이 진짜값이 부족하여 지도 학습 기반 깊이 추정이 제한되는 문제를 해결하기 위해.
  • 이미지 재구성으로서의 지도 신호를 활용하여 자기지도 학습을 통해 비지도 깊이 추정 성능을 향상시키기 위해.
  • 적대적 훈련을 통해 재구성 품질을 향상시키고 깊이 예측의 잡음과 잡음 제거를 위해.
  • 세부 조정 없이 다양한 복강경 시스템과 데이터셋 간의 일반화를 가능하게 하기 위해.
  • 내 endoscopic 시각에서 지도 학습과 비지도 학습 간의 성능 격차를 해소하기 위해.

제안 방법

  • 프레임워크는 스테레오 RGB 이미지 쌍에서 왼쪽 및 오른쪽 디스parity 맵을 예측하기 위해 U-Net 기반의 인코더-디코더 생성망을 사용한다.
  • 재투영 샘플러는 예측된 디스패리 맵을 재투영하여 입력 이미지를 재구성함으로써 광학적 재투영 손실을 계산한다.
  • 국소 최소값을 완화하고 특징 학습을 향상시키기 위해 다중 해상도 수준에서 다중 해상도 감시를 적용한다.
  • 예측된 디스패리 맵의 정규화를 위해 디스패리 스무쓰니스 손실을 통합하여 노이즈를 감소시킨다.
  • 진짜 입력 이미지와 생성망에서 재구성된 이미지를 구별하도록 판별망 네트워크를 훈련시켜 적대적 훈련을 가능하게 한다.
  • 전체 훈련 목표는 광학적 재투영 손실, 디스패리 스무쓰니스 손실, 그리고 적대적 손실을 조합하여 엔드 투 엔드 최적화를 수행한다.

실험 결과

연구 질문

  • RQ1적대적 훈련은 자기지도 학습 기반 복강경 영상의 깊이 추정에서 재구성 이미지의 품질을 향상시킬 수 있는가?
  • RQ2다중 해상도 감시는 광학적 재투영 손실로 인해 발생하는 국소 최소값을 어떻게 완화하는가?
  • RQ3진짜값이 없는 자기지도 학습 기반 GAN 기반 방법이 다양한 복강경 데이터셋 간에 얼마나 잘 일반화되는가?
  • RQ4픽셀 단위 깊이 레이블이 없는 상황에서 제안된 방법이 지도 학습 방법과 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ5적대적 학습 통합이 낮은 텍스처를 가진 수술 환경에서 깊이 예측의 정확성과 이미지 재구성의 신뢰성에 어떤 영향을 미치는가?

주요 결과

  • dVPN 데이터셋에서 SADepth는 SSIM 79.6을 기록하여 Monodepth [9]보다 24.7 단위, Monodepth2 [10]보다 8.4 단위 높은 성능을 달성했다.
  • SCARED 데이터셋에서 SADepth는 테스트 세트 1에서 평균 절대 깊이 오차 17.42 mm, 테스트 세트 2에서 11.23 mm를 기록하여 모든 비지도 기반 기준 모델을 초월했다.
  • 비지도 학습과 지도 학습 간의 성능 격차를 줄였으며, SCARED에서 일부 지도 학습 방법과 경쟁 가능한 성능을 보였다.
  • 다양한 복강경 기기와 수술 시나리오에서 수집된 데이터셋 간에 잘 일반화되어 강력한 내성적 안정성을 보였다.
  • 적대적 훈련을 통해 재구성된 이미지의 시각적 품질이 크게 향상되어 광학적 일致성 향상과 잡음 감소를 이끌었다.
  • 다중 해상도 감시와 디스패리 스무쓰니스 손실의 조합은 국소 최소값을 효과적으로 완화하고 깊이 맵 정확도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.