Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Monocular Depth and Ego-Motion Estimation in Endoscopy: Appearance Flow to the Rescue

Shuwei Shao, Zhongcai Pei|arXiv (Cornell University)|2021. 12. 15.
Advanced Vision and Imaging인용 수 7
한 줄 요약

이 논문은 표준 밝기 동일성 가정을 위반하는 심한 밝기 변동을 해결하기 위해 새로운 개념인 '외관 흐름(appearance flow)'을 사용하여 내 endoscopy 영상에서 단안 영상 기반 깊이 및 자가 운동 추정을 위한 자기지도 학습 프레임워크를 제안한다. 동적인 밝기 변화를 모델링함으로써, 이 방법은 강력한 이미지 재구성 능력을 제공하고 기준 자기지도 학습 방법보다 정확도를 향상시켜 SCARED, EndoSLAM, SERV-CT 및 Hamlyn 데이터셋에서 최신 기술 수준의 성능을 달성하며, 환자 및 카메라 간에 강력한 zero-shot 일반화 성능을 보인다.

ABSTRACT

Recently, self-supervised learning technology has been applied to calculate depth and ego-motion from monocular videos, achieving remarkable performance in autonomous driving scenarios. One widely adopted assumption of depth and ego-motion self-supervised learning is that the image brightness remains constant within nearby frames. Unfortunately, the endoscopic scene does not meet this assumption because there are severe brightness fluctuations induced by illumination variations, non-Lambertian reflections and interreflections during data collection, and these brightness fluctuations inevitably deteriorate the depth and ego-motion estimation accuracy. In this work, we introduce a novel concept referred to as appearance flow to address the brightness inconsistency problem. The appearance flow takes into consideration any variations in the brightness pattern and enables us to develop a generalized dynamic image constraint. Furthermore, we build a unified self-supervised framework to estimate monocular depth and ego-motion simultaneously in endoscopic scenes, which comprises a structure module, a motion module, an appearance module and a correspondence module, to accurately reconstruct the appearance and calibrate the image brightness. Extensive experiments are conducted on the SCARED dataset and EndoSLAM dataset, and the proposed unified framework exceeds other self-supervised approaches by a large margin. To validate our framework's generalization ability on different patients and cameras, we train our model on SCARED but test it on the SERV-CT and Hamlyn datasets without any fine-tuning, and the superior results reveal its strong generalization ability. Code will be available at: \url{https://github.com/ShuweiShao/AF-SfMLearner}.

연구 동기 및 목표

  • 자기지도 학습 기반 깊이 및 자가 운동 추정에서 밝기 동일성 가정을 위반하는 심한 내시경 영상 간 밝기 변동 문제를 해결한다.
  • 비-Lambertian 반사, 상호 반사 및 조명 변화로 인해 기존 자기지도 학습 방법이 미세 외과 수술 환경에서 제한을 받는 문제를 해결한다.
  • 재구성 정밀도 향상을 위해 외관 변화를 校정하는 동시에 깊이 및 자가 운동을 동시에 추정하는 통합 프레임워크를 개발한다.
  • SCARED에서 학습하고 SERV-CT 및 Hamlyn 데이터셋에서 테스트하는 방식으로, 미세조정 없이도 강력한 일반화 성능을 입증한다.
  • 정답 RGB-D 데이터가 필요 없이 내시경 AR 내비게이션 및 3D 재구성에 대해 강력하고 확장 가능한 솔루션을 제공한다.

제안 방법

  • 모든 밝기 패턴의 변화를 모델링할 수 있는 미분 가능한 표현인 외관 흐름을 도입하여, 동적인 이미지 제약 조건을 가능하게 한다.
  • 깊이 및 자가 운동을 공동 최적화하기 위한 네 개의 모듈(구조, 운동, 외관, 대응)을 포함하는 통합 자기지도 학습 프레임워크를 설계한다.
  • 이미지 워핑 중 밝기 불일치를 추정하고 보정하기 위해 외관 흐름을 활용하여 조명 변화로 인한 잘못된 지도 신호를 감소시킨다.
  • 외관 이동을 고려함으로써 엄격한 밝기 동일성 가정을 완화하는 일반화된 동적 이미지 제약 조건을 통합한다.
  • 예측된 깊이 및 자가 운동을 기반으로 워핑 기반 시각 합성 기법을 활용하고, 외관 흐름을 통해 재구성 품질을 향상시킨다.
  • 깊이 예측에서 고품질 3D 표면 재구성을 위해 마치징 큐브를 사용한 절단된 부호 거리 함수(TSDF)를 적용한다.

실험 결과

연구 질문

  • RQ1외관 흐름은 조명 변화 및 비-Lambertian 반사로 인한 내시경 영상에서 심한 밝기 변동을 효과적으로 모델링하고 보정할 수 있는가?
  • RQ2제안된 통합 자기지도 학습 프레임워크는 도전적인 내시경 조건 하에서 기존 방법보다 단안 영상 기반 깊이 및 자가 운동 추정 성능을 뛰어나게 하는가?
  • RQ3미세조정 없이도 이 프레임워크는 예상치 못한 환자 및 카메라 설정에 얼마나 잘 일반화되는가?
  • RQ4정답 데이터가 없을 경우, 이 프레임워크는 최신 기술 수준의 방법과 비교해 3D 표면 재구성 성능에서 어떤 성능을 보이는가?
  • RQ5과포화 및 저무늬 영역가 존재하는 환경에서도 스케일 드리프트를 완화하고 구조적 세부 정보를 깊이 맵에 유지할 수 있는가?

주요 결과

  • 제안된 방법은 SCARED 및 EndoSLAM 데이터셋에서 다른 자기지도 학습 방법보다 뛰어난 정확도를 보이며, 깊이 및 자가 운동 추정 성능이 뛰어나다.
  • 트랙토리-1에서, 이 방법은 기준 모델 및 Monodepth2보다 높은 정확도를 기록하고 스케일 드리프트가 현저히 적다.
  • 트랙토리-2에서, 이 방법은 높은 정확도를 유지하며 Monodepth2 및 기준 모델과 달리 전역적으로 스케일 일관성 있는 트랙토리를 생성한다.
  • SCARED 및 Hamlyn 데이터셋에서의 정성적 표면 재구성 결과는 왜곡이 적고 조직 윤곽 등의 주요 해부학적 특징을 잘 유지함을 보여준다.
  • SCARED에서만 학습하고 SERV-CT 및 Hamlyn 데이터셋에서 테스트하는 방식으로, 미세조정 없이도 효과적인 도메인 일반화 성능을 보이며, 강력한 도메인 일반화 능력을 입증한다.
  • 밝기 변동으로 인한 지도의 모호성을 감소시켜, 저무늬 및 밝기 변동이 심한 환경에서 더 신뢰할 수 있는 깊이 및 자세 예측을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.