Skip to main content
QUICK REVIEW

[논문 리뷰] Depth Anything in Medical Images: A Comparative Study

John Han, Ayberk Acar|arXiv (Cornell University)|2024. 01. 29.
AI in cancer detection인용 수 4
한 줄 요약

이 연구는 의료 내 endoscopic 및 laparoscopic 영상에서 Depth Anything 기초 모델의 zero-shot 성능을 일반 장면 및 도메인 내 단안 깊이 추정(MDE) 모델과 비교하여 평가한다. 강력한 zero-shot 능력을 보이지만, 정확도나 속도에서 항상 이전 모델을 능가하지는 않으며, 도메인 내 모델인 Endo-Depth 및 MiDaS는 특정 해부학적 시퀀스에서 뛰어난 성능을 보이며, Depth Anything은 실시간 응용에 유리한 추론 속도를 제공한다.

ABSTRACT

Monocular depth estimation (MDE) is a critical component of many medical tracking and mapping algorithms, particularly from endoscopic or laparoscopic video. However, because ground truth depth maps cannot be acquired from real patient data, supervised learning is not a viable approach to predict depth maps for medical scenes. Although self-supervised learning for MDE has recently gained attention, the outputs are difficult to evaluate reliably and each MDE's generalizability to other patients and anatomies is limited. This work evaluates the zero-shot performance of the newly released Depth Anything Model on medical endoscopic and laparoscopic scenes. We compare the accuracy and inference speeds of Depth Anything with other MDE models trained on general scenes as well as in-domain models trained on endoscopic data. Our findings show that although the zero-shot capability of Depth Anything is quite impressive, it is not necessarily better than other models in both speed and performance. We hope that this study can spark further research in employing foundation models for MDE in medical scenes.

연구 동기 및 목표

  • 의료 내 endoscopic 및 laparoscopic 장면에서 Depth Anything 기초 모델의 zero-shot 일반화 능력을 평가하기 위해.
  • 일반 장면 MDE 모델(MiDaS, ZoeDepth)과 도메인 내 모델(Endo-SfM, Endo-Depth)과의 정확도 및 추론 속도를 Depth Anything과 비교하기 위해.
  • Depth Anything과 같은 기초 모델이 미세조정 없이 다양한 해부학적 구조에 대해 신뢰성 있게 일반화할 수 있는지 평가하기 위해.
  • 미래의 의료 단안 깊이 추정에서 기초 모델에 대한 벤치마크 제공을 위해.
  • 사전 훈련된 기초 모델을 사용하여 실시간 수술 내비게이션 및 3D 재구성 가능성을 탐색하기 위해.

제안 방법

  • 연구는 두 개의 공개 의료 데이터셋인 EndoSLAM 및 보정된 Hamlyn 데이터셋에서 Depth Anything, MiDaS, ZoeDepth, Endo-SfM, Endo-Depth, LapDepth를 평가한다.
  • 의료 데이터에 대한 미세조정 없이 원본 사전 훈련된 가중치를 사용하여 zero-shot 추론을 수행한다.
  • 정량적 평가 지표로는 절대 상대 오차(Abs. Rel.), 제곱 상대 오차(Sq. Rel.), 평균 제곱근 오차(RMSE), δ1(δ1)을 사용하여 깊이 정확도를 평가한다.
  • 추론 속도는 인텔 i9-13900K CPU 및 NVIDIA RTX 4090 GPU에서 입력 해상도(320, 320)로 측정한다.
  • 다양한 해부학적 영역을 대표하는 네 개의 시퀀스(대장, 소장, 위, 직장)를 기반으로 성능을 분석한다.
  • 정확도와 속도 간의 상충 관계를 강조하며, Hamlyn 데이터셋의 불완전한 진짜 값으로 인한 제약 사항을 논의한다.

실험 결과

연구 질문

  • RQ1Depth Anything 기초 모델은 일반 장면 MDE 모델보다 의료 내 endoscopic 장면에서 뛰어난 zero-shot 성능을 달성하는가?
  • RQ2의료 내 endoscopic 데이터에 특화해 훈련된 도메인 내 MDE 모델과 비교해 Depth Anything의 zero-shot 성능은 어떠한가?
  • RQ3Depth Anything의 추론 속도는 다른 MDE 모델과 비교해 어떻게 되며, 실시간 수술 내비게이션 시스템에 적합한가?
  • RQ4공개 의료 데이터셋의 진짜 깊이 맵이 성능 평가의 신뢰성에 어느 정도 영향을 미치는가?
  • RQ5Depth Anything과 같은 기초 모델은 미세조정 없이 다양한 해부학적 구조에 효과적으로 일반화할 수 있는가?

주요 결과

  • EndoSLAM 데이터셋에서 MiDaS는 대장 시퀀스에서 Depth Anything을 앞섰으며, Endo-SfMLearner와 MiDaS는 소장 시퀀스에서 모든 Depth Anything 버전을 뛰어넘었다.
  • 위 시퀀스에서는 DAM-Large가 모든 모델 중 가장 높은 정확도를 기록했으며, Abs. Rel.는 0.078, δ1는 0.953였다.
  • 보정된 Hamlyn 데이터셋에서 ZoeDepth와 Depth Anything-Indoor/Outdoor는 유사한 성능을 보였으며, 시퀀스 1에서 ZoeDepth는 Abs. Rel. 0.083, δ1 0.949를 기록했다.
  • Endo-Depth는 가장 빠른 모델이었으며, 동일 하드웨어에서 249.38 FPS를 기록했고, 가장 작은 Depth Anything 버전(120.34 FPS)보다 뛰어났다.
  • ZoeDepth는 가장 느린 추론 시간(82.15 ms, 12.17 FPS)을 기록했지만, 여전히 수술 적용에 있어서 실시간 능력 범위 내에 있었다.
  • Hamlyn 데이터셋의 진짜 깊이 맵은 불완전한 것으로 밝혀졌으며, 특히 시퀀스 4, 19, 20에서 성능 비교의 신뢰성에 영향을 줄 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.