[논문 리뷰] EndoSLAM Dataset and An Unsupervised Monocular Visual Odometry and Depth Estimation Approach for Endoscopic Videos: Endo-SfMLearner
이 논문은 6차원 자세와 3차원 포인트 클라우드 지상 진실을 포함한, 육상의 돼지 위장 기관에서 촬영한 내 endoscopic 영상의 종합적인 컬렉션인 EndoSLAM 데이터셋을 소개한다. 또한, 공간적 주의 모듈과 밝기 인식형 사진 손실을 갖춘 잔차 신경망을 활용하는 비지도 단안 시각적 옵티컬 플로우 및 깊이 추정 방법인 Endo-SfMLearner를 제안한다. 이 방법은 대장, 위, 소장에서 깊이 추정 및 자세 추적 성능이 최신 기술 수준을 초월하며, 실제 및 합성 데이터에서 RMSE 값이 낮은 성능을 기록한다.
Deep learning techniques hold promise to develop dense topography reconstruction and pose estimation methods for endoscopic videos. However, currently available datasets do not support effective quantitative benchmarking. In this paper, we introduce a comprehensive endoscopic SLAM dataset consisting of 3D point cloud data for six porcine organs, capsule and standard endoscopy recordings as well as synthetically generated data. A Panda robotic arm, two commercially available capsule endoscopes, two conventional endoscopes with different camera properties, and two high precision 3D scanners were employed to collect data from 8 ex-vivo porcine gastrointestinal (GI)-tract organs. In total, 35 sub-datasets are provided with 6D pose ground truth for the ex-vivo part: 18 sub-dataset for colon, 12 sub-datasets for stomach and 5 sub-datasets for small intestine, while four of these contain polyp-mimicking elevations carried out by an expert gastroenterologist. Synthetic capsule endoscopy frames from GI-tract with both depth and pose annotations are included to facilitate the study of simulation-to-real transfer learning algorithms. Additionally, we propound Endo-SfMLearner, an unsupervised monocular depth and pose estimation method that combines residual networks with spatial attention module in order to dictate the network to focus on distinguishable and highly textured tissue regions. The proposed approach makes use of a brightness-aware photometric loss to improve the robustness under fast frame-to-frame illumination changes. To exemplify the use-case of the EndoSLAM dataset, the performance of Endo-SfMLearner is extensively compared with the state-of-the-art. The codes and the link for the dataset are publicly available at https://github.com/CapsuleEndoscope/EndoSLAM. A video demonstrating the experimental setup and procedure is accessible through https://www.youtube.com/watch?v=G_LCe0aWWdQ.
연구 동기 및 목표
- 내시경 영상 분석을 위한 6차원 자세와 3차원 지상 진실이 포함된 종합적이고 공개 가능한 데이터셋의 부족을 해결하기 위해.
- 내시경 영상 조건에 특화된 강건한 비지도 단안 시각적 옵티컬 플로우 및 깊이 추정 방법을 개발하기 위해.
- 실제 및 합성 데이터를 사용하여 딥 러닝 방법의 벤치마킹을 가능하게 하기 위해.
- 주의 메커니즘과 손실 설계를 통해 다양한 내시경 질감과 조명 변화에 대한 일반화 능력을 향상시키기 위해.
- 미세 치료 내시경 분야에서 향후 3차원 복원, 국소화 및 다중 작업 학습 연구를 지원하기 위해.
제안 방법
- EndoSLAM 데이터셋은 패닉 로봇 암, 두 대의 캡슐 내시경, 두 대의 표준 내시경, 그리고 두 대의 고정밀 3차원 스캐너를 사용하여 8개의 육상의 돼지 위장 기관에서 수집되었다.
- 데이터셋에는 대장, 위, 소장의 깊이 및 자세 애너테이션을 포함한 35개의 서브-데이터셋이 포함되어 있으며, 6차원 자세 지상 진실, 3차원 포인트 클라우드, 그리고 합성 프레임이 포함되어 있다.
- Endo-SfMLearner는 단안 깊이 및 자세 추정 과정에서 무늬가 뚜렷하고 구별 가능한 조직 영역에 집중하기 위해 공간적 주의 모듈을 갖춘 잔차 신경망을 사용한다.
- 내시경 영상에서 흔히 발생하는 급격한 조명 변화에 대응하기 위해 밝기 인식형 사진 손실을 도입하였다.
- 스테레오 매칭에서의 깊이 감독과 프레임 간 자세 일致성에 기반한 비지도 학습을 사용한다.
- SIFT 특징 매칭, RANSAC 기반의 이상치 제거, Tsai-Shah 기반의 형태에서 형태 추정, 반사 억제를 위한 Otsu 임계값 및 OpenCV 인painting을 활용한 이미지 스티칭을 통한 3차원 복원을 수행한다.
실험 결과
연구 질문
- RQ1일관된 비지도 단안 네트워크가 다양한 질감과 조명 조건을 가진 내시경 환경에서 정확한 깊이 및 자세 추정을 달성할 수 있는가?
- RQ2공간적 주의 모듈의 통합이 낮은 질감 또는 높은 반사율을 가지는 내시경 영역에서 성능 향상에 기여하는 정도는 어떠한가?
- RQ3밝기 인식형 사진 손실이 내시경 영상에서 급격한 조명 변화에 대응하는 데 얼마나 강건성을 향상시키는가?
- RQ4Endo-SfMLearner는 학습 데이터에 포함되지 않은 기관, 예를 들어 위나 소장에 대해 얼마나 잘 일반화되는가?
- RQ5합성 내시경 데이터는 실제 세계의 내시경 SLAM 작업에 대한 전이 학습을 효과적으로 지원할 수 있는가?
주요 결과
- 소장에서 Endo-SfMLearner는 RMSE 0.40 cm를 기록하여 SC-SfMLearner(1.02 cm)와 형태에서 형태 추정 방법(0.54 cm)을 능가하였다.
- 대장에서 Endo-SfMLearner는 RMSE 0.37 cm를 기록하였으며, 이는 SC-SfMLearner(0.51 cm)와 형태에서 형태 추정 방법(0.86 cm)보다 우수하였다.
- 위-III에서 Endo-SfMLearner는 RMSE 0.41 cm를 기록하였으며, 이는 SC-SfMLearner(1.37 cm)와 형태에서 형태 추정 방법(0.73 cm)보다 유의미하게 낮았다.
- 주의 모듈은 학습 세트에 포함되지 않은 합성 대장, 소장 및 위 영상에서의 깊이 추정 성능 향상에 기여하였다.
- Endo-SfMLearner의 깊이 추정 결과를 활용한 3차원 복원 파이프라인은 RMSE 0.65 cm(Colon-IV), 0.54 cm(Small Intestine), 0.73 cm(Stomach-III)를 기록하였으며, 룰 기반 방법을 능가하였다.
- 제거 분석 결과, 주의 모듈이 깊이 변화에 대한 민감도를 향상시키고, 특정 기관에 직접 학습하지 않은 상태에서도 질감의 차이에 대한 일반화 능력을 향상시킨다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.