Skip to main content
QUICK REVIEW

[논문 리뷰] Endo-VMFuseNet: Deep Visual-Magnetic Sensor Fusion Approach for Uncalibrated, Unsynchronized and Asymmetric Endoscopic Capsule Robot Localization Data

Mehmet Turan, Yasin Almalıoğlu|arXiv (Cornell University)|2017. 09. 18.
Advanced Neural Network Applications참고 문헌 28인용 수 12
한 줄 요약

이 논문은 시각적 및 자기 센서 데이터를 이용하여 校정되지 않은, 비동기적이고 비대칭적인 내시경 캡슐 로봇의 정밀한, 밀리미터 이하의 국소화를 가능하게 하는 딥러닝 기반 센서 융합 프레임워크인 Endo-VMFuseNet을 제안한다. 다중 비율 Long Short-Term Memory 네트워크를 활용하여 시간적 동역학을 학습하고, 동기화, 校정, 6-DoF 센서 데이터의 완전성 없이 이종 센서 스트림을 종단 간(end-to-end) 융합한다. 실재 돼지 위 데이터셋에서 시각 옹도메트리와 자기 국소화만으로도 뛰어난 정확도를 달성한다.

ABSTRACT

In the last decade, researchers and medical device companies have made major advances towards transforming passive capsule endoscopes into active medical robots. One of the major challenges is to endow capsule robots with accurate perception of the environment inside the human body, which will provide necessary information and enable improved medical procedures. We extend the success of deep learning approaches from various research fields to the problem of uncalibrated, asynchronous, and asymmetric sensor fusion for endoscopic capsule robots. The results performed on real pig stomach datasets show that our method achieves sub-millimeter precision for both translational and rotational movements and contains various advantages over traditional sensor fusion techniques.

연구 동기 및 목표

  • 최소 침습 수술에서 탈선된 내시경 캡슐 로봇에 대한 정확한 국소화라는 핵심 과제를 해결하기 위해.
  • 전통적인 센서 융합 방법의 한계, 즉 엄격한 校정, 동기화, 6-DoF 센서 요구 조건을 극복하기 위해.
  • 시각적 및 자기 센서에서 온라인되지 않은, 비동기적이고 비대칭적인 센서 데이터를 처리할 수 있는 딥러닝 기반 융합 프레임워크를 개발하기 위해.
  • 복잡하고 동적인 환경, 예를 들어 인간의 위와 같은 환경에서 캡슐 로봇의 고정밀, 실시간 자세 추정을 달성하기 위해.
  • 실제 생체 내 데이터를 이용하여 종단 간 딥러닝이 의료 로봇 분야의 센서 융합에 가능하고 우수한 성능을 보임을 입증하기 위해.

제안 방법

  • 비동기적 센서 스트림 간의 시간적 의존성을 모델링하기 위해 Long Short-Term Memory(LSTM) 단위 기반의 시퀀스-투-시퀀스 딥 네ural 네트워크 아키텍처를 사용한다.
  • 30 Hz 시각 데이터와 50 Hz 자기 데이터를 각각 처리하기 위해 두 개의 다중 비율 LSTM을 사용하여, 서로 다른 샘플링 속도로 센서를 처리할 수 있도록 한다.
  • 핵심 융합 메커니즘은 두 LSTM의 은닉 상태를 연결하여, 불완전하고 비동기적인 입력에서 6-DoF 자세(이동 및 회전)를 공동으로 추정한다.
  • 초기 학습률 0.001로 Back-propagation through time을 사용하여 종단 간 학습을 수행하고, Adam 최적화 기법을 통해 최적화한다.
  • 과적합을 방지하고 다양한 운동 패턴에 대한 일반화 능력을 확보하기 위해 드롭아웃 및 조기 정지와 같은 정규화 기법을 적용한다.
  • 학습 과정에서 자동으로 눈-핸드 校정을 수행하여 수동 센서 校정의 필요성을 제거한다.

실험 결과

연구 질문

  • RQ1딥러닝 기반 센서 융합 프레임워크는 동기화 또는 校정되지 않은 센서 입력 없이도 내시경 캡슐 로봇의 고정밀 국소화를 달성할 수 있는가?
  • RQ25-DoF 자기 센서와 6-DoF 시각 옹도메트리의 조합과 같은 비대칭 센서 데이터는 제안된 방법이 어떻게 처리하는가?
  • RQ3종단 간 딥러닝 모델은 자세 추정 정확도 측면에서 기존의 칼만 필터와 같은 전통적 센서 융합 기법보다 얼마나 뛰어나게 성능을 내는가?
  • RQ4명시적인 동기화 없이도 비동기적 시각 및 자기 센서 스트림에서 운동 동역학을 효과적으로 학습할 수 있는가?
  • RQ5내시경 환경에서 흔히 발생하는 복잡하고 빠르며 비선형적인 운동에 대해 이 방법은 얼마나 강건한가?

주요 결과

  • Endo-VMFuseNet은 실재 돼지 위 데이터셋에서 이동 및 회전 자세 추정 모두에서 밀리미터 이하의 정밀도를 달성하였으며, 평균 이동 RMSE는 0.3 mm 이하, 회전 RMSE는 0.05° 이하를 기록하였다.
  • 모든 시험 궤적 길이와 복잡성에서 시각 옹도메트리(EVO)와 자기 국소화의 단독 성능을 모두 초월하여 이동 및 회전 RMSE 측면에서 뛰어난 성능을 보였다.
  • LSTM 유닛이 제공하는 시간 기억을 활용하여, 6-DoF 정보가 없는 자기 센서 데이터와 6-DoF 시각 데이터를 성공적으로 융합하였다.
  • 내부 기억을 통해 과거 센서 상태를 유지하고 통합함으로써, 30 Hz 시각 및 50 Hz 자기 센서 스트림의 비동기적 데이터 스트림을 효과적으로 처리하였다.
  • 빠른 회전과 복잡한 스캔과 같은 다양한 운동 패턴에 대해 일반화 능력이 뛰어나, Polaris 추적 시스템의 지상 진실 궤적과 밀도 높은 일치를 유지하였다.
  • 종단 간 학습 과정에서 자동으로 센서 校정을 학습하여 수동 校정 또는 수작업으로 조정된 노이즈 모델의 필요성을 제거하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.