Skip to main content
QUICK REVIEW

[论文解读] Endo-VMFuseNet: Deep Visual-Magnetic Sensor Fusion Approach for Uncalibrated, Unsynchronized and Asymmetric Endoscopic Capsule Robot Localization Data

Mehmet Turan, Yasin Almalıoğlu|arXiv (Cornell University)|Sep 18, 2017
Advanced Neural Network Applications参考文献 28被引用 12
一句话总结

该论文提出Endo-VMFuseNet,一种基于深度学习的传感器融合框架,通过视觉与磁传感器数据,实现对未校准、非同步且非对称的内窥镜胶囊机器人精确的亚毫米级定位。该方法利用多速率长短期记忆网络,学习时间动态特性并端到端融合异构传感器数据流,无需同步、校准或完整的6-DoF传感器数据,相较于仅使用视觉里程计或磁定位方法,在真实猪胃数据集上实现了更优的定位精度。

ABSTRACT

In the last decade, researchers and medical device companies have made major advances towards transforming passive capsule endoscopes into active medical robots. One of the major challenges is to endow capsule robots with accurate perception of the environment inside the human body, which will provide necessary information and enable improved medical procedures. We extend the success of deep learning approaches from various research fields to the problem of uncalibrated, asynchronous, and asymmetric sensor fusion for endoscopic capsule robots. The results performed on real pig stomach datasets show that our method achieves sub-millimeter precision for both translational and rotational movements and contains various advantages over traditional sensor fusion techniques.

研究动机与目标

  • 为微创手术中无缆内窥镜胶囊机器人的精确定位这一关键挑战提供解决方案。
  • 克服传统传感器融合方法的局限,包括严格的校准、同步要求以及对完整6-DoF传感器数据的依赖。
  • 开发一种基于深度学习的融合框架,可处理来自视觉与磁传感器的未校准、异步且非对称的传感器数据。
  • 在复杂动态环境(如人体胃部)中实现高精度、实时的姿态估计。
  • 通过真实体内数据,证明端到端深度学习在医疗机器人传感器融合中的可行性和优越性。

提出的方法

  • 该方法采用基于长短期记忆(LSTM)单元的编码器-解码器序列到序列深度神经网络架构,以建模异步传感器数据流之间的时序依赖关系。
  • 使用两个多速率LSTM网络——一个处理30 Hz的视觉数据,另一个处理50 Hz的磁传感器数据——使网络能够以不同采样率处理传感器输入。
  • 核心融合机制将两个LSTM的隐藏状态进行拼接,联合估计6-DoF姿态(平移与旋转),输入为不完整且异步的数据。
  • 网络通过时间反向传播进行端到端训练,初始初始学习率为0.001,并采用Adam优化算法进行优化。
  • 应用正则化技术(如dropout与早停法)以防止过拟合,并确保在多样化运动模式下的泛化能力。
  • 模型在训练过程中自动完成眼在手校准,无需人工传感器校准。

实验结果

研究问题

  • RQ1基于深度学习的传感器融合框架是否能在无需同步或校准传感器输入的情况下,实现对内窥镜胶囊机器人的高精度定位?
  • RQ2所提出的方法如何处理非对称传感器数据,例如5-DoF磁传感器与6-DoF视觉里程计的组合?
  • RQ3端到端深度学习模型在姿态估计精度方面,相较于传统传感器融合技术(如扩展卡尔曼滤波)能有多大程度的性能提升?
  • RQ4网络是否能有效从异步的视觉与磁传感器数据流中学习运动动力学,而无需显式同步?
  • RQ5该方法在典型内窥镜环境中常见的复杂、快速且非线性运动下,具备多强的鲁棒性?

主要发现

  • Endo-VMFuseNet在真实猪胃数据集上实现了亚毫米级的平移与旋转姿态估计精度,平均平移RMSE低于0.3 mm,旋转RMSE低于0.05°。
  • 在所有测试轨迹长度与复杂度下,该方法在平移与旋转RMSE方面均优于独立的视觉里程计(EVO)与磁定位方法。
  • 通过LSTM单元的时间记忆能力,网络成功融合了5-DoF磁传感器数据与6-DoF视觉数据,即使磁传感器缺乏完整的6-DoF信息。
  • Endo-VMFuseNet通过内部记忆机制,有效处理异步数据流(30 Hz视觉,50 Hz磁传感器),保留并整合历史传感器状态。
  • 该模型在多样化运动模式下泛化能力良好,包括快速旋转与复杂扫描,其预测轨迹与Polaris追踪系统的真值轨迹高度一致。
  • 端到端训练过程自动学习传感器校准参数,无需人工校准或手动调整噪声模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。