[论文解读] SuPer Deep: A Surgical Perception Framework for Robotic Tissue Manipulation using Deep Learning for Feature Extraction
SuPer Deep 提出了一种增强型深度学习手术感知框架,通过集成两个深度神经网络(DNNs)实现无标记的手术器械追踪与改进的基于立体视觉的可变形组织重建。通过利用少量训练数据的迁移学习,其在器械位姿估计(91.0% 的平均交并比)与深度图精度方面均达到当前最先进水平,显著减少了对手动特征工程和标记点的依赖。
Robotic automation in surgery requires precise tracking of surgical tools and mapping of deformable tissue. Previous works on surgical perception frameworks require significant effort in developing features for surgical tool and tissue tracking. In this work, we overcome the challenge by exploiting deep learning methods for surgical perception. We integrated deep neural networks, capable of efficient feature extraction, into the tissue reconstruction and instrument pose estimation processes. By leveraging transfer learning, the deep learning based approach requires minimal training data and reduced feature engineering efforts to fully perceive a surgical scene. The framework was tested on three publicly available datasets, which use the da Vinci Surgical System, for comprehensive analysis. Experimental results show that our framework achieves state-of-the-art tracking performance in a surgical environment by utilizing deep learning for feature extraction.
研究动机与目标
- 通过利用深度学习实现鲁棒的特征提取,克服传统手工特征工程在手术感知中的局限性。
- 通过基于深度学习的立体匹配提升可变形组织追踪性能,减少对传统立体算法的依赖。
- 消除手术器械追踪中对涂色标记和关键点关联的需求,实现无标记操作。
- 通过在公开数据集上的全面评估,建立可变形组织追踪在手术机器人领域的标准化基准。
- 证明深度学习可在典型手术应用中低数据场景下实现高精度感知。
提出的方法
- 集成两个深度神经网络:DNN(1) 用于立体特征匹配以生成深度图,DNN(2) 用于检测手术器械特征。
- 采用 ImageNet 预训练模型进行迁移学习,仅使用 60–80 个训练样本即可实现高性能特征检测。
- 采用带置信度加权观测的粒子滤波器,以应对低置信度或误检特征,提升鲁棒性。
- 将深度图融合至可变形组织模型中,并实现实时工具在相机坐标系中的定位,完成完整场景重建。
- 将 SuPer Deep 框架应用于三个公开的 da Vinci® 手术数据集,进行全面评估。
- 对基于深度学习的立体匹配方法(如 AdaBins、DPT)与传统方法(如 ELAS)在手术内窥镜深度估计中的表现进行定量比较。
实验结果
研究问题
- RQ1基于深度学习的特征提取是否能在手术器械追踪中超越传统手工设计的特征工程?
- RQ2迁移学习是否能使仅用少量标注训练数据的手术机器人中实现高精度器械特征检测?
- RQ3基于深度学习的立体匹配与传统方法相比,在可变形组织追踪的深度图重建中表现如何?
- RQ4全端到端的深度学习框架是否能消除手术感知中对涂色标记和关键点关联的需求?
- RQ5深度学习对微创机器人手术中 3D 组织重建的逼真度与精度有何影响?
主要发现
- SuPer Deep 在手术器械分割中实现了 91.0% 的平均交并比(IoU),显著优于原始 SuPer 方法(82.8%)。
- 通过采用基于深度学习的立体匹配,显著降低了深度估计的像素级均方根误差,其中更深层网络(如 AdaBins 和 DPT)表现更优。
- 仅需 60–80 个训练样本即可训练 DNN(2) 实现手术器械特征检测,证明了迁移学习带来的高数据效率。
- 该框架成功实现了无标记器械追踪,消除了先前方法中对涂色标记的依赖。
- DNN 输出的置信度分数有效缓解了特征检测失败的影响,低置信度检测未对位姿估计性能造成显著下降。
- 重建的 3D 场景展现出逼真的组织几何结构,工具在点云上定位准确,表明环境保真度显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。