[论文解读] Temporal Segmentation of Surgical Sub-tasks through Deep Learning with Multiple Data Sources
该论文提出Fusion-KVE,一种深度学习模型,通过融合运动学、视觉和系统事件数据,实现实时、细粒度的机器人辅助手术状态估计。通过融合多种数据源,该模型在复杂数据集上实现了89.4%的帧级准确率,优于先前方法,并展现出对短时态和频繁切换状态的鲁棒性。
Many tasks in robot-assisted surgeries (RAS) can be represented by finite-state machines (FSMs), where each state represents either an action (such as picking up a needle) or an observation (such as bleeding). A crucial step towards the automation of such surgical tasks is the temporal perception of the current surgical scene, which requires a real-time estimation of the states in the FSMs. The objective of this work is to estimate the current state of the surgical task based on the actions performed or events occurred as the task progresses. We propose Fusion-KVE, a unified surgical state estimation model that incorporates multiple data sources including the Kinematics, Vision, and system Events. Additionally, we examine the strengths and weaknesses of different state estimation models in segmenting states with different representative features or levels of granularity. We evaluate our model on the JHU-ISI Gesture and Skill Assessment Working Set (JIGSAWS), as well as a more complex dataset involving robotic intra-operative ultrasound (RIOUS) imaging, created using the da Vinci Xi surgical system. Our model achieves a superior frame-wise state estimation accuracy up to 89.4%, which improves the state-of-the-art surgical state estimation models in both JIGSAWS suturing dataset and our RIOUS dataset.
研究动机与目标
- 通过多模态数据实现实时、细粒度的机器人辅助手术(RAS)子任务时间分割。
- 解决单模态模型难以准确捕捉短时态和频繁切换状态的挑战。
- 开发一个统一框架,整合运动学、视觉和系统事件,以提升状态估计的鲁棒性。
- 在标准数据集(JIGSAWS)和复杂、类真实世界数据集(RIOUS)上评估模型,以证明其泛化能力。
- 探究不同模态(尤其是系统事件)的互补优势,以减少快速切换过程中的估计波动。
提出的方法
- 所提出的Fusion-KVE模型融合三种数据源:机器人运动学、内窥镜视频和da Vinci® Xi手术系统生成的系统事件。
- 视觉特征通过空间卷积神经网络(CNN)提取,并经时间卷积网络(TCN)处理以实现时间建模。
- 基于运动学的状态估计采用TCN和双向LSTM架构,分别利用其在不同持续时间状态下的时间依赖建模优势。
- 系统事件作为独立模态引入,以增强对环境噪声的鲁棒性,并减少快速状态切换过程中的波动。
- 采用加权融合机制,通过学习到的类似注意力的加权因子组合各子模型的预测结果,以根据当前状态优先选择可靠输入。
- 模型采用端到端训练,损失函数为交叉熵损失,并在仅使用当前及历史数据的因果推理设置下进行评估,以确保实时适用性。
实验结果
研究问题
- RQ1与单模态模型相比,融合运动学、视觉和系统事件等多种数据源在细粒度手术状态估计准确率方面有何提升?
- RQ2系统事件在减少快速或短时态切换过程中的估计误差方面,其相对贡献如何?
- RQ3不同时间建模架构(如TCN与LSTM)在手术任务中不同持续时间的状态下表现如何?
- RQ4该统一融合模型在标准数据集(如JIGSAWS)之外的复杂、真实世界手术场景中的泛化能力如何?
- RQ5融合模型中的加权因子矩阵是否能揭示模态可靠性与任务特定特征重要性的洞察?
主要发现
- Fusion-KVE在RIOUS数据集上实现了89.4%的帧级状态估计准确率,显著优于先前最先进模型。
- 与Fusion-KV相比,Fusion-KVE中引入系统事件后,在快速切换和短时态中均显著降低了估计误差。
- 该模型对环境噪声和相机运动表现出更强鲁棒性,其预测波动少于单模态模型。
- 加权因子矩阵显示,TCN在短时态中表现更优,而LSTM在长时态中表现更佳,验证了模型自适应融合策略的有效性。
- RIOUS数据集包含干实验、尸体实验和在体试验,且包含非动作状态,其复杂性高于JIGSAWS,但Fusion-KVE仍保持高准确率。
- 在仅使用当前及历史数据的因果设置中,融合模型仍保持优异性能,证实其具备临床部署所需的实时可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。