[论文解读] One to Many: Adaptive Instrument Segmentation via Meta Learning and Dynamic Online Adaptation in Robotic Surgical Video
该论文提出MDAL,一种元学习与动态在线自适应框架,仅需首帧标注即可实现对预训练腹腔镜器械分割模型在新型机器人手术视频上的快速、少样本适应。通过采用基于任务的元训练和梯度门机制以过滤噪声伪标签,MDAL在极少微调下实现最先进性能,在仅5次适应步骤后即超越基线模型,且在分布偏移下仍保持鲁棒性。
Surgical instrument segmentation in robot-assisted surgery (RAS) - especially that using learning-based models - relies on the assumption that training and testing videos are sampled from the same domain. However, it is impractical and expensive to collect and annotate sufficient data from every new domain. To greatly increase the label efficiency, we explore a new problem, i.e., adaptive instrument segmentation, which is to effectively adapt one source model to new robotic surgical videos from multiple target domains, only given the annotated instruments in the first frame. We propose MDAL, a meta-learning based dynamic online adaptive learning scheme with a two-stage framework to fast adapt the model parameters on the first frame and partial subsequent frames while predicting the results. MDAL learns the general knowledge of instruments and the fast adaptation ability through the video-specific meta-learning paradigm. The added gradient gate excludes the noisy supervision from pseudo masks for dynamic online adaptation on target videos. We demonstrate empirically that MDAL outperforms other state-of-the-art methods on two datasets (including a real-world RAS dataset). The promising performance on ex-vivo scenes also benefits the downstream tasks such as robot-assisted suturing and camera control.
研究动机与目标
- 为解决机器人手术视频分割中的领域偏移问题,即在某一数据集上训练的模型因分布差异而在新临床领域表现不佳。
- 实现在仅需极少标注(具体为仅首帧器械掩码)的情况下,将单一源模型快速有效地适应至多个新目标领域。
- 开发一种方法,即使在真实手术视频中存在外观变化、运动模糊和遮挡等挑战,仍能保持高精度分割。
- 通过提供准确、实时的器械分割结果,支持下游机器人任务(如自主摄像控制与机器人辅助缝合)。
- 通过实现高效的在线自适应,减少对新手术场所或手术类型进行大量重训练或标注的需求。
提出的方法
- MDAL采用两阶段框架:在源域视频上进行元学习以获得可泛化的初始化参数,随后在目标视频上进行动态在线自适应。
- 该方法采用视频特定的元学习范式,训练模型以仅凭首帧标注即可快速适应新领域。
- 引入梯度门机制,仅当后续帧生成的伪标签导致分割损失降低时才更新模型参数,从而过滤噪声或不可靠的更新。
- 模型使用元学习得到的参数(θ*, α*)进行初始化,并通过在首帧及部分后续帧上进行少步随机梯度下降进行微调。
- 该框架利用前序帧生成的伪掩码实现在线自适应,但仅在损失改善时才更新模型,确保自适应过程稳定且准确。
- 该方法在源数据(如EndoVis17)上端到端训练,随后直接应用于目标领域(如HKPWH、DSS、PSH)而无需进一步预训练。
实验结果
研究问题
- RQ1能否仅凭首帧标注,将单一预训练分割模型快速适应至新型机器人手术视频?
- RQ2如何使模型自适应对源域与目标域之间分布偏移保持鲁棒性?
- RQ3通过引入梯度门机制的动态在线自适应,能否随时间推移持续提升分割精度并有效过滤噪声伪标签?
- RQ4元学习在多大程度上提升了手术器械分割任务中的零样本泛化能力与快速适应性能?
- RQ5所提方法能否支持下游机器人任务(如自主摄像控制与机器人辅助缝合)?
主要发现
- MDAL在仅5次适应步骤后即超越微调基线模型,优于基线模型在100次迭代下的表现。
- 在未进行任何自适应(K=0)的情况下,元训练模型的IoU至少比微调基线高5.4%,证明元学习具有强大的泛化能力。
- 在HKPWH数据集上,在线自适应使最后30%帧的平均IoU显著提升,表明性能可长期维持。
- 梯度门机制相比朴素在线自适应具有更稳定的性能表现,因其可避免由噪声伪标签引发的有害更新。
- 在离体数据集(DSS与PSH)上,MDAL成功适应具有显著分布偏移的新场景,仅需首帧标注约2.6秒即可实现准确分割。
- 该方法支持实用的下游应用:一致的器械分割结果可支持机器人辅助缝合与自主摄像控制,实现实时性能(约4 fps)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。