Skip to main content
QUICK REVIEW

[论文解读] Ultrasound-Guided Robotic Navigation with Deep Reinforcement Learning

Hannes Hase, Mohammad Farid Azampour|arXiv (Cornell University)|Mar 30, 2020
Robotic Path Planning Algorithms参考文献 22被引用 4
一句话总结

本文提出了一种基于深度强化学习(DRL)的超声引导机器人导航框架,利用实时超声(US)图像作为输入,自主导航至骶骨。通过结合记忆增强型DQN与二分类器以确定停止动作,该方法在未见过的模拟环境中从165个起始位置导航至骶骨的成功率达到82.91%,在策略正确性上优于纯DRL和监督学习基线方法20–30%,在可达性上优于40–60%。

ABSTRACT

In this paper we introduce the first reinforcement learning (RL) based robotic navigation method which utilizes ultrasound (US) images as an input. Our approach combines state-of-the-art RL techniques, specifically deep Q-networks (DQN) with memory buffers and a binary classifier for deciding when to terminate the task. Our method is trained and evaluated on an in-house collected data-set of 34 volunteers and when compared to pure RL and supervised learning (SL) techniques, it performs substantially better, which highlights the suitability of RL navigation for US-guided procedures. When testing our proposed model, we obtained a 82.91% chance of navigating correctly to the sacrum from 165 different starting positions on 5 different unseen simulated environments.

研究动机与目标

  • 开发一种端到端的自主机器人导航系统,用于仅基于超声图像输入的超声引导脊柱介入手术。
  • 克服超声成像中信号噪声比低、图像伪影多以及观察者间差异大的挑战,以支持机器人导航。
  • 解决强化学习中由于稀疏且高惩罚性奖励导致的最优停止动作学习困难问题。
  • 通过结合二分类器的混合学习方法,提升在未见解剖环境中的泛化能力与鲁棒性。
  • 证明在实时、无辐射的超声引导手术中,基于强化学习的导航方法在最小人工干预下具有可行性。

提出的方法

  • 使用优先经验回放训练记忆增强型深度Q网络(M-DQN),以稳定稀疏奖励导航中的学习过程并提高样本效率。
  • 集成二分类器以预测智能体应何时终止导航,解决纯DRL中‘停止’动作难度高且奖励稀疏的问题。
  • 将DQN策略与分类器结合,形成混合决策系统:DQN基于状态值估计选择动作,分类器判断任务是否完成。
  • 基于34名志愿者的内部超声数据构建模拟环境,用于在多样化解剖变异下训练和评估智能体。
  • 采用状态值估计与优势值估计指导动作选择,MS-DQN变体在状态值估计准确性方面表现更优。
  • 使用奖励函数进行系统训练,对错误动作施加惩罚,对靠近骶骨的位置给予奖励,并对正确停止动作施加较大正向奖励。

实验结果

研究问题

  • RQ1深度强化学习能否有效应用于仅以原始超声图像作为输入的超声引导机器人导航?
  • RQ2在稀疏奖励导航任务中,集成用于停止决策的二分类器相较于纯DRL方法在性能上提升多少?
  • RQ3DQN架构中的记忆机制在未见模拟环境中在策略稳定性和泛化能力方面提升程度如何?
  • RQ4与纯DQN和监督分类基线相比,所提出的混合DRL-SL方法在成功率和鲁棒性方面表现如何?
  • RQ5尽管超声图像外观差异大,该方法在多样化解剖结构和未见环境中是否仍具备泛化能力?

主要发现

  • 所提方法在5个未见模拟环境中,从165个不同起始位置导航至骶骨的成功率达到82.91%。
  • 结合二分类器的混合DQN在策略正确性上优于纯DQN(V-DQN和M-DQN)20–30%,在可达性上优于40–60%。
  • 引入二分类器显著缓解了‘停止’动作学习的挑战,该动作在初始探索中因惩罚重且极少被正确执行而难以掌握。
  • MS-DQN变体(结合记忆与分类器)生成的状态值估计最接近真实值,表明其对环境状态的理解更优。
  • 与监督学习基线相比,该方法在未见环境中的泛化能力更优,后者在循环形成和目标到达方面表现困难。
  • 结果证实,混合DRL-SL方法在稀疏奖励的复杂现实医疗导航任务中,比纯强化学习或监督学习更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。