Skip to main content
QUICK REVIEW

[论文解读] Robotic Surgery With Lean Reinforcement Learning

Yotam Barnoy, Molly O’Brien|arXiv (Cornell University)|May 3, 2021
Reinforcement Learning in Robotics参考文献 23被引用 10
一句话总结

本文提出首个基于视觉的、无模型强化学习(RL)系统,用于达芬奇技能模拟器(dVSS)的机器人手术,使智能体能够从视觉输入中学习缝合任务。该研究引入了混合批量学习(HBL)方法,结合在线策略与离线策略经验回放缓冲区,使训练速度提升6倍以上,并通过重用基于状态的数据来启动基于图像的学习,实现课程学习。

ABSTRACT

As surgical robots become more common, automating away some of the burden of complex direct human operation becomes ever more feasible. Model-free reinforcement learning (RL) is a promising direction toward generalizable automated surgical performance, but progress has been slowed by the lack of efficient and realistic learning environments. In this paper, we describe adding reinforcement learning support to the da Vinci Skill Simulator, a training simulation used around the world to allow surgeons to learn and rehearse technical skills. We successfully teach an RL-based agent to perform sub-tasks in the simulator environment, using either image or state data. As far as we know, this is the first time an RL-based agent is taught from visual data in a surgical robotics environment. Additionally, we tackle the sample inefficiency of RL using a simple-to-implement system which we term hybrid-batch learning (HBL), effectively adding a second, long-term replay buffer to the Q-learning process. Additionally, this allows us to bootstrap learning from images from the data collected using the easier task of learning from state. We show that HBL decreases our learning times significantly.

研究动机与目标

  • 在高保真度外科模拟环境中实现无模型强化学习,以复现真实世界机器人手术的动力学特性。
  • 通过引入一种新型训练框架,克服强化学习在复杂外科任务中样本效率低下的问题。
  • 在机器人外科手术中实现基于视觉的强化学习,使智能体从图像观测中学习,而非仅依赖状态向量。
  • 通过重用简单、基于状态的任务数据来加速更复杂、基于图像的任务学习。
  • 在真实模拟环境(dVSS-RL)和简化环境(Needle Master)中验证该方法,以实现快速迭代。

提出的方法

  • 作者将达芬奇技能模拟器(dVSS)扩展为dVSS-RL,一种具备刚体与柔体动力学的物理丰富型模拟环境,可真实模拟针头-组织相互作用。
  • 采用无模型深度Q学习算法,结合图像和状态观测,学习如针头定位和缝合等子任务。
  • 提出一种名为混合批量学习(HBL)的新型训练方案,结合标准在线策略经验回放缓冲区与长期离线策略经验回放缓冲区,以提升数据效率。
  • HBL通过超参数α控制在线策略与离线策略数据的加权组合,实现对实时学习与历史轨迹重放的平衡。
  • 该方法通过先在基于状态的数据上训练,再使用相同经验回放缓冲区对基于图像的数据进行微调,支持课程学习。
  • 该框架在dVSS-RL和一个简化的二维环境(称为Needle Master,NMRL)上进行了评估,实现了快速且可扩展的训练。

实验结果

研究问题

  • RQ1能否在高保真度模拟环境中成功应用无模型强化学习于机器人外科手术,且基于视觉观测?
  • RQ2在需要数百万次训练步数的复杂外科环境中,如何缓解强化学习中的样本效率低下问题?
  • RQ3能否有效重用早期简单任务(如基于状态的学习)的离线策略经验数据,以加速更复杂、基于图像的任务学习?
  • RQ4通过HBL结合在线与离线数据,是否能显著缩短外科强化学习的墙 clock 训练时间?
  • RQ5通过HBL实现的课程学习在多大程度上提升了基于视觉的外科强化学习的样本效率?

主要发现

  • 当α = 0.96时,HBL使墙 clock 训练性能提升6.7倍,训练时间从125.6小时缩短至18.8小时。
  • 在缝合任务中,当α = 0.9时,最大累积奖励达到32.0,优于纯在线策略(α = 0)和纯离线策略(α = 1.0)设置。
  • 在Needle Master环境中,基于图像的HBL学习仅需少于一半的训练步数即可达到与从零开始训练相当的成功率。
  • 结合课程学习的HBL使基于图像的学习在样本效率方面超越了原始基于状态的数据采集方法。
  • 该系统成功仅通过视觉输入学习执行缝合任务,标志着首次在具有软组织相互作用的外科机器人模拟中应用基于视觉的强化学习。
  • HBL中长期经验回放缓冲区的使用稳定了学习过程,防止了在α = 1.0时因分布偏移和不稳定性导致的性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。