Skip to main content
QUICK REVIEW

[论文解读] A Novel Sample-efficient Deep Reinforcement Learning with Episodic Policy Transfer for PID-Based Control in Cardiac Catheterization Robots

Olatunji Mumini Omisore, Toluwanimi Oluwadara Akinyemi|arXiv (Cornell University)|Oct 28, 2021
Mechanical Circulatory Support Devices参考文献 20被引用 8
一句话总结

本文提出了一种样本高效的深度强化学习框架,结合了周期性策略迁移,用于机器人心脏导管介入术中的自适应PID调参。通过实现在不同周期之间的连续策略迁移,该智能体在轴向运动控制中实现了仅0.003 mm的平均误差,显著提升了模拟环境和真实实验中的稳定性和性能。

ABSTRACT

Robotic catheterization is typically used for percutaneous coronary intervention procedures nowadays and it involves steering flexible endovascular tools to open up occlusion in the coronaries. In this study, a sample-efficient deep reinforcement learning with episodic policy transfer is, for the first time, used for motion control during robotic catheterization with fully adaptive PID tuning strategy. The reinforcement model aids the agent to continuously learn from its interactions in its environment and adaptively tune PID control gains for axial navigation of endovascular tool. The model was validated for axial motion control of a robotic system designed for intravascular catheterization. Simulation and experimental trials were done to validate the application of the model, and results obtained shows it could self-tune PID gains appropriately for motion control of a robotic catheter system. Performance comparison with conventional methods in average of 10 trials shows the agent tunes the gain better with error of 0.003 mm. Thus, the proposed model would offer more stable set-point motion control robotic catheterization.

研究动机与目标

  • 解决在机器人导管控制中深度强化学习样本效率低下的挑战。
  • 实现在柔性血管内工具轴向导航过程中实时、自适应的PID增益调参。
  • 提升机器人心脏导管介入系统中运动控制的稳定性和准确性。
  • 通过专用机器人平台的仿真与实验验证所提出方法的有效性。
  • 展示该方法相较于传统PID调参方法的优越性能。

提出的方法

  • 该框架采用深度强化学习(DRL)使智能体通过与环境的交互学习最优PID增益。
  • 实施周期性策略迁移,将先前周期的知识迁移至当前周期,提升样本效率并加速收敛。
  • 智能体根据导管轴向位置的实时反馈,持续自适应调整PID控制参数(Kp, Ki, Kd)。
  • 设计了奖励函数以惩罚位置误差和控制努力,引导智能体实现稳定、精确的运动。
  • 该方法被集成到机器人导管介入系统中,用于在仿真和物理环境中实现轴向导航。
  • 训练过程采用经验回放和目标网络以稳定学习,这是基于DQN方法的典型做法。

实验结果

研究问题

  • RQ1周期性策略迁移是否能显著提升在机器人导管控制中深度强化学习的样本效率?
  • RQ2智能体在实时环境中能否有效自适应调整PID增益,以维持精确的轴向运动控制?
  • RQ3与传统PID调参方法相比,该方法在控制精度方面带来了多大的性能提升?
  • RQ4该模型在仿真与真实实验中的泛化能力如何?
  • RQ5在动态血管环境中,智能体能否实现稳定的目标点控制并保持最小的跟踪误差?

主要发现

  • 在10次试验中,该方法实现了仅0.003 mm的平均跟踪误差,证明了其在轴向运动控制中的高精度。
  • 与传统PID调参相比,该智能体表现出更优的性能,位置误差显著降低,稳定性明显提升。
  • 周期性策略迁移实现了更快的收敛速度和更优的样本效率,减少了有效学习所需的周期数。
  • 该方法在仿真和真实实验中均成功得到验证,证实了其鲁棒性与实际应用潜力。
  • 自适应PID调参策略实现了增益的持续在线调整,增强了对导管环境动态变化的响应能力。
  • 该框架展示了稳定的设定点控制,这对安全有效的经皮冠状动脉介入手术至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。