[论文解读] Towards Safe Control of Continuum Manipulator Using Shielded Multiagent Reinforcement Learning
本文提出了一种屏蔽式多智能体深度Q网络(MADQN)强化学习框架,用于在微创手术中对缆索驱动的连续体机械臂实现安全、高精度的控制。通过将控制问题形式化为单自由度、单智能体问题,并集成动态动作集屏蔽机制,该方法在外部负载、软性障碍物和刚性碰撞条件下均实现了亚毫米级跟踪精度,展示了在复杂手术场景下的鲁棒性与安全性。
Continuum robotic manipulators are increasingly adopted in minimal invasive surgery. However, their nonlinear behavior is challenging to model accurately, especially when subject to external interaction, potentially leading to poor control performance. In this letter, we investigate the feasibility of adopting a model-free multiagent reinforcement learning (RL), namely multiagent deep Q network (MADQN), to control a 2-degree of freedom (DoF) cable-driven continuum surgical manipulator. The control of the robot is formulated as a one-DoF, one agent problem in the MADQN framework to improve the learning efficiency. Combined with a shielding scheme that enables dynamic variation of the action set boundary, MADQN leads to efficient and importantly safer control of the robot. Shielded MADQN enabled the robot to perform point and trajectory tracking with submillimeter root mean square errors under external loads, soft obstacles, and rigid collision, which are common interaction scenarios encountered by surgical manipulators. The controller was further proven to be effective in a miniature continuum robot with high structural nonlinearitiy, achieving trajectory tracking with submillimeter accuracy under external payload.
研究动机与目标
- 解决在难以精确建模的微创手术中控制高度非线性、柔顺的连续体机械臂的挑战。
- 克服依赖精确动力学模型和力传感的传统模型控制方法在手术环境中往往不切实际的局限性。
- 开发一种无需模型、基于数据的控制方法,确保在不可预测的外部交互下具备安全性和高精度。
- 实现对具有复杂结构非线性和实时环境扰动的连续体机械臂的高效且稳定的训练。
- 在标准和微型连续体机械臂上验证该方法的有效性,这些机械臂具有高载荷重量比和极高柔顺性。
提出的方法
- 在多智能体深度Q网络(MADQN)框架内,将控制问题形式化为单自由度、单智能体问题,以提升学习效率。
- 实施一种屏蔽方案,动态调整动作集边界,以防止不安全动作并确保探索过程中的安全性。
- 采用带经验回放和目标网络的深度Q网络(DQN),以稳定训练并提升策略收敛性。
- 使用惩罚跟踪误差并鼓励收敛至期望轨迹的奖励函数来训练智能体。
- 将实时接触力反馈(通过力矩传感器获取)集成到状态空间中,以增强对扰动的感知与响应能力。
- 在物理2自由度缆索驱动连续体机械臂上,于各种外部负载和碰撞场景下,应用训练好的策略进行闭环控制。
实验结果
研究问题
- RQ1无模型的多智能体强化学习方法是否能在外部负载和碰撞条件下,实现对连续体机械臂的亚毫米级跟踪精度?
- RQ2屏蔽机制在高维、非线性控制空间中的探索过程中,如何提升安全性和稳定性?
- RQ3MADQN在多大程度上可泛化至具有高度结构非线性和极端柔顺性的机器人,例如微型镍钛诺基神经外科机械臂?
- RQ4在相同扰动条件下,屏蔽式MADQN与传统基于运动学的最优控制器(KMOC)的性能相比如何?
- RQ5屏蔽机制是否能有效应对未知的突发扰动(如刚性碰撞),同时不损害系统稳定性?
主要发现
- 在10 g外部载荷下,屏蔽式MADQN在微型镍钛诺基连续体机械臂上实现了亚毫米级均方根(RMS)跟踪误差——圆形轨迹为0.41 mm,方形轨迹为0.45 mm。
- 在施加2 N力持续100秒的刚性碰撞下,控制器的最大跟踪误差为0.62 mm,且扰动后误差始终低于0.5 mm。
- 该方法优于基于运动学的最优控制器(KMOC),后者在相同载荷条件下RMS误差分别为1.22 mm(圆形)和2.14 mm(方形)。
- 屏蔽机制在动态扰动(包括软性障碍物和外部负载)下实现了稳定控制,未出现跟踪丢失或系统失稳现象。
- 控制器在高结构非线性场景下表现出鲁棒性和适应性,例如在直径2.2 mm、具有超弹性材料行为的镍钛诺机器人中表现优异。
- 实时力反馈的集成增强了对扰动的检测与响应能力,显著提升了控制器从意外碰撞中恢复的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。