[论文解读] Learning to Locomote with Deep Neural-Network and CPG-based Control in a Soft Snake Robot
本文提出了一种混合深度强化学习(PPOC-CPG)与中央模式发生器(CPG)的控制框架,用于软体蛇形机器人,实现了自适应目标追踪和多样化的运动模式。通过将基于PPO的策略与独立控制频率和振幅的Matsuoka振子CPG相结合,该系统在仿真和真实世界实验中均实现了稳定、高效且自适应的运动,且在6,400次训练迭代后,策略成功泛化至动态目标。
In this paper, we present a new locomotion control method for soft robot snakes. Inspired by biological snakes, our control architecture is composed of two key modules: A deep reinforcement learning (RL) module for achieving adaptive goal-tracking behaviors with changing goals, and a central pattern generator (CPG) system with Matsuoka oscillators for generating stable and diverse locomotion patterns. The two modules are interconnected into a closed-loop system: The RL module, analogizing the locomotion region located in the midbrain of vertebrate animals, regulates the input to the CPG system given state feedback from the robot. The output of the CPG system is then translated into pressure inputs to pneumatic actuators of the soft snake robot. Based on the fact that the oscillation frequency and wave amplitude of the Matsuoka oscillator can be independently controlled under different time scales, we further adapt the option-critic framework to improve the learning performance measured by optimality and data efficiency. The performance of the proposed controller is experimentally validated with both simulated and real soft snake robots.
研究动机与目标
- 开发一种仿生控制框架,使软体蛇形机器人能够在动态环境中实现自适应、目标追踪的运动。
- 解决高自由度与非线性执行器动力学带来的软体机器人控制挑战,采用混合学习与振荡控制方法。
- 通过利用Matsuoka振子参数(频率与振幅)的时间尺度分离特性,提升强化学习的数据效率与学习性能。
- 在仿真与真实世界的软体蛇形机器人平台中,验证控制器的鲁棒性与泛化能力。
提出的方法
- 训练一个深度强化学习智能体(PPOC-CPG),以调节传递至CPG网络的两个输入:神经刺激(用于相位与振幅调制)以及频率比(用于速度控制)。
- CPG网络由耦合的Matsuoka振子构成,其振荡频率与波幅可独立控制,从而实现多样化的运动模式。
- 系统采用课程学习策略,结合终止函数与频率增益 $K_f$ 的动态调整,以提升样本效率与收敛性。
- 在仿真训练中应用领域随机化,通过在测量值附近的分布中采样摩擦等物理参数,以减少仿真到现实的域差距。
- 通过动作捕捉系统实现实时状态反馈与低延迟无线控制,将策略直接迁移到真实的软体蛇形机器人上。
- 在静态与缓慢移动目标的到达任务中对控制器进行评估,验证了其鲁棒性与适应性。
实验结果
研究问题
- RQ1基于混合深度强化学习与CPG的控制系统能否在具有复杂非线性动力学的软体蛇形机器人中实现自适应目标追踪?
- RQ2如何通过独立控制Matsuoka振子的频率与振幅来提升运动多样性与学习效率?
- RQ3在仿真中训练的策略在现实世界软体机器人运动中,能在多大程度上实现泛化,且仅需极少的仿真到现实迁移工作?
- RQ4课程学习与领域随机化能否提升软体机器人运动训练中的数据效率与收敛性?
主要发现
- PPOC-CPG控制器在6,400次训练迭代后收敛至接近最优策略,使用4个并行机器人,总训练时间约为12小时。
- 该策略在仿真与真实世界实验中均成功追踪了静态与缓慢移动的目标,证明了其在固定目标训练之外的泛化能力。
- 真实机器人平均速度达到0.092 m/s,与在调参后摩擦参数匹配的仿真机器人平均速度0.083 m/s非常接近。
- 控制器表现出双阶段运动策略:当距离目标较远时,以低频高速移动;接近目标时切换至高频,实现精确逼近与转向。
- 通过领域随机化,系统对仿真不准确性表现出鲁棒性,提升了现实世界迁移性能。
- 在仿真与真实机器人之间观察到状态演化存在延迟,可能源于接触动力学建模不准确,提示需要改进物理建模或引入自适应反馈机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。