Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning for Tensegrity Robot Locomotion

Marvin Zhang, Xinyang Geng|arXiv (Cornell University)|Sep 28, 2016
Structural Analysis and Optimization参考文献 30被引用 11
一句话总结

本文提出了一种基于镜面下降引导策略搜索(MDGPS)的深度强化学习方法,用于学习张拉整体机器人的周期性、反馈式运动策略。该方法在仿真中成功训练出一种可泛化至真实环境的策略,使物理世界中的SUPERball机器人首次实现了连续、可靠的滚动步态,仅依赖机载加速度计反馈,100秒内实现了最高12米的运动距离。

ABSTRACT

Tensegrity robots, composed of rigid rods connected by elastic cables, have a number of unique properties that make them appealing for use as planetary exploration rovers. However, control of tensegrity robots remains a difficult problem due to their unusual structures and complex dynamics. In this work, we show how locomotion gaits can be learned automatically using a novel extension of mirror descent guided policy search (MDGPS) applied to periodic locomotion movements, and we demonstrate the effectiveness of our approach on tensegrity robot locomotion. We evaluate our method with real-world and simulated experiments on the SUPERball tensegrity robot, showing that the learned policies generalize to changes in system parameters, unreliable sensor measurements, and variation in environmental conditions, including varied terrains and a range of different gravities. Our experiments demonstrate that our method not only learns fast, power-efficient feedback policies for rolling gaits, but that these policies can succeed with only the limited onboard sensing provided by SUPERball's accelerometers. We compare the learned feedback policies to learned open-loop policies and hand-engineered controllers, and demonstrate that the learned policy enables the first continuous, reliable locomotion gait for the real SUPERball robot. Our code and other supplementary materials are available from http://rll.berkeley.edu/drl_tensegrity

研究动机与目标

  • 为解决张拉整体机器人控制问题,其具有复杂的欠驱动动力学特性,且难以通过手工设计的方法进行控制。
  • 开发一种基于学习的方法,自动发现高效、周期性的运动步态,而无需依赖手工设计的策略类别或示范。
  • 实现对不同环境条件、系统参数和传感器噪声的鲁棒泛化,尤其针对真实世界部署。
  • 证明通过深度强化学习学习到的反馈策略在真实硬件上可优于开环策略和手工设计的控制器。

提出的方法

  • 将镜面下降引导策略搜索(MDGPS)扩展至处理周期性运动,通过从多样化初始状态顺序训练简单策略,以捕捉稳定的步态行为。
  • 使用深度神经网络表示最终策略,实现表达性强的闭环控制,可自适应传感器反馈。
  • 实施课程学习策略,先训练多个短时域策略,以提供最终策略的强初始化。
  • 利用仿真环境训练策略,随后直接将策略迁移到真实的SUPERball机器人上,仅需极少微调。
  • 利用机载加速度计反馈实现实时自适应,补偿仿真与真实硬件之间的差异。
  • 采用奖励塑形策略,鼓励向前推进、能量效率以及长时域内的稳定周期性运动。

实验结果

研究问题

  • RQ1能否使用深度强化学习在不依赖手工设计策略结构的前提下,学习到张拉整体机器人的稳定、周期性运动步态?
  • RQ2在仿真中训练的策略在存在传感器噪声、执行器延迟和机械非线性的实际硬件上泛化效果如何?
  • RQ3学习到的反馈策略在鲁棒性和适应性方面是否优于开环策略和手工设计的控制器?
  • RQ4单个策略是否能在不重新训练的情况下泛化至重力、地形和机器人参数的变化?

主要发现

  • 所学习的反馈策略在物理世界的SUPERball机器人上实现了连续、可靠的运动,在三次试验中均实现了100秒内最高12米的移动距离。
  • 该策略对重力、地形和系统参数的变化具有良好的泛化能力,表现出对环境和硬件变化的鲁棒性。
  • 该策略仅依赖机载加速度计反馈,成功适应了真实世界条件,克服了仿真与现实之间的差异。
  • 开环策略因电机动力学不匹配和缆绳滞后效应而完全失效,凸显了反馈机制的必要性。
  • 所学习的策略相比以往控制器表现出更低风险和更高可靠性,减少了硬件应力并提升了安全性。
  • 该方法仅需数百次训练试验,表明未来在真实世界中直接训练也具有可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。