Skip to main content
QUICK REVIEW

[论文解读] Adaptive Tensegrity Locomotion on Rough Terrain via Reinforcement Learning

David Surovik, Kun Wang|arXiv (Cornell University)|Sep 27, 2018
Structural Analysis and Optimization参考文献 19被引用 5
一句话总结

本文提出了一种基于强化学习的控制器,用于6杆张拉整体机器人,通过改进的引导策略搜索(GPS)框架,实现在复杂崎岖地形上的自适应、非周期性运动。通过引入多模态局部建模和事后数据定位,该方法在具有动态接触响应的复杂不规则地形上实现了鲁棒的越障能力,显著优于以往的周期性控制方法。

ABSTRACT

The dynamical properties of tensegrity robots give them appealing ruggedness and adaptability, but present major challenges with respect to locomotion control. Due to high-dimensionality and complex contact responses, data-driven approaches are apt for producing viable feedback policies. Guided Policy Search (GPS), a sample-efficient and model-free hybrid framework for optimization and reinforcement learning, has recently been used to produce periodic locomotion for a spherical 6-bar tensegrity robot on flat or slightly varied surfaces. This work provides an extension to non-periodic locomotion and achieves rough terrain traversal, which requires more broadly varied, adaptive, and non-periodic rover behavior. The contribution alters the control optimization step of GPS, which locally fits and exploits surrogate models of the dynamics, and employs the existing supervised learning step. The proposed solution incorporates new processes to ensure effective local modeling despite the disorganized nature of sample data in rough terrain locomotion. Demonstrations in simulation reveal that the resulting controller sustains the highly adaptive behavior necessary to reliably traverse rough terrain.

研究动机与目标

  • 在崎岖、非结构化的地形上实现张拉整体机器人的非周期性、自适应运动,克服以往周期性控制策略的局限性。
  • 解决张拉整体机器人在复杂接触动力学下强化学习中出现的杂乱、高维样本数据问题。
  • 扩展引导策略搜索(GPS)框架,通过改进局部动力学建模与数据组织,支持持续的自适应行为。
  • 展示样本高效学习反馈策略的能力,实现稳定穿越陡峭、不规则地形特征。
  • 为其他高维、柔性机器人系统提供可扩展的自适应运动算法基础。

提出的方法

  • 通过修改控制优化步骤,将多模态局部动力学建模引入GPS框架,提升对崎岖地形中杂乱样本数据的拟合能力。
  • 通过聚类实现事后数据定位,将相似状态分组,即使在非周期性、不规则轨迹下也能实现有效的局部代理建模。
  • 利用降维与对称性利用,降低样本复杂度,提升在多样化地形构型下的泛化能力。
  • 应用监督学习,基于优化后的局部动力学模型拟合反馈策略,确保稳定且自适应的控制策略。
  • 采用混合优化流程,交替执行监督学习与局部动力学拟合,在保持样本效率的同时支持复杂行为。
  • 在NTRT仿真环境中,使用6杆张拉整体月球车模型验证该方法,集成真实物理与地形变化。

实验结果

研究问题

  • RQ1基于强化学习的控制器能否在崎岖地形上实现张拉整体机器人的非周期性、自适应运动?
  • RQ2在复杂地形交互产生的杂乱、非周期性样本数据下,如何改进局部动力学建模?
  • RQ3与单模态建模相比,多模态局部建模在控制器性能与鲁棒性方面提升程度如何?
  • RQ4GPS框架能否扩展至支持高维、柔性机器人系统中超越周期步态的持续自适应行为?
  • RQ5事后数据定位在实现非周期性运动任务的有效学习中起到何种作用?

主要发现

  • 所提控制器在崎岖地形上实现了鲁棒的非周期性运动,单个地形特征上净高度提升超过一个杆长的2/3,表现出高度适应性。
  • 多模态拟合相比单模态拟合使代价函数降低超过10%,显著减少了陷入卡滞状态的频率。
  • 控制器在平坦与下坡段保持了900多步(1.5分钟)的平稳质心轨迹,在上坡段展现出自适应响应。
  • 该方法降低了对周期性的依赖,支持任意轴向运动,提升了在狭窄或危险地形构型中的可导航性。
  • 通过事后数据定位与多模态建模,即使在不规则且杂乱的样本数据下,仍能实现有效的局部动力学近似。
  • 控制器对复杂接触几何与地形变化表现出强韧性,在适应性与鲁棒性方面优于以往的周期性控制器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。