[论文解读] Episodic Learning for Safe Bipedal Locomotion with Control Barrier Functions and Projection-to-State Safety
本文提出了一种基于经验学习的框架,结合控制屏障函数(CBFs)与投影到状态安全(PSSf),以减少双足行走中的模型不确定性。通过在闭环试验中迭代学习扰动估计,该方法在动态行走中提升了安全性和精确度,已在仿真和AMBER-3M机器人上得到验证,仿真中屏障函数违规减少了85%,硬件实验中减少了79%。
This paper combines episodic learning and control barrier functions in the setting of bipedal locomotion. The safety guarantees that control barrier functions provide are only valid with perfect model knowledge; however, this assumption cannot be met on hardware platforms. To address this, we utilize the notion of projection-to-state safety paired with a machine learning framework in an attempt to learn the model uncertainty as it affects the barrier functions. The proposed approach is demonstrated both in simulation and on hardware for the AMBER-3M bipedal robot in the context of the stepping-stone problem, which requires precise foot placement while walking dynamically.
研究动机与目标
- 为解决在动态步态(如跨石步态任务)中双足机器人安全关键控制的模型不确定性挑战。
- 通过将学习与控制屏障函数相结合,实现在模型知识不完善情况下的鲁棒安全保证。
- 开发一种数据高效的经验学习框架,提升扰动估计精度,而无需依赖大量输入数据多样性。
- 首次在硬件上实验验证CBFs在双足机器人安全关键控制中的应用。
- 通过迭代学习减少足部放置过程中的屏障函数违规,提升在石块上行走的可靠性。
提出的方法
- 该方法采用经验学习循环,机器人执行行走试验,收集状态与控制数据,并更新学习到的扰动模型。
- 采用监督学习框架,估计标称模型与真实系统动力学之间的偏差,特别关注影响屏障函数的扰动。
- 将学习到的扰动整合入基于CBF的二次规划(CBF-QP),生成能保持集合不变性的更安全控制输入。
- 使用投影到状态安全(PSSf)来限制模型不确定性的效应,确保即使在知识不完善的情况下仍能保证安全。
- 控制器在多轮经验中迭代更新,优化扰动估计并减少屏障函数违规。
- 该方法采用采样数据优化控制器(SS-QP),在硬件和仿真中均以1kHz运行。
实验结果
研究问题
- RQ1经验学习能否有效减少基于CBF的安全控制中双足机器人的模型不确定性?
- RQ2基于学习的扰动估计在跨石步态动态行走中如何改善屏障函数的满足程度?
- RQ3尽管存在模型不准确,CBFs能否在真实双足机器人上成功部署于安全关键控制?
- RQ4学习过程在仿真和硬件中在多大程度上减少了屏障函数违规的幅值?
- RQ5与假设最坏情况不确定性的鲁棒CBF变体相比,所提方法在性能和保守性方面表现如何?
主要发现
- 在仿真中,足部放置期间的最大屏障函数违规从2.0 cm降低至0.3 cm,降幅达85%。
- 在硬件上,经过两次学习周期后,最大违规从9.2 cm降至1.9 cm,违规幅值减少79%。
- 所提方法成功实现了对8 cm宽石块的安全穿越,实际石块尺寸为10 cm,以容纳残余不确定性。
- 学习到的扰动模型成功捕捉了关节摩擦及质量/惯性参数的不匹配,提升了控制精度。
- 经学习扰动增强的SS-QP控制器实现了稳定、动态行走,且未表现出过度保守性,而鲁棒$ar{\rho}$-CBF-QP则存在此问题。
- 首次成功在硬件上实现了基于CBF的安全控制在双足机器人上的实验验证,采用此学习增强框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。