[论文解读] Risk-Averse Planning via CVaR Barrier Functions: Application to Bipedal Robot Locomotion
本文提出条件风险价值(CVaR)障碍函数,以在随机离散时间系统中实现风险规避型安全控制,特别适用于存在不确定性的双足机器人行走。通过基于差分凸规划(DCP)的控制器综合方法,该方法在最小干扰既有控制器的同时,确保最坏情况下的安全性,已在Cassie机器人上通过高保真度仿真得到验证,模型不确定性下碰撞规避性能显著提升。
Enforcing safety in the presence of stochastic uncertainty is a challenging problem. Traditionally, researchers have proposed safety in the statistical mean as a safety measure in this case. However, ensuring safety in the statistical mean is only reasonable if system's safe behavior in the large number of runs is of interest, which precludes the use of mean safety in practical scenarios. In this paper, we propose a risk sensitive notion of safety called conditional-value-at-risk (CVaR) safety, which is concerned with safe performance in the worst case realizations. We introduce CVaR barrier functions as a tool to enforce CVaR-safety and propose conditions for their Boolean compositions. Given a legacy controller, we show that we can design a minimally interfering CVaR-safe controller via solving difference convex programs. We elucidate the proposed method by applying it to a bipedal robot locomotion case study.
研究动机与目标
- 解决基于均值的安全度量在随机机器人系统中的局限性,这些度量无法有效防范罕见但灾难性的故障。
- 开发一种风险敏感的安全框架,优先考虑最坏情况性能而非平均情况行为。
- 设计一种计算上可行的方法,用于合成CVaR安全控制器,同时对现有既有控制器的干扰最小化。
- 在模型不确定性与动态障碍物条件下,于高保真双足机器人模型上验证该方法。
- 将障碍函数的应用从概率安全性扩展至CVaR等一致风险度量,以提升鲁棒性。
提出的方法
- 引入CVaR障碍函数作为工具,用于在随机不确定性的最坏实现中强制执行安全约束,其定义基于条件风险价值(CVaR)风险度量。
- 提出CVaR障碍函数的布尔组合条件,以处理多个安全约束,例如避免多个障碍物。
- 开发差分凸规划(DCP)公式,用于合成最小化与给定既有控制器偏差的CVaR安全控制器。
- 将该方法应用于具有加法不确定性的一维离散时间随机系统,使用采样多面体集表示模型不确定性。
- 在每个时间步使用模型预测控制(MPC)框架结合DCP优化,实时计算安全控制输入。
- 采用基于随机仿真的方法估计不确定性分布,假设采样模型实现的分布为均匀分布。
实验结果
研究问题
- RQ1CVaR障碍函数是否能有效在随机机器人系统的最坏情况下实现安全控制?
- RQ2如何在最小化对既有控制器干扰的前提下,正式将CVaR安全性整合进控制器综合过程?
- RQ3何种计算框架可实现双足机器人在不确定性下风险规避控制器的实时应用?
- RQ4CVaR安全控制与风险中性或基于均值的安全控制相比,在碰撞规避任务中的表现如何?
- RQ5CVaR障碍函数的布尔组合能否有效处理复杂多障碍物环境?
主要发现
- 当β = 0.1时,所提出的CVaR障碍函数在直线路径障碍物场景中成功防止了碰撞,而风险中性和基于均值的方法均失败。
- 当β = 0.5时,机器人在保持前向行走行为的同时,成功实现了与倾斜墙壁的安全距离,展示了有效的横向适应能力。
- 在双墙多障碍物场景中,β = 0.5的CVaR安全控制器通过保持min(h₁, h₂) ≥ 0,成功避免了碰撞。
- DCP求解器在每步内完成100–700次迭代,耗时少于10秒,可在标准笔记本电脑上实现实时应用。
- 该方法在高保真Cassie机器人仿真中,既保持了原有既有MPC控制器的轨迹,又在随机不确定性下确保了安全性。
- 如图1(c)所示,该方法在最坏情况下的表现优于风险中性和基于均值的安全方法,CVaR安全控制即使在其他方法失败时仍能确保避障。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。