[论文解读] Feasibility-Guided Learning for Robust Control in Constrained Optimal Control Problems
该论文提出了一种可行性引导的学习方法,通过优化任意相对阶系统中高阶控制屏障函数(HOCBFs)的参数,以增强约束最优控制中的鲁棒性。通过使用机器学习对可行/不可行参数区域进行分类,并将可微分分类器集成到学习过程中,该方法在时变且未知的危险集下提升了二次规划(QP)的可行性,相较于梯度下降法在基于仿真的机器人导航任务中表现出更优的性能,并具备安全保证。
Optimal control problems with constraints ensuring safety and convergence to desired states can be mapped onto a sequence of real time optimization problems through the use of Control Barrier Functions (CBFs) and Control Lyapunov Functions (CLFs). One of the main challenges in these approaches is ensuring the feasibility of the resulting quadratic programs (QPs) if the system is affine in controls. The recently proposed penalty method has the potential to improve the existence of feasible solutions to such problems. In this paper, we further improve the feasibility robustness (i.e., feasibility maintenance in the presence of time-varying and unknown unsafe sets) through the definition of a High Order CBF (HOCBF) that works for arbitrary relative degree constraints; this is achieved by a proposed feasibility-guided learning approach. Specifically, we apply machine learning techniques to classify the parameter space of a HOCBF into feasible and infeasible sets, and get a differentiable classifier that is then added to the learning process. The proposed feasibility-guided learning approach is compared with the gradient-descent method on a robot control problem. The simulation results show an improved ability of the feasibility-guided learning approach over the gradient-decent method to determine the optimal parameters in the definition of a HOCBF for the feasibility robustness, as well as show the potential of the CBF method for robot safe navigation in an unknown environment.
研究动机与目标
- 解决在具有严格安全约束和紧密控制极限的系统中,基于CBF和CLF的最优控制中二次规划(QP)不可行的挑战。
- 在时变且未知的危险集存在下,提升高相对阶系统中的可行性鲁棒性。
- 开发一种基于学习的方法,以优化HOCBF参数,延迟约束激活时间并最大化鲁棒性。
- 在机器人控制场景中,将可行性引导学习方法与梯度下降法进行比较,验证其性能与安全性的提升。
- 通过可微分、可学习的屏障函数框架,实现在未知或动态环境中的自适应、实时安全导航。
提出的方法
- 通过可调惩罚参数和幂参数对高阶控制屏障函数(HOCBF)进行参数化,以处理任意相对阶约束。
- 利用机器学习将HOCBF参数空间划分为基于QP可行性的可行与不可行区域。
- 训练一个可微分分类器,将HOCBF参数映射到可行性结果,实现端到端优化。
- 将学习到的分类器集成到可行性引导优化(FGO)框架中,以最大化到危险集的最小距离。
- 构建一个约束最优控制问题,使HOCBF约束尽可能晚激活,以增强鲁棒性。
- 在仿真中将FGO方法与梯度下降(GD)进行比较,以分类准确率和可行性鲁棒性作为度量指标。
实验结果
研究问题
- RQ1基于机器学习的分类器是否能提升在未知且时变危险集下,基于CBF和CLF的最优控制中QP的可行性?
- RQ2可行性引导学习(FGO)与梯度下降在优化HOCBF参数以提升鲁棒性方面相比如何?
- RQ3当危险集未知或动态变化时,所提出方法在多大程度上能维持QP的可行性?
- RQ4学习到的HOCBF参数是否能确保在具有移动障碍物的未知环境中实现安全的机器人导航?
- RQ5可微分分类器是否能实现对高相对阶系统中HOCBF参数的有效且可扩展的优化?
主要发现
- 可行性引导学习(FGO)在4000个训练样本上实现了97.0%的分类准确率,显著优于梯度下降法在识别最优HOCBF参数方面的能力。
- 当使用3500个训练样本时,FGO在寻找优于梯度下降解方面表现出28.8%的成功率,且在结合两种方法时实现了5%的性能提升。
- 学习到的HOCBF参数 $(p_1^*, p_2^*, q_1^*, q_2^*) = (0.7426, 1.9745, 1.9148, 0.7024)$ 在所有测试的障碍物配置下(包括不同尺寸和随机运动)均实现了安全的机器人导航。
- 基于CBF的框架在无需全局环境知识的情况下维持了安全保证,而A*和RRT则需要完整的地图信息。
- CBF方法每步计算时间低于0.01秒,显著优于A*(1.3秒)和RRT(0.3秒)在需要频繁重规划的动态环境中的效率。
- 在动态环境中,CBF框架相比A*和RRT展现出更优的适应性与鲁棒性,尤其在障碍物位置快速变化时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。