Skip to main content
QUICK REVIEW

[论文解读] Model-based Constrained Reinforcement Learning using Generalized Control Barrier Function

Haitong Ma, Jianyu Chen|arXiv (Cornell University)|Mar 2, 2021
Vehicle emissions and performance被引用 8
一句话总结

该论文提出了一种基于模型的约束强化学习方法,采用广义控制屏障函数(GCBF)以提升安全性和样本效率。通过利用模型预测的轨迹来惩罚可能使系统趋向约束边界的动作,该方法在训练过程中避免违反安全约束,实现高达73.83%的约束违规减少和3.36倍的更快收敛速度,优于基线方法。

ABSTRACT

Model information can be used to predict future trajectories, so it has huge potential to avoid dangerous region when implementing reinforcement learning (RL) on real-world tasks, like autonomous driving. However, existing studies mostly use model-free constrained RL, which causes inevitable constraint violations. This paper proposes a model-based feasibility enhancement technique of constrained RL, which enhances the feasibility of policy using generalized control barrier function (GCBF) defined on the distance to constraint boundary. By using the model information, the policy can be optimized safely without violating actual safety constraints, and the sample efficiency is increased. The major difficulty of infeasibility in solving the constrained policy gradient is handled by an adaptive coefficient mechanism. We evaluate the proposed method in both simulations and real vehicle experiments in a complex autonomous driving collision avoidance task. The proposed method achieves up to four times fewer constraint violations and converges 3.36 times faster than baseline constrained RL approaches.

研究动机与目标

  • 为解决无模型约束强化学习中探索过程不可避免导致的固有安全风险。
  • 通过减少对长时域轨迹采样的依赖,提升约束强化学习的样本效率,避免因预测精度下降和采样成本增加带来的问题。
  • 开发一种基于模型的方法,利用预测动力学通过惩罚趋向约束边界的趋势来实现安全,而非在每次轨迹回放步骤中强制执行约束。
  • 引入自适应系数机制,在策略优化不可行时增强约束满足能力。
  • 在仿真和真实自动驾驶车辆实验中验证该方法在碰撞规避方面的有效性。

提出的方法

  • 该方法采用广义控制屏障函数(GCBF),通过惩罚系统到约束边界的距离变化率,而非在每个时间步强制执行约束。
  • 利用短时域(1–2步)的模型预测轨迹来估计系统未来状态,并计算GCBF惩罚项。
  • 通过近似拉格朗日方法计算约束策略梯度,将GCBF惩罚整合到演员更新中,以保持可行性。
  • 引入自适应保守性系数,动态调整GCBF惩罚强度,在优化不可行时提升收敛性。
  • 结合基于模型的预测与屏障函数约束,实现在训练过程中避免约束违规,同时保持高样本效率。
  • 该方法在真实自动驾驶车辆平台上采用并行车载架构实现,控制器与规划器均基于神经网络。

实验结果

研究问题

  • RQ1能否利用基于模型的预测在不依赖长时域轨迹回放的情况下提升约束强化学习的安全性?
  • RQ2在约束边界距离上构建的广义控制屏障函数(GCBF)是否能有效防止策略训练过程中的约束违规?
  • RQ3与多步约束强制执行相比,使用短时域GCBF约束是否能提升样本效率?
  • RQ4当原始公式在优化中变得不可行时,自适应系数机制是否能增强约束策略优化的可行性?
  • RQ5所提出的方法是否在真实自动驾驶任务中实现了更优的安全性和收敛性能?

主要发现

  • 与基线约束强化学习方法相比,所提方法在训练过程中将约束违规减少了高达73.83%。
  • 该方法相比基线基于模型的约束强化学习,收敛速度提升了3.36倍,显著提升了样本效率。
  • 在真实车辆实验中,所学习的策略成功执行了多种碰撞规避行为,包括减速、加速、紧急制动和路径偏移。
  • 该算法在九种复杂交通场景中表现出鲁棒性能,包括左转、直行和右转,且周围车辆配置各异。
  • 理论分析证明,GCBF公式所需的每轮更新采样步数最少,支持其效率优势。
  • 尽管有所改进,但由于采用近似求解技术,仍存在约束违规情况,表明未来可通过增强拉格朗日等方法进一步优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。