[论文解读] Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk
该论文提出了一种新型的安全强化学习算法——条件风险价值-近端策略优化(CVaR-Proximal-Policy-Optimization, CPPO),该算法利用条件风险价值(CVaR)来约束在状态转移扰动和观测扰动下的风险。通过在理论层面将性能退化与价值函数范围(VFR)相联系,CPPO 在不过度惩罚最坏情况结果的前提下优化鲁棒性,在 MuJoCo 连续控制任务中,对两类扰动均实现了更高的累积奖励和更优的鲁棒性。
Though deep reinforcement learning (DRL) has obtained substantial success, it may encounter catastrophic failures due to the intrinsic uncertainty of both transition and observation. Most of the existing methods for safe reinforcement learning can only handle transition disturbance or observation disturbance since these two kinds of disturbance affect different parts of the agent; besides, the popular worst-case return may lead to overly pessimistic policies. To address these issues, we first theoretically prove that the performance degradation under transition disturbance and observation disturbance depends on a novel metric of Value Function Range (VFR), which corresponds to the gap in the value function between the best state and the worst state. Based on the analysis, we adopt conditional value-at-risk (CVaR) as an assessment of risk and propose a novel reinforcement learning algorithm of CVaR-Proximal-Policy-Optimization (CPPO) which formalizes the risk-sensitive constrained optimization problem by keeping its CVaR under a given threshold. Experimental results show that CPPO achieves a higher cumulative reward and is more robust against both observation and transition disturbances on a series of continuous control tasks in MuJoCo.
研究动机与目标
- 为解决安全强化学习中同时处理状态转移和观测扰动的统一分析与方法缺失问题。
- 通过引入基于 CVaR 的风险敏感目标,克服基于最坏情况方法的过度悲观问题。
- 通过价值函数范围(VFR)理论连接在结构上不同的扰动(状态转移 vs. 观测)下的策略鲁棒性。
- 开发一种实用算法 CPPO,通过在轨迹回报上施加 CVaR 约束来提升鲁棒性,同时不牺牲平均性能。
- 通过实证验证 CPPO 在状态转移和观测扰动下,鲁棒性和累积回报方面的优越性。
提出的方法
- 理论分析表明,状态转移和观测扰动下的性能退化受价值函数范围(VFR)的限制,VFR 定义为最优和最差状态值之间的差距。
- 采用轨迹回报的 CVaR 作为风险度量,证明其是价值函数 CVaR 的下界,且比 VFR 更易于估计。
- 构建约束优化问题,以在保持回报 CVaR 低于预设阈值的前提下,最大化期望累积回报。
- CPPO 算法通过引入 CVaR 正则化,扩展了近端策略优化(PPO),采用截断的代理目标以在风险约束下稳定训练。
- 该方法集成风险感知的策略更新机制,优先选择 CVaR 更高的轨迹,从而提升对状态转移和观测扰动的鲁棒性。
- 通过在标准 MuJoCo 连续控制环境中注入状态转移和观测扰动,进行实证评估以测试鲁棒性。
实验结果
研究问题
- RQ1价值函数范围(VFR)与在状态转移和观测扰动下策略鲁棒性之间有何关系?
- RQ2轨迹回报的 CVaR 是否可作为两种扰动下风险敏感策略优化的实用且有效代理?
- RQ3CVaR 约束的优化框架是否能生成在性能和鲁棒性方面均表现优异、且能应对状态转移与观测不确定性同时存在的策略?
- RQ4在扰动下,CPPO 与现有安全强化学习方法相比,在累积回报和鲁棒性方面表现如何?
- RQ5所提方法是否能避免基于最坏情况方法的过度悲观,同时在不确定性下保持强性能?
主要发现
- 在 HalfCheetah、Walker2d、Swimmer 和 Hopper 任务中,CPPO 的累积奖励均高于 PPO、VPG、TRPO 和 PG-CMDP,表明其具有更高的样本效率和性能。
- 在状态转移扰动(质量扰动)下,CPPO 的性能显著优于基线方法,尤其在 Swimmer 和 Hopper 中表现突出,表明其对环境动力学变化具有强鲁棒性。
- 在观测扰动(高斯噪声)下,CPPO 的鲁棒性优于所有基线方法,即使在高噪声水平下性能退化也极小,证实其对观测不确定性具有强有效性。
- 尽管 PG-CMDP 和 VPG 的 VFR 较低,CPPO 仍优于它们,因为 CPPO 通过 CVaR 正则化主动控制风险,而非仅依赖低 VFR。
- 在对抗性观测攻击下,CPPO 的鲁棒性优于所有对比基线方法,如附录 C 所报告,证实其对最坏情况观测损坏具有强韧性。
- 理论分析确认,轨迹回报的 CVaR 是价值函数 CVaR 的下界,验证了其在策略优化中作为实用风险代理的合理性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。