[论文解读] Efficient Risk-Averse Reinforcement Learning
该论文提出了一种新型的交叉熵软风险优化算法 CeSoR,通过将环境状态采样与策略优化解耦,克服了风险规避强化学习中的“对成功视而不见”问题。通过采用软风险调度机制和动态目标交叉熵采样器,CeSoR 即使在标准风险规避策略梯度方法失效的情况下,也能高效学习高回报、低风险的策略,在迷宫导航、自动驾驶和资源分配基准测试中均实现了更优的 CVaR 表现。
In risk-averse reinforcement learning (RL), the goal is to optimize some risk measure of the returns. A risk measure often focuses on the worst returns out of the agent's experience. As a result, standard methods for risk-averse RL often ignore high-return strategies. We prove that under certain conditions this inevitably leads to a local-optimum barrier, and propose a soft risk mechanism to bypass it. We also devise a novel Cross Entropy module for risk sampling, which (1) preserves risk aversion despite the soft risk; (2) independently improves sample efficiency. By separating the risk aversion of the sampler and the optimizer, we can sample episodes with poor conditions, yet optimize with respect to successful strategies. We combine these two concepts in CeSoR - Cross-entropy Soft-Risk optimization algorithm - which can be applied on top of any risk-averse policy gradient (PG) method. We demonstrate improved risk aversion in maze navigation, autonomous driving, and resource allocation benchmarks, including in scenarios where standard risk-averse PG completely fails.
研究动机与目标
- 为解决风险规避强化学习中的“对成功视而不见”问题,即标准方法因过度强调最坏情况回报而忽略高回报策略。
- 通过减少标准 CVaR-PG 方法中被丢弃的高回报轨迹的浪费,提升风险规避强化学习的样本效率。
- 在存在高认知不确定性(如迷宫中随机出现的守卫)和随机性不确定性(如随机动作)的环境中,实现对稳健、风险规避策略的有效学习。
- 开发一种通用框架,可无缝集成到任意风险规避策略梯度方法之上,无需架构修改。
- 通过实证验证,分离风险规避采样与风险规避优化可带来更优的 CVaR 表现和更强的现实基准鲁棒性。
提出的方法
- 引入软风险调度:从风险中性($\alpha' = 1$)逐步增加风险规避程度至目标风险水平($\alpha$),使初始阶段能够探索高回报策略。
- 提出一种动态目标交叉熵方法(CEM),独立于智能体表现,采样最具挑战性的环境条件(如迷宫中的守卫)。
- 将采样器(专注于困难条件)与优化器(专注于低回报)解耦,使模型能同时接触到高回报策略和高风险场景。
- 应用 CEM 生成环境条件分布,以最大化产生低回报结果的可能性,从而提升 CVaR 优化训练数据的质量。
- 将软风险调度与动态 CEM 采样结合,形成 CeSoR,一种可插拔的算法,兼容任意可微的风险规避策略梯度方法。
- 使用可微神经网络策略,基于软风险调整后的回报分布通过策略梯度进行训练,确保端到端可微性与收敛性。
实验结果
研究问题
- RQ1能否通过将高风险环境条件的采样与低回报轨迹的优化解耦,来改进风险规避强化学习方法?
- RQ2软风险调度是否能缓解风险规避强化学习中的‘对成功视而不见’问题,即因过度关注最坏情况轨迹而从未观测到高回报策略?
- RQ3交叉熵方法能否被适配为动态聚焦最具挑战性环境条件,从而提升风险规避训练中的样本效率?
- RQ4CeSoR 在多样化的基准测试中,相较于标准风险规避 PG 和 DRL 方法,在 CVaR 和平均回报方面有多大的性能优势?
- RQ5软风险调度与动态 CEM 采样组合是否为性能优越所必需?二者是否各自独立做出贡献?
主要发现
- 在 Guarded Maze 基准测试中,CeSoR 实现了 CVaR(0.05) 回报为 -7,显著优于 GCVaR(-32)和 PG(4),证明其成功学习了长路径策略。
- 在自动驾驶基准测试中,CeSoR 保持与前车的安全距离,避免了风险中性 PG 方法导致的事故,也避免了 GCVaR 过度保守的行为。
- 在资源分配任务中,CeSoR 平均仅分配 5 台服务器,优于 PG(无法应对峰值负载)和 GCVaR(提前分配 8 台服务器,导致更高成本)。
- 消融实验表明,软风险和 CE 采样器均不可或缺:CeR 和 SoR 单独使用时在 CVaR 和平均回报上均劣于 CeSoR,证实了两者的协同效应。
- CeSoR 在 Guarded Maze 中成功学习了最优长路径策略,而 GCVaR 因在训练批次中从未观测到高回报、低风险轨迹而完全失败。
- 在分布式强化学习实验中,CeSoR 优于风险中性 QR-DQN 和风险规避 CVaR-DRL 变体,实现 CVaR(0.05) 为 -7,而 GCVaR 仅为 -32,进一步证实其在 PG 方法之外的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。