[论文解读] Mean-Variance Policy Iteration for Risk-Averse Reinforcement Learning
本文提出了均值-方差策略迭代(MVPI),这是一种灵活的风险规避强化学习框架,通过扩展的马尔可夫决策过程(MDP)优化每步奖励的方差。通过利用Fenchel对偶性和块循环坐标上升法,MVPI实现了离策略(off-policy)和确定性策略学习,相较于以往方法在Mujoco基准测试中表现更优,标志着首次成功将离策略和确定性策略应用于风险规避强化学习。
We present a mean-variance policy iteration (MVPI) framework for risk-averse control in a discounted infinite horizon MDP optimizing the variance of a per-step reward random variable. MVPI enjoys great flexibility in that any policy evaluation method and risk-neutral control method can be dropped in for risk-averse control off the shelf, in both on- and off-policy settings. This flexibility reduces the gap between risk-neutral control and risk-averse control and is achieved by working on a novel augmented MDP directly. We propose risk-averse TD3 as an example instantiating MVPI, which outperforms vanilla TD3 and many previous risk-averse control methods in challenging Mujoco robot simulation tasks under a risk-aware performance metric. This risk-averse TD3 is the first to introduce deterministic policies and off-policy learning into risk-averse reinforcement learning, both of which are key to the performance boost we show in Mujoco domains.
研究动机与目标
- 通过在风险规避设置中实现离策略和确定性策略学习,弥合风险中性与风险规避强化学习之间的性能差距。
- 通过Fenchel对偶性和块循环坐标上升法,解决均值-方差RL中策略依赖奖励的挑战。
- 提出一种灵活的框架,可集成任意风险中性策略评估与控制方法,用于风险规避控制。
- 首次在Mujoco机器人控制任务中实现风险规避强化学习中离策略和确定性策略的实证成功。
- 将每步奖励的方差优化作为复杂环境中最小化总奖励方差的可扩展代理。
提出的方法
- MVPI构建了一个扩展的MDP,其中状态空间被扩展以包含策略的均值和方差,从而实现对期望回报与风险的联合优化。
- 该框架利用Fenchel对偶性,将策略依赖的奖励问题转化为可解的凸优化问题,实现策略与价值函数学习的解耦。
- 采用块循环坐标上升法(BCAA)迭代优化策略与价值函数,确保在策略依赖奖励下仍能收敛。
- 通过密度比估计将行为策略与目标策略解耦,支持离策略与在线策略学习。
- 在MVPI中实例化了风险规避TD3算法,结合离策略学习、确定性策略与方差正则化。
- MVPI兼容任意风险中性强化学习算法,支持现有方法在风险规避控制中的即插即用式集成。
实验结果
研究问题
- RQ1能否设计一个统一框架,以实现在风险规避强化学习中的离策略与确定性策略学习?
- RQ2能否将每步奖励的方差优化作为最小化总折扣奖励方差的有效且可扩展的代理?
- RQ3在均值-方差RL中,如何有效处理奖励函数依赖于策略的策略依赖奖励问题?
- RQ4能否使MVPI兼容任意现有的风险中性策略优化方法,包括在线与离策略方法?
- RQ5在复杂控制任务中,将离策略学习与确定性策略集成到风险规避强化学习中,是否能带来可量化的性能提升?
主要发现
- 在Mujoco机器人控制任务中,基于MVPI实例化的风险规避TD3在风险感知性能指标下,优于原始TD3及所有先前的均值-方差RL方法。
- MVPI首次在风险规避强化学习中成功实现离策略学习,显著提升了数据效率与训练稳定性。
- MVPI中使用确定性策略降低了策略方差,使仿真中的轨迹更加平滑、可靠。
- MVPI通过Fenchel对偶性与BCAA成功处理了策略依赖奖励问题,实现在非平稳MDP中的收敛。
- 该框架展现出良好的可扩展性与灵活性,支持多种风险中性算法的即插即用式集成,用于风险规避控制。
- 实证结果表明,随着风险厌恶系数λ的增加,选择高风险动作的概率降低,证实了有效的风险校准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。