[论文解读] Risk-Aware Transfer in Reinforcement Learning using Successor Features
本文提出风险感知后继特征(RaSF),一种新颖的框架,将后继特征扩展以建模回报方差,从而在强化学习中实现风险感知的策略迁移。通过结合嫡效用优化与均值-方差近似,RaSF 在任务泛化能力与风险控制方面优于风险中立方法,在导航与机器人控制任务中,其性能超越了标准后继特征与风险规避基线方法。
Sample efficiency and risk-awareness are central to the development of practical reinforcement learning (RL) for complex decision-making. The former can be addressed by transfer learning and the latter by optimizing some utility function of the return. However, the problem of transferring skills in a risk-aware manner is not well-understood. In this paper, we address the problem of risk-aware policy transfer between tasks in a common domain that differ only in their reward functions, in which risk is measured by the variance of reward streams. Our approach begins by extending the idea of generalized policy improvement to maximize entropic utilities, thus extending policy improvement via dynamic programming to sets of policies and levels of risk-aversion. Next, we extend the idea of successor features (SF), a value function representation that decouples the environment dynamics from the rewards, to capture the variance of returns. Our resulting risk-aware successor features (RaSF) integrate seamlessly within the RL framework, inherit the superior task generalization ability of SFs, and incorporate risk-awareness into the decision-making. Experiments on a discrete navigation domain and control of a simulated robotic arm demonstrate the ability of RaSFs to outperform alternative methods including SFs, when taking the risk of the learned policies into account.
研究动机与目标
- 为解决在奖励函数不同的任务之间缺乏风险感知策略迁移的问题。
- 通过嫡效用最大化,将广义策略改进(GPI)与广义策略评估(GPE)扩展至风险感知设置。
- 开发能够捕捉回报方差的后继特征,实现跨任务的风险感知泛化。
- 确保在风险敏感目标下,GPI 的理论保证成立,特别是针对嫡效用。
- 通过实证验证,RaSF 能够在保持新任务强泛化能力的同时,改善回报与风险之间的权衡。
提出的方法
- 将广义策略改进(GPI)扩展至最大化嫡效用,通过策略集合上的动态规划实现风险规避策略优化。
- 提出风险感知后继特征(RaSF),利用共享特征表示来表示回报分布的均值与方差。
- 采用均值-方差近似方法,直接或通过分布强化学习方法计算回报分布的充分统计量。
- 使用基于残差的方法估计后继特征表示中的协方差矩阵,提升方差建模的准确性。
- 在风险敏感评估下应用GPI,实现不同奖励函数任务之间的策略迁移,同时在风险约束下保持单调改进。
- 利用共享环境动态结构,将价值估计(包括方差)泛化至未见任务,即使存在随机性与函数逼近误差。
实验结果
研究问题
- RQ1广义策略改进(GPI)能否扩展至在风险感知目标(如嫡效用)下保持最优性保证?
- RQ2后继特征能否扩展以建模回报方差,从而实现风险感知的策略迁移?
- RQ3在将风险感知性引入后继特征后,与风险中立或风险规避基线相比,是否能提升新任务上的泛化能力并降低失败率?
- RQ4RaSF 中的均值-方差近似方法在处理连续控制与导航任务中的高方差、高风险区域时,与标准后继特征相比表现如何?
- RQ5RaSF 在多个源任务上维持准确方差估计的能力如何?其能否有效泛化至未见的测试任务?
主要发现
- 在机器人手臂抓取领域,RaSFC51 在测试任务中的失败率显著低于 RaC51 和 SFC51,尤其在高方差区域表现更优。
- RaSFC51 学习到在目标位置附近悬停,同时避开高风险区域,这一行为通过均值-方差目标的热力图得到验证,其峰值出现在低方差区域的目标稍远处。
- RaSFC51 学习到的方差估计在全部 8 个测试任务中均准确且具有良好泛化能力,而 SFDQN 配合残差协方差估计则高估了方差且未能收敛。
- 在回报与风险的权衡方面,RaSFC51 在所有 β 值下均优于 RaC51,表现为归一化回报-失败率比持续更高。
- 由 RaSFC51 衍生的 GPI 策略在新任务上泛化良好,轨迹显示其能一致避免高方差区域,而风险中立的 SFC51 则完全忽略风险。
- RaSF 有效将后继特征的泛化能力扩展至高阶矩(方差),证明 SF 不仅能泛化期望回报,还能泛化回报波动性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。