[论文解读] Risk-Averse Offline Reinforcement Learning
本文提出 O-RAAC,这是首个无需在线探索即可仅使用预收集数据优化风险规避策略的无模型离线强化学习算法。通过结合分布式评论者、基于CVaR或其他一致风险度量的风险规避演员,以及基于VAE的模仿组件以减少自举误差,O-RAAC 在 MuJoCo 控制任务中实现了更优的风险规避性能与分布鲁棒性,尤其在分布偏移下显著优于风险中性基线。
Training Reinforcement Learning (RL) agents in high-stakes applications might be too prohibitive due to the risk associated to exploration. Thus, the agent can only use data previously collected by safe policies. While previous work considers optimizing the average performance using offline data, we focus on optimizing a risk-averse criteria, namely the CVaR. In particular, we present the Offline Risk-Averse Actor-Critic (O-RAAC), a model-free RL algorithm that is able to learn risk-averse policies in a fully offline setting. We show that O-RAAC learns policies with higher CVaR than risk-neutral approaches in different robot control tasks. Furthermore, considering risk-averse criteria guarantees distributional robustness of the average performance with respect to particular distribution shifts. We demonstrate empirically that in the presence of natural distribution-shifts, O-RAAC learns policies with good average performance.
研究动机与目标
- 解决在探索成本过高的高风险应用中缺乏风险规避离线强化学习算法的问题。
- 开发一种完全离线的算法,用于优化如 CVaR 等风险规避性能指标,确保对分布偏移的鲁棒性。
- 通过整合变分自编码器(VAE)建模行为策略,减少离线强化学习中的自举误差。
- 证明风险规避目标不仅能提升最坏情况下的性能,也能在自然分布偏移下保持较强的平均性能。
- 提供一个兼容多种风险度量的通用框架,包括一致风险度量与累积前景理论。
提出的方法
- 该算法基于隐式分位数网络(Implicit Quantile Networks)构建分布式评论者,以建模完整的回报分布,而无需假设高斯分布。
- 风险规避演员通过可微分的风险准则优化回报分布的扭曲形式,例如条件风险价值(CVaR)。
- 训练一个变分自编码器(VAE)以建模行为策略,实现模仿学习,并减少策略更新中的分布偏移。
- 演员参数化为 VAE 生成策略的扰动形式,确保学习到的策略与行为策略保持接近,从而减少过拟合。
- 评论者通过在完整回报分布上执行分布式贝尔曼更新进行训练,而演员则通过风险规避策略梯度目标进行更新。
- 该方法完全离线,仅依赖固定数据集,无需与环境进行在线交互。
实验结果
研究问题
- RQ1能否在高风险控制任务中,通过完全离线的强化学习算法有效优化如 CVaR 等风险规避性能指标?
- RQ2在离线强化学习中使用风险规避准则是否能提升对数据中自然分布偏移的鲁棒性?
- RQ3基于 VAE 的模仿组件如何减少离线风险规避强化学习中的自举误差?
- RQ4在离线设置中,风险规避策略能否在平均性能上与风险中性基线保持竞争力?
- RQ5所提出的方法在不同风险度量(如 CVaR、0.25-CVaR 和 CPW)之间是否具备可扩展性?
主要发现
- 在中等数据集的 Half-Cheetah 环境中,O-RAAC 实现了 0.1-CVaR 为 214 ± 36,显著优于 O-D4PG(66 ± 34)和 BEAR(15 ± 30)。
- 在专家数据集的 Walker-2D 环境中,O-RAAC 实现了 0.1-CVaR 为 751 ± 154,优于 O-D4PG(31 ± 29)和 BEAR(517 ± 66)。
- 在专家数据集的 Hopper 环境中,O-RAAC 实现了 0.1-CVaR 为 1416 ± 28,远超 O-D4PG(1008 ± 28)和 BEAR(1252 ± 47)。
- O-RAAC 维持了具有竞争力的平均回报,Hopper(专家)环境下为 1482 ± 4,Walker-2D(中等)环境下为 1282 ± 20,与风险中性基线如 O-D4PG 和 BEAR 相当。
- 在存在分布偏移的环境中(如 Hopper-E),O-RAAC 学习到将策略集中在安全区域,避免稀疏数据区域的高风险区域,而 O-D4PG 则过度进入高风险区域。
- VAE 组件有效减少了自举误差,尤其在低多样性专家数据集中,风险规避优化提供了更强的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。