Skip to main content
QUICK REVIEW

[论文解读] Offline RL Policies Should be Trained to be Adaptive

Dibya Ghosh, Anurag Ajay|arXiv (Cornell University)|Jul 5, 2022
Machine Learning and Algorithms被引用 4
一句话总结

本文主张,离线强化学习(RL)策略应具备自适应性而非纯粹的保守性,因为有限数据集带来的认知不确定性会引发隐式的部分可观测性,从而需要依赖历史的自适应机制。作者提出 APE-V 方法,一种基于集成的算法,在推理过程中自适应地在多个价值函数之间进行选择,通过动态策略切换,在 Procgen Maze 和 D4RL 等离线 RL 基准测试中表现优于保守基线方法,实现更优性能。

ABSTRACT

Offline RL algorithms must account for the fact that the dataset they are provided may leave many facets of the environment unknown. The most common way to approach this challenge is to employ pessimistic or conservative methods, which avoid behaviors that are too dissimilar from those in the training dataset. However, relying exclusively on conservatism has drawbacks: performance is sensitive to the exact degree of conservatism, and conservative objectives can recover highly suboptimal policies. In this work, we propose that offline RL methods should instead be adaptive in the presence of uncertainty. We show that acting optimally in offline RL in a Bayesian sense involves solving an implicit POMDP. As a result, optimal policies for offline RL must be adaptive, depending not just on the current state but rather all the transitions seen so far during evaluation.We present a model-free algorithm for approximating this optimal adaptive policy, and demonstrate the efficacy of learning such adaptive policies in offline RL benchmarks.

研究动机与目标

  • 挑战离线 RL 中对保守、静态策略的普遍依赖,因为这类策略对保守性超参数敏感,可能导致次优表现。
  • 将离线 RL 形式化为贝叶斯问题,其中认知不确定性导致隐式的部分可观测性,从而需要自适应策略。
  • 开发一种实用算法,实现在离线 RL 中的跨 episode 自适应,提升相对于静态策略的推理时性能。
  • 证明即使在数据稀缺场景下,自适应策略也能通过在价值函数假设之间动态选择,超越保守策略。

提出的方法

  • 将离线 RL 形式化为由认知不确定性引发的 POMDP,其中智能体对 MDP 的信念随观测转移而演化。
  • 推导基于历史的自适应策略的策略梯度目标,利用 MDP 的后验分布和价值函数分布来建模不确定性。
  • 提出 APE-V,一种无需模型的算法,通过维护一组 Q 函数,并利用其上的信念分布来指导推理阶段的动作选择。
  • 通过根据观测转移动态更新信念状态,实现 episode 内的自适应,使策略在初始预测错误时能够切换策略。
  • 采用策略梯度更新,利用隐式的 POMDP 目标优化自适应策略,使其能同时从数据集和推理过程中的实时反馈中学习。
  • 将方法应用于离线 RL 基准测试,包括 Procgen Mazes 和 D4RL,以 SAC-n 作为基础价值函数学习器,并与 CQL 和 SAC-n 等保守基线方法进行比较。

实验结果

研究问题

  • RQ1在离线 RL 中,静态的保守策略是否可能因无法在推理过程中适应新信息而变得任意次优?
  • RQ2由数据集不确定性引发的隐式部分可观测性是否要求离线 RL 中必须采用自适应行为?
  • RQ3一种无模型的、基于集成的方法能否有效近似离线 RL 中的贝叶斯最优自适应策略?
  • RQ4通过在价值函数上进行信念更新实现的 episode 内自适应,是否能带来相对于静态保守策略的推理时性能提升?
  • RQ5在何种场景下,自适应相比保守性在离线 RL 中能提供显著优势?

主要发现

  • 在 Procgen 环境中,APE-V 在未见迷宫上的成功率达到 79%,优于所有保守和非自适应方法。
  • 在仅使用 200 个训练迷宫的低数据场景下,APE-V 在未见迷宫上的成功率为 31%,而保守方法仅为 23%。
  • 在 D4RL 上,APE-V 在中等性能和中等回放数据集上优于 SAC-n 和 CQL,其平均回报高于任一单一集成成员。
  • 在 D4RL 中,自适应策略始终优于任何固定的价值函数选择,证明了推理时动态信念更新的优势。
  • 在数据分布歧义性较低的任务中,如专家或随机策略收集的数据,自适应带来的增益较小,因为多个假设的显著性较低。
  • 结果证实,为实现最优的离线 RL 性能,自适应是必要的,因为静态策略在不确定性下可能任意次优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。