Skip to main content
QUICK REVIEW

[论文解读] When does return-conditioned supervised learning work for offline reinforcement learning?

David Brandfonbrener, Alberto Bietti|arXiv (Cornell University)|Jun 2, 2022
Reinforcement Learning in Robotics被引用 4
一句话总结

本文研究了在离线强化学习中,返回条件监督学习(RCSL)在何种条件下能够成功,表明其仅在强假设下才能获得最优策略——即近乎确定性的动态系统、已知的返回条件值,以及数据集中充分的返回覆盖。实证结果证实了这些理论限制,显示尽管RCSL相较于动态规划方法更简单且可扩展,但在随机或覆盖不足的环境中仍会失败。

ABSTRACT

Several recent works have proposed a class of algorithms for the offline reinforcement learning (RL) problem that we will refer to as return-conditioned supervised learning (RCSL). RCSL algorithms learn the distribution of actions conditioned on both the state and the return of the trajectory. Then they define a policy by conditioning on achieving high return. In this paper, we provide a rigorous study of the capabilities and limitations of RCSL, something which is crucially missing in previous work. We find that RCSL returns the optimal policy under a set of assumptions that are stronger than those needed for the more traditional dynamic programming-based algorithms. We provide specific examples of MDPs and datasets that illustrate the necessity of these assumptions and the limits of RCSL. Finally, we present empirical evidence that these limitations will also cause issues in practice by providing illustrative experiments in simple point-mass environments and on datasets from the D4RL benchmark.

研究动机与目标

  • 严格分析返回条件监督学习(RCSL)在离线强化学习中的理论保证与失败模式。
  • 识别RCSL恢复最优策略的必要与充分条件,并与传统动态规划(DP)方法进行比较。
  • 使用合成环境和D4RL基准数据集,实证验证理论限制。
  • 阐明RCSL、行为克隆(BC)与基于DP的算法在性能与鲁棒性方面的关系。
  • 评估RCSL是否可作为离线RL的一般性解决方案,还是仅限于特定、结构良好的设定。

提出的方法

  • RCSL通过在专家轨迹数据集上使用最大似然估计,训练策略以根据状态和轨迹返回值预测动作。
  • 该方法最小化经验负对数似然损失:$\hat{L}(\pi) = -\sum_{\tau \in \mathcal{D}} \sum_{t=1}^{H} \log \pi(a_t | s_t, g(\tau))$。
  • 推理时,策略通过函数$f(s)$对目标返回进行条件化,定义为$\pi_f(a|s) = \pi(a|s, f(s))$。
  • 理论分析推导出RCSL恢复最优策略的条件,包括近乎确定性的动态系统和数据集中完整的返回支持。
  • 实证评估使用质点环境和D4RL基准数据集,测试在不同返回覆盖、随机性和行为策略质量下的性能。
  • 对比实验包括基于DP的方法(TD3+BC、IQL)、基于BC的基线方法,以及RCSL变体(如决策Transformer),并进行超参数调优和多次随机种子实验。

实验结果

研究问题

  • RQ1在何种条件下RCSL能恢复最优策略,其与动态规划(DP)方法所需假设相比如何?
  • RQ2RCSL的理论失败模式是什么,其在实践中如何表现?
  • RQ3在稀疏奖励、随机动力学或数据集覆盖差的环境中,RCSL相对于BC和基于DP的算法表现如何?
  • RQ4RCSL能否泛化到真实世界的离线RL基准,还是其成功仅限于特定高质量数据场景?
  • RQ5RCSL在多大程度上继承了监督学习的简洁性,同时避免了行为克隆的缺陷?

主要发现

  • RCSL仅在强于DP方法的假设下才能恢复最优策略,包括近乎确定性的动态系统和数据集中完整的返回支持。
  • 在具有随机动力学或稀疏返回的环境中,RCSL甚至无法学习到正向回报,如在antmaze稀疏奖励设置中,不存在高回报轨迹。
  • 在D4RL基准上,RCSL在大多数任务上表现不如基于DP的方法(如TD3+BC和IQL),尤其是在高随机性任务中(如antmaze-medium-play)。
  • RCSL仅在行为策略质量高但次优时表现良好,例如在pen-human数据集中,密集奖励和有限覆盖使得返回条件化能优于BC。
  • 理论分析表明,RCSL对轨迹级返回信息的依赖,使其从根本上受限于数据集中最佳轨迹,且在时域上达到最优性能需呈指数级样本复杂度。
  • 尽管其简洁且可扩展,RCSL并非离线RL的一般解法,因其无法从差的数据集覆盖或随机动力学中恢复,而DP方法则具备此能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。