Skip to main content
QUICK REVIEW

[论文解读] Reward-Conditioned Policies

Aviral Kumar, Xue Bin Peng|arXiv (Cornell University)|Dec 31, 2019
Reinforcement Learning in Robotics参考文献 41被引用 16
一句话总结

本文提出奖励条件策略(RCP),一种强化学习方法,通过将目标奖励作为条件,训练单一策略以在多种回报值之间实现泛化。通过将次优轨迹视为匹配特定回报的最优监督信号,RCP 实现了对任意收集数据的监督学习,在基准环境上取得了具有竞争力的性能,尽管其样本效率低于最先进方法。

ABSTRACT

Reinforcement learning offers the promise of automating the acquisition of complex behavioral skills. However, compared to commonly used and well-understood supervised learning methods, reinforcement learning algorithms can be brittle, difficult to use and tune, and sensitive to seemingly innocuous implementation decisions. In contrast, imitation learning utilizes standard and well-understood supervised learning methods, but requires near-optimal expert data. Can we learn effective policies via supervised learning without demonstrations? The main idea that we explore in this work is that non-expert trajectories collected from sub-optimal policies can be viewed as optimal supervision, not for maximizing the reward, but for matching the reward of the given trajectory. By then conditioning the policy on the numerical value of the reward, we can obtain a policy that generalizes to larger returns. We show how such an approach can be derived as a principled method for policy search, discuss several variants, and compare the method experimentally to a variety of current reinforcement learning methods on standard benchmarks.

研究动机与目标

  • 通过利用标准监督学习技术,解决深度强化学习的脆弱性和超参数敏感性问题。
  • 通过重用次优轨迹作为特定回报值的最优监督信号,实现在无专家演示情况下的有效策略学习。
  • 开发一种原理清晰、可扩展的方法,通过单一受目标奖励条件化的策略泛化于不同回报水平。
  • 在标准强化学习基准上评估该方法的性能与鲁棒性,并与现有离策略强化学习算法进行比较。

提出的方法

  • 核心方法训练一个受目标回报 Z 条件化的策略 πθ(a|s, Z),其中 Z 为目标回报或优势值。
  • 将次优轨迹视为旨在实现特定 Z 值的策略的最优监督信号,从而实现对任意收集数据的监督学习。
  • 该方法使用奖励条件化策略网络,通过状态与目标值 Z 的拼接或乘法交互实现特征融合。
  • 经验回放缓冲区存储来自轨迹的 (s, Z, a) 三元组,策略通过标准监督学习在这些三元组上进行训练。
  • 训练期间从学习到的分布 pπ*(Z) 中采样目标值 Z,以确保覆盖多样化的回报水平。
  • 探索了两种变体:RCP-R(基于回报条件化)和 RCP-A(基于优势条件化),架构消融实验表明乘法交互优于拼接。

实验结果

研究问题

  • RQ1次优轨迹能否被有效用作针对特定回报水平的策略学习的最优监督信号?
  • RQ2将策略基于目标回报或优势进行条件化,如何提升离策略强化学习设置下的泛化能力与性能?
  • RQ3哪些架构选择(如拼接与乘法交互)对奖励条件化策略的性能影响最大?
  • RQ4奖励条件化策略在多大程度上能泛化到训练期间未见过的更高回报?
  • RQ5与 SOTA 离策略强化学习算法(如 SAC 或 AWR)相比,该方法在样本效率和最终性能方面表现如何?

主要发现

  • RCP 方法成功学习到能够泛化至训练期间未见的更高回报的策略,证明了奖励条件化在泛化方面的有效性。
  • 乘法交互架构在所有环境中均持续优于拼接架构,在 HalfCheetah-v2 和 Hopper-v2 上实现了更高的样本效率与最终性能。
  • RCP 变体的回报分布与目标 Z 值高度匹配,如目标与观测回报共现频率的热力图所示。
  • 随着经验回放缓冲区增大,性能下降,表明在数据效率方面存在挑战,且长缓冲区可能存在分布偏移问题。
  • 尽管泛化能力出色,RCP 在最终性能与样本效率方面仍落后于 SAC 等 SOTA 方法,表明仍有改进空间。
  • 由于方法简单且依赖于成熟的监督学习技术,该方法在实际应用中具有潜力,但探索与泛化仍是关键挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。