Skip to main content
QUICK REVIEW

[论文解读] Universal Value Density Estimation for Imitation Learning and Goal-Conditioned Reinforcement Learning

Yannick Schroecker, Charles L. Isbell|arXiv (Cornell University)|Feb 15, 2020
Reinforcement Learning in Robotics参考文献 37被引用 7
一句话总结

本文提出通用价值密度估计(UVDE),一种新颖方法,利用归一化流从回溯经验中估计价值密度,实现无偏、样本高效的条件目标强化学习与模仿学习。其在仅使用单一示范轨迹的情况下,于运动基准测试中超越GAIL,达到最先进水平的示范效率。

ABSTRACT

This work considers two distinct settings: imitation learning and goal-conditioned reinforcement learning. In either case, effective solutions require the agent to reliably reach a specified state (a goal), or set of states (a demonstration). Drawing a connection between probabilistic long-term dynamics and the desired value function, this work introduces an approach which utilizes recent advances in density estimation to effectively learn to reach a given state. As our first contribution, we use this approach for goal-conditioned reinforcement learning and show that it is both efficient and does not suffer from hindsight bias in stochastic domains. As our second contribution, we extend the approach to imitation learning and show that it achieves state-of-the art demonstration sample-efficiency on standard benchmark tasks.

研究动机与目标

  • 解决回溯经验重放(HER)在随机环境中固有的偏差问题,该问题会导致对低概率动作的过度估计。
  • 开发统一框架,通过价值密度估计实现高效条件目标强化学习与模仿学习。
  • 通过匹配专家的状态-动作分布,而非依赖对抗奖励设计,提升模仿学习的样本效率。
  • 通过自监督回放将示范状态作为条件,使条件目标Q函数能够从仅观察数据中学习。

提出的方法

  • 该方法使用归一化流(具体为RealNVP)估计价值密度,价值密度表示从给定状态-动作对实现目标的折扣后似然性。
  • 利用回溯样本——即状态-动作-达成目标三元组——训练密度估计器,实现对长期期望奖励的无偏估计。
  • 将价值密度与标准时序差分学习结合,更新条件目标Q函数,确保低方差与无偏学习。
  • 在模仿学习中,通过将示范状态采样为目标来训练智能体,促使智能体匹配专家的状态分布。
  • 该方法避免对抗训练,仅将示范用于条件化Q函数,而非作为判别器的直接训练数据。
  • 该方法同时应用于条件目标强化学习与模仿学习,消融实验表明其在高维、随机环境中具有更强鲁棒性。

实验结果

研究问题

  • RQ1能否利用回溯样本以消除条件目标强化学习中回溯偏差的方式估计价值密度?
  • RQ2价值密度估计是否可实现无需依赖对抗奖励设计的样本高效模仿学习?
  • RQ3在复杂运动任务中,该方法与GAIL相比在示范效率方面表现如何?
  • RQ4价值密度估计是否可在高维控制环境中实现有效的仅观察数据学习?
  • RQ5该方法在传统HER因高失败率而失效的复杂随机环境中是否具备泛化能力?

主要发现

  • VDI仅使用单一子采样的示范轨迹,即在HalfCheetah-v2上达到专家水平性能,优于相同条件下的GAIL。
  • 在Humanoid-v2-NonExploitable环境中,VDI仅用单一示范轨迹即成功模仿专家,而GAIL在示范减少时性能急剧下降。
  • 该方法对稀疏奖励具有鲁棒性,通过使用归一化流直接从回溯样本估计价值密度,避免了回溯偏差。
  • VDI通过从自监督回放中学习条件目标Q函数,无需判别器,显著提升了示范样本效率,优于GAIL。
  • 该方法可实现有效的仅观察数据模仿学习,如在HalfCheetah-v2中所示,仅匹配状态分布即可实现成功。
  • 在Humanoid-v2中,将示范动作作为目标可显著提升探索效率,表明状态-动作分布匹配在高维设置中可增强学习效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。