Skip to main content
QUICK REVIEW

[论文解读] Learning Robust State Abstractions for Hidden-Parameter Block MDPs

Amy Zhang, Shagun Sodhani|arXiv (Cornell University)|Jul 14, 2020
Reinforcement Learning in Robotics参考文献 35被引用 5
一句话总结

本文提出隐藏参数块MDP(HiP-BMDP),一种将隐藏参数MDP的结构化动态与块MDP的基于观测的状态抽象相结合的框架,可在高维观测空间中实现鲁棒、样本高效的多任务强化学习与元强化学习。该方法引入一种基于梯度的表征学习方法,结合任务双胞胎相似性损失(BiSim),实现了更优的零样本泛化能力与更快的适应速度,在多任务RL(MTRL)与元强化学习(Meta-RL)设置下,性能优于当前最先进基线方法。

ABSTRACT

Many control tasks exhibit similar dynamics that can be modeled as having common latent structure. Hidden-Parameter Markov Decision Processes (HiP-MDPs) explicitly model this structure to improve sample efficiency in multi-task settings. However, this setting makes strong assumptions on the observability of the state that limit its application in real-world scenarios with rich observation spaces. In this work, we leverage ideas of common structure from the HiP-MDP setting, and extend it to enable robust state abstractions inspired by Block MDPs. We derive instantiations of this new framework for both multi-task reinforcement learning (MTRL) and meta-reinforcement learning (Meta-RL) settings. Further, we provide transfer and generalization bounds based on task and state similarity, along with sample complexity bounds that depend on the aggregate number of samples across tasks, rather than the number of tasks, a significant improvement over prior work that use the same environment assumptions. To further demonstrate the efficacy of the proposed method, we empirically compare and show improvement over multi-task and meta-reinforcement learning baselines.

研究动机与目标

  • 解决在任务间动态变化但奖励共享时,多任务强化学习(MTRL)与元强化学习中样本效率低下的挑战。
  • 在真实状态为隐变量的丰富高维观测环境中,实现鲁棒的状态抽象。
  • 形式化一个统一框架,通过隐藏参数实现任务间的共享动态,提升泛化与迁移能力。
  • 推导出依赖于任务间总数据量而非任务数量的一般化与样本复杂度的理论边界。
  • 在机器人控制基准测试中,实证验证该方法在快速适应与零样本迁移方面的优越性。

提出的方法

  • 提出一种隐藏参数块MDP(HiP-BMDP)框架,通过任务特定的隐藏参数条件化共享转移模型,统一各任务的动态。
  • 引入一种基于梯度的表征学习算法,学习具有平滑性质的潜在状态表征,以提升少样本泛化能力。
  • 引入任务双胞胎相似性损失(BiSim),以促使表征保留任务相似性,从而提升对未见任务的泛化能力。
  • 推导出价值损失与样本复杂度的理论边界,其规模依赖于任务间总样本数,而非任务数量。
  • 通过在推理网络中加入HiP-BMDP损失,将PEARL算法适配于元强化学习。
  • 采用一种通用转移模型,仅通过更新任务参数θ即可泛化至未见环境,同时保持全局动态固定。

实验结果

研究问题

  • RQ1一个基于隐藏参数条件化的统一动态模型,是否能提升在共享奖励设置下的多任务强化学习中的样本效率与泛化能力?
  • RQ2当真实状态为隐变量时,如何从高维观测中学习鲁棒的状态抽象?
  • RQ3通过双胞胎相似性损失引入任务相似性,在未见任务中能多大程度上提升零样本泛化能力?
  • RQ4能否推导出依赖于聚合数据而非任务数量的理论样本复杂度边界?
  • RQ5所提出方法是否在快速适应与零样本迁移方面优于现有MTRL与元强化学习基线?

主要发现

  • 在MTRL设置下,HiP-BMDP在插值任务的零样本泛化中持续优于基线方法,在多个环境中均表现出统计显著的性能提升。
  • 采用双胞胎相似性损失的HiP-BMDP模型(HiP-BMDP)相比无该损失的变体(HiP-BMDP-nobisim)泛化能力更优,证明了保持相似性的表征的重要性。
  • 在转移模型评估中,该方法在未见环境中的适应速度更快,5步与100步展开后的每步模型误差显著低于基线。
  • 在Meta-RL设置下,HiP-BMDP在Walker-Walk-V1等环境中比PEARL基线更快收敛至阈值奖励,表明其少样本适应能力更强。
  • 理论边界表明,样本复杂度依赖于任务间总样本数,而非任务数量,相较于先前工作有显著改进。
  • 实证结果证实,性能增益并非仅源于任务嵌入,因为去除双胞胎相似性损失的消融实验性能更差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。