Skip to main content
QUICK REVIEW

[论文解读] Model Based Planning with Energy Based Models

Yilun Du, Toru Lin|arXiv (Cornell University)|Sep 15, 2019
Reinforcement Learning in Robotics参考文献 33被引用 5
一句话总结

本文提出在强化学习的基于模型规划中使用能量模型(EBMs),实现在线训练和对状态轨迹的最大熵推理。EBMs 在在线学习中优于前馈网络,在未见障碍物上泛化能力更强,并通过为可到达的未探索状态分配低能量值,自然激励定向探索。

ABSTRACT

Model-based planning holds great promise for improving both sample efficiency and generalization in reinforcement learning (RL). We show that energy-based models (EBMs) are a promising class of models to use for model-based planning. EBMs naturally support inference of intermediate states given start and goal state distributions. We provide an online algorithm to train EBMs while interacting with the environment, and show that EBMs allow for significantly better online learning than corresponding feed-forward networks. We further show that EBMs support maximum entropy state inference and are able to generate diverse state space plans. We show that inference purely in state space - without planning actions - allows for better generalization to previously unseen obstacles in the environment and prevents the planner from exploiting the dynamics model by applying uncharacteristic action sequences. Finally, we show that online EBM training naturally leads to intentionally planned state exploration which performs significantly better than random exploration.

研究动机与目标

  • 通过采用基于模型的规划与学习的动力学模型,解决模型无关强化学习中样本效率低和泛化能力差的问题。
  • 克服动作条件化规划的局限性,后者可能利用模型不准确之处,并在面对未见障碍物时失效。
  • 为EBMs开发一种在线训练框架,使其能够适应现实环境中动态变化和相关联的经验。
  • 通过EBM训练实现内在探索,其中未探索区域因能量值波动而自然成为目标。
  • 证明仅在状态空间中进行规划——不依赖动作条件化——可实现更好的泛化性,并生成更安全、更多样化的轨迹。

提出的方法

  • 将规划建模为由能量模型定义的图模型中的推理,其中能量函数编码状态转移的可能性。
  • 使用真实转移和计划转移(在发生偏差前)在线训练EBMs,采用对比性目标,使真实和合理计划转移的能量最小化。
  • 使用Langevin动力学或类似采样方法,对状态轨迹执行最大熵推理,从起点到目标生成多样化计划。
  • 通过仅基于起始状态和目标状态进行规划,将策略学习与动力学建模解耦,避免对动作空间的利用。
  • 利用EBMs的组合性和在线学习特性,在训练期间面对相关联、非独立同分布的经验时保持鲁棒性。
  • 通过允许EBMs为未探索但可到达的状态分配低能量值,将探索激励纳入其中,引导智能体前往新区域。

实验结果

研究问题

  • RQ1能量模型能否在具有相关经验的现实非平稳环境中,有效支持动力学的在线学习?
  • RQ2当面对先前未见的障碍物时,使用EBMs在状态空间中进行规划,其泛化能力是否优于动作条件化规划?
  • RQ3基于EBM的规划能否在无需显式奖励塑造或探索奖励的情况下,自然生成多样化、高质量的轨迹?
  • RQ4与随机或基于内在动机的方法相比,在线EBM训练在多大程度上能实现更定向、更高效的探索?
  • RQ5EBMs的最大熵特性在多大程度上提升了状态空间规划中的鲁棒性和多样性?

主要发现

  • EBMs 在在线模型学习中显著优于对应的前馈网络,对相关经验具有更强鲁棒性,收敛速度更快。
  • 基于EBM的规划在未见障碍物上泛化能力更强:在粒子环境中,EBM的奖励为 -61.94,而动作条件化前馈网络为 -81.24。
  • EBM-based规划生成多样化轨迹——在多步规划中表现为更宽泛的可能路径包络,在Reacher环境中能生成顺时针和逆时针路径。
  • EBMs自然激励探索:在迷宫环境中,EBM引导的探索在不到10,000次转移内覆盖了整个迷宫,而随机策略需超过200,000次转移才能达到最大空间占用。
  • 在Sawyer机械臂任务中,EBMs在远少于随机探索的转移次数内达到最大3D末端执行器占用(116个体素),证明了其探索的定向性和高效性。
  • 在训练过程中,未探索区域的能量值发生波动,导致EBMs生成指向此前未访问但可到达状态的计划,从而形成动态的探索激励。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。