Skip to main content
QUICK REVIEW

[论文解读] Model Imitation for Model-Based Reinforcement Learning

Yueh-Hua Wu, Ting-Han Fan|arXiv (Cornell University)|Sep 25, 2019
Reinforcement Learning in Robotics参考文献 41被引用 6
一句话总结

该论文提出模型模仿(Model Imitation, MI),一种基于模型的强化学习方法,利用基于WGAN的分布匹配技术,将从学习到的环境模型生成的多步轨迹与真实环境中的轨迹对齐。通过最小化真实轨迹与合成轨迹在占用度量上的差异,MI在样本效率和策略性能方面优于当前最先进的基于模型强化学习(MBRL)与基于模型函数逼近强化学习(MFRL)方法,且在累积奖励相似性方面具有理论保证。

ABSTRACT

Model-based reinforcement learning (MBRL) aims to learn a dynamic model to reduce the number of interactions with real-world environments. However, due to estimation error, rollouts in the learned model, especially those of long horizons, fail to match the ones in real-world environments. This mismatching has seriously impacted the sample complexity of MBRL. The phenomenon can be attributed to the fact that previous works employ supervised learning to learn the one-step transition models, which has inherent difficulty ensuring the matching of distributions from multi-step rollouts. Based on the claim, we propose to learn the transition model by matching the distributions of multi-step rollouts sampled from the transition model and the real ones via WGAN. We theoretically show that matching the two can minimize the difference of cumulative rewards between the real transition and the learned one. Our experiments also show that the proposed Model Imitation method can compete or outperform the state-of-the-art in terms of sample complexity and average return.

研究动机与目标

  • 解决由学习到的动力学模型中累积估计误差导致的基于模型强化学习中的样本效率低下问题。
  • 克服监督学习在单步转移建模中的局限性,后者无法保证长时程轨迹的相似性。
  • 通过确保模型生成的合成轨迹与同一策略下真实世界轨迹高度匹配,改进策略梯度估计。
  • 为分布匹配在减少真实环境与学习环境之间累积奖励差异方面的有效性提供理论依据。
  • 通过截断WGAN与基于混合的占用度量匹配,稳定模型模仿框架的训练过程。

提出的方法

  • 该方法采用WGAN框架,匹配来自真实环境轨迹与由学习模型生成的合成轨迹中状态-动作-下一状态三元组(s, a, s')的联合分布。
  • 学习到的模型作为生成器,而判别网络则用于区分真实轨迹与合成轨迹,以指导训练过程。
  • 训练过程交替更新生成器(即模型)与判别器,推动合成轨迹分布趋近于真实分布。
  • 采用截断WGAN变体以防止模式崩溃,并在多个WGAN迭代中稳定训练。
  • 为提升泛化能力并支持权重迁移,该方法匹配来自多个策略的占用度量混合,而非单一策略的分布。
  • 该方法被整合进基于模型的强化学习流程中,通过模仿模型的轨迹实现高效的策略学习。

实验结果

研究问题

  • RQ1与监督学习的单步学习相比,通过WGAN进行分布匹配是否能提升基于模型强化学习中长时程轨迹的保真度?
  • RQ2匹配真实与合成轨迹的占用度量是否能带来更优的累积奖励近似与更高的策略性能?
  • RQ3所提方法是否能在样本效率方面优于当前最先进的无模型与基于模型强化学习算法?
  • RQ4使用来自多个策略的占用度量混合,如何提升模型模仿中的训练稳定性和泛化能力?
  • RQ5在所提出的分布匹配目标下,真实环境与学习环境之间累积奖励差异的理论边界是什么?

主要发现

  • 在连续控制基准测试中,MI在收敛速度与平均回报方面均优于当前最先进的MBRL与MFRL方法,包括TRPO、PPO、SLBO、PETS、METRPO与STEVE。
  • MI在仅使用140k时间步(相比基线方法的200k)的情况下,以50%更少的环境交互次数,实现了更优的性能。
  • 在Ant环境中,MI将平均回报提升至约1,000,表明其捕捉到了比竞争方法更准确的动力学模型。
  • 理论分析表明,真实环境与学习环境之间累积奖励的差异,线性受WGAN训练误差的约束,提供了强有力的泛化保证。
  • 通过使用来自多个策略的占用度量混合,实现了稳定的权重迁移并提升了泛化能力,而单一策略匹配则因分布不匹配而表现不佳。
  • 通过采用截断WGAN变体,该方法稳定了训练过程,避免了标准GAN中常见的局部最优与模式崩溃问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。