Skip to main content
QUICK REVIEW

[论文解读] Learning to Combat Compounding-Error in Model-Based Reinforcement Learning

Chenjun Xiao, Yifan Wu|arXiv (Cornell University)|Dec 24, 2019
Reinforcement Learning in Robotics参考文献 18被引用 16
一句话总结

该论文提出AdaMVE,一种基于通过时序差分学习获得的状态相关模型误差估计,在基于模型的强化学习中自适应选择规划时域的方法。通过动态调整滚动时域以避免在不准确模型区域中累积误差,AdaMVE显著提升了样本效率,并在网格世界和连续控制任务中优于模型无关及非自适应的基于模型的基线方法。

ABSTRACT

Despite its potential to improve sample complexity versus model-free approaches, model-based reinforcement learning can fail catastrophically if the model is inaccurate. An algorithm should ideally be able to trust an imperfect model over a reasonably long planning horizon, and only rely on model-free updates when the model errors get infeasibly large. In this paper, we investigate techniques for choosing the planning horizon on a state-dependent basis, where a state's planning horizon is determined by the maximum cumulative model error around that state. We demonstrate that these state-dependent model errors can be learned with Temporal Difference methods, based on a novel approach of temporally decomposing the cumulative model errors. Experimental results show that the proposed method can successfully adapt the planning horizon to account for state-dependent model accuracy, significantly improving the efficiency of policy learning compared to model-based and model-free baselines.

研究动机与目标

  • 为解决基于模型强化学习中的误差累积问题,即不准确的模型会导致策略灾难性失败。
  • 开发一种基于局部模型准确度自适应选择规划时域的方法,而非使用固定时域。
  • 使基于模型的强化学习即使在全局模型不完美时,也能利用局部准确的模型组件。
  • 通过在模型不可靠时结合基于模型的规划与基于模型的更新,提升样本效率。
  • 利用时序差分学习高效学习模型误差估计,实现实时规划时域的自适应调整。

提出的方法

  • 该方法提出了一种新颖的规划时域上累积模型误差的时间分解,使时序差分学习能够估计状态相关的误差。
  • 通过在模型滚动结果上使用时序差分更新训练的神经网络,学习累积模型误差函数 $\hat{\mathcal{E}}(s, h)$。
  • 基于学习到的误差估计,自适应地选择每个状态的规划时域,使高误差区域倾向于选择较短的时域。
  • 通过用由误差函数决定的状态相关时域替代原始MVE中的固定时域,扩展了基于模型的价值扩展(MVE)方法。
  • 引入了一种选择性模型学习策略,以在在线训练期间提升模型质量,仅使用预测模型误差较低的数据。
  • 使用参考策略学习模型误差函数 $\hat{\mathcal{E}}$,为模型学习提供稳定且可泛化的误差估计,以指导模型学习。

实验结果

研究问题

  • RQ1当模型不完美时,状态相关的规划时域是否能减少基于模型强化学习中的误差累积?
  • RQ2时序差分学习是否能有效估计多个规划步骤上的累积模型误差?
  • RQ3与固定时域或模型无关方法相比,自适应时域选择是否能提升样本效率?
  • RQ4当模型在线学习且可能不准确时,该方法是否仍能保持性能?
  • RQ5学习到的误差函数是否能指导选择性模型学习,从而提升整体策略性能?

主要发现

  • 在模型不完美的网格世界迷宫任务中,AdaMVE显著优于模型无关的DDPG和非自适应的MVE,尤其在模型不准确的区域表现更优。
  • 在HalfCheetah和Swimmer等连续控制任务中,使用预训练模型的AdaMVE优于DDPG和MVE,展现出更高的样本效率。
  • 在在线模型学习设置下,原始AdaMVE因难以稳定跟踪实时模型误差而未能优于基线方法。
  • 所提出的有选择性模型学习(SML_AdaMVE)策略在在线模型设置下实现了显著的性能提升,优于所有基线方法,包括STEVE。
  • 该方法学习到一个单一、可微的模型误差函数,实现了高效且自适应的时域选择,无需使用集成方法或随机规划。
  • 实证结果表明,MVE的最优固定时域通常为H=1,凸显了固定时域方法的局限性以及自适应方法的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。