Skip to main content
QUICK REVIEW

[论文解读] Planning with Sequence Models through Iterative Energy Minimization

Hongyi Chen, Yilun Du|arXiv (Cornell University)|Mar 28, 2023
Reinforcement Learning in Robotics被引用 4
一句话总结

该论文提出LEAP,一种利用掩码语言模型进行迭代能量最小化的规划器,以优化强化学习中的轨迹。通过将轨迹规划建模为具有双向上下文的能量最小化问题,LEAP在BabyAI和Atari任务中表现更优,实现了比自回归基线方法更好的泛化能力、推理时适应能力以及计划组合能力。

ABSTRACT

Recent works have shown that sequence modeling can be effectively used to train reinforcement learning (RL) policies. However, the success of applying existing sequence models to planning, in which we wish to obtain a trajectory of actions to reach some goal, is less straightforward. The typical autoregressive generation procedures of sequence models preclude sequential refinement of earlier steps, which limits the effectiveness of a predicted plan. In this paper, we suggest an approach towards integrating planning with sequence models based on the idea of iterative energy minimization, and illustrate how such a procedure leads to improved RL performance across different tasks. We train a masked language model to capture an implicit energy function over trajectories of actions, and formulate planning as finding a trajectory of actions with minimum energy. We illustrate how this procedure enables improved performance over recent approaches across BabyAI and Atari environments. We further demonstrate unique benefits of our iterative optimization procedure, involving new task generalization, test-time constraints adaptation, and the ability to compose plans together. Project website: https://hychen-naza.github.io/projects/LEAP

研究动机与目标

  • 解决自回归序列模型在规划中的局限性,即一旦生成动作便无法对早期动作进行修正。
  • 通过将轨迹规划建模为在双向掩码语言模型上的迭代能量最小化,实现基于序列模型的轨迹规划。
  • 提升在长时序决策任务(如BabyAI和Atari环境)中的性能表现。
  • 实现对未见过的环境以及测试时约束(包括动态障碍物和复杂迷宫)的泛化能力。
  • 通过组合多个模型实现组合式规划,以应对多目标任务。

提出的方法

  • 训练一个双向掩码语言模型(MLM),通过负伪似然估计动作轨迹的隐式能量函数。
  • 将轨迹的能量定义为MLM的负对数似然,从而支持基于能量的优化。
  • 通过在每个时间步用给定当前上下文和未来动作的最可能动作替换原动作,实现迭代优化。
  • 利用双向上下文,使未来信息能够影响早期动作的选择。
  • 通过迭代最小化过程,收敛到低能量(高概率)轨迹,以满足目标。
  • 将能量最小化过程集成到规划器中,使其能够适应新约束,并组合多个模型的计划。

实验结果

研究问题

  • RQ1与标准自回归生成相比,基于序列模型的迭代能量最小化是否能提升强化学习中的轨迹规划性能?
  • RQ2序列模型中的双向上下文是否能更好地优化轨迹中早期动作的生成?
  • RQ3该能量最小化框架是否能泛化到包含新障碍物或复杂布局的未见环境中?
  • RQ4该规划器是否能适应测试时的约束,如动态障碍物或新引入的障碍物?
  • RQ5能否通过该框架组合多个预训练模型,实现多目标规划?

主要发现

  • 在测试时障碍物场景下,LEAP在中等难度熔岩环境中的成功率高达92.0%,显著优于自回归基线DT的68.0%。
  • 在未见过的迷宫环境中,LEAP泛化能力出色,在中等难度下达到77.5%的成功率,困难级别为61.0%,而DT分别降至36.0%和24.5%。
  • 在复合任务组合方面,LEAP在简单任务中取得83.5%的成功率,中等难度下为43.0%,显著优于IQL(42.5%和11.5%)与DT(58.0%和15.5%)。
  • 在复杂迷宫和动态障碍物场景中,LEAP表现出强鲁棒性,能通过迭代优化成功绕过熔岩格子和不可见障碍物。
  • 迭代能量最小化过程显著提升了长时序规划能力,所有评估基准均显示出一致的性能提升。
  • 该框架支持组合式规划,允许多个模型在各自仅观察部分信息的情况下共同贡献于单一计划。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。