Skip to main content
QUICK REVIEW

[论文解读] Delay-Aware Model-Based Reinforcement Learning for Continuous Control

Baiming Chen, Mengdi Xu|arXiv (Cornell University)|May 11, 2020
Reinforcement Learning in Robotics参考文献 36被引用 8
一句话总结

本文提出了一种延迟感知的基于模型强化学习框架,用于连续控制,通过将动作延迟显式建模为系统动态的一部分,实现了高效且可迁移的学习。通过将动态分解为已知的延迟分量和未知的系统动态,该方法在瞬时环境中性能与标准的无模型强化学习相当,同时在不同延迟持续时间下保持了鲁棒性和可迁移性。

ABSTRACT

Action delays degrade the performance of reinforcement learning in many real-world systems. This paper proposes a formal definition of delay-aware Markov Decision Process and proves it can be transformed into standard MDP with augmented states using the Markov reward process. We develop a delay-aware model-based reinforcement learning framework that can incorporate the multi-step delay into the learned system models without learning effort. Experiments with the Gym and MuJoCo platforms show that the proposed delay-aware model-based algorithm is more efficient in training and transferable between systems with various durations of delay compared with off-policy model-free reinforcement learning methods. Codes available at: https://github.com/baimingc/dambrl.

研究动机与目标

  • 解决现实世界强化学习系统中因动作延迟导致的性能下降和不稳定性问题。
  • 正式定义一种延迟感知马尔可夫决策过程(DA-MDP),即使在动作延迟存在的情况下仍保持马尔可夫性质。
  • 开发一种基于模型的强化学习框架,将多步延迟整合到学习到的动力学模型中,且无需额外学习成本。
  • 实现学习到的动力学模型在不同延迟持续时间之间的可迁移性,促进仿真到现实的部署。
  • 相较于离策略无模型基线方法,在延迟连续控制任务中提升样本效率和规划性能。

提出的方法

  • 通过在状态空间中引入延迟动作历史,正式定义延迟感知马尔可夫决策过程(DA-MDP),确保马尔可夫性质得以保持。
  • 引入延迟感知马尔可夫奖励过程(DA-MRP),从理论上证明DA-MDP可转化为具有扩展状态的标准MDP。
  • 将系统动态分解为两部分:由动作延迟引起的已知分量和来自原始系统动态的未知分量。
  • 通过将PETS(带轨迹采样的概率集成)与动力学模型中显式延迟效应建模相结合,提出延迟感知轨迹采样(DATS)算法。
  • 利用已知的延迟分量预先计算未来状态转移,减少对额外训练数据的需求,提升规划效率。
  • 在无延迟模拟器上训练动力学模型,但在规划阶段引入延迟效应,从而实现向具有已知延迟的真实系统的迁移。

实验结果

研究问题

  • RQ1延迟感知MDP公式是否能在存在多步动作延迟的系统中保持马尔可夫性质?
  • RQ2基于模型的强化学习如何在不重新训练的情况下,高效地将已知动作延迟整合到学习到的动力学模型中?
  • RQ3当应用于不同延迟持续时间的环境时,所提出的框架是否能保持高性能和样本效率?
  • RQ4在一种延迟环境下学习到的知识(动力学模型)在延迟持续时间不同的另一环境中的可迁移程度如何?
  • RQ5与离策略无模型方法(如RTAC)相比,所提出的延迟感知基于模型方法在延迟条件下的性能和稳定性如何?

主要发现

  • DATS在无延迟环境中达到与标准无模型强化学习相当的性能,Pendulum-v0环境下的平均回报为154.10 ± 14.86,Walker2d-v1环境下的平均回报为471.34 ± 426.26(1步延迟)。
  • 在训练时使用8步延迟、测试时使用双倍延迟(如16步延迟)的环境中,DATS仍保持强劲性能,表明其具有高度可迁移性。
  • 作为无模型基线的RTAC在延迟增加时表现出显著性能下降,Pendulum-v0环境下的回报降至-122.98 ± 64.82,Walker2d-v1环境下的回报降至-2173.87 ± 625.76(16步延迟)。
  • DATS学习到的动力学模型即使在部署时的延迟持续时间是训练环境的两倍时,依然保持有效性,证明了其强大的可迁移性。
  • 在高延迟设置下,DATS实现稳定性能所需的转移次数少于RTAC,表明其具有更优的样本效率。
  • 该框架通过允许在无延迟模拟器中进行训练,同时在规划阶段引入已知延迟效应,实现了仿真到现实的迁移,降低了真实世界部署成本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。