Skip to main content
QUICK REVIEW

[论文解读] Task-Agnostic Dynamics Priors for Deep Reinforcement Learning

Yilun Du, Karthik Narasimhan|arXiv (Cornell University)|May 13, 2019
Reinforcement Learning in Robotics参考文献 38被引用 10
一句话总结

本文提出一种新颖的空间记忆架构(SpatialNet),通过从视频数据中学习与任务无关的动力学先验,以提升基于模型的深度强化学习中的样本效率和泛化能力。通过在多样化物理视频上预训练帧预测器,并在目标任务上进行微调,该方法实现了更快的策略学习和更优的性能表现——在PhysShooter上性能最高提升130%,在Asteroids上提升56.5%,优于基线方法。

ABSTRACT

While model-based deep reinforcement learning (RL) holds great promise for sample efficiency and generalization, learning an accurate dynamics model is often challenging and requires substantial interaction with the environment. A wide variety of domains have dynamics that share common foundations like the laws of classical mechanics, which are rarely exploited by existing algorithms. In fact, humans continuously acquire and use such dynamics priors to easily adapt to operating in new environments. In this work, we propose an approach to learn task-agnostic dynamics priors from videos and incorporate them into an RL agent. Our method involves pre-training a frame predictor on task-agnostic physics videos to initialize dynamics models (and fine-tune them) for unseen target environments. Our frame prediction architecture, SpatialNet, is designed specifically to capture localized physical phenomena and interactions. Our approach allows for both faster policy learning and convergence to better policies, outperforming competitive approaches on several different environments. We also demonstrate that incorporating this prior allows for more effective transfer between environments.

研究动机与目标

  • 解决模型无关深度强化学习中的样本效率低下与泛化能力差的问题。
  • 克服在交互数据有限的新环境中从零开始学习准确动力学模型的困难。
  • 利用不同环境中共享的物理先验(如运动、碰撞、弹性等)来提升基于模型的强化学习性能。
  • 通过使用从非结构化视频数据中预训练的动力学模型初始化,实现更快且更稳定的策略学习。
  • 通过将动力学模型学习与策略学习解耦,实现跨不同任务环境的独立动力学先验迁移,从而提升零样本和少样本迁移性能。

提出的方法

  • 在包含运动物体与物理相互作用的大量非结构化视频上预训练一个帧预测模型(SpatialNet)。
  • 设计SpatialNet,包含卷积编码器、3D空间记忆模块和卷积解码器,以保留精细的空间与时间动态特性。
  • 将预训练的SpatialNet作为基于模型的强化学习智能体中动力学模型的初始化,并在任务特定的经验数据上进行微调。
  • 将预测的未来帧作为额外上下文输入到策略网络中,类似于IPA框架,以提升决策能力。
  • 将动力学模型学习与策略学习解耦,实现不同任务环境中动力学先验的独立迁移。
  • 在三个领域中应用该方法:PhysWorld(2D物理游戏)、PhysShooter3D(3D刚体动力学)以及具有粘性动作的随机Atari游戏。

实验结果

研究问题

  • RQ1在多样化物理视频上预训练帧预测器,是否能获得可泛化的动力学先验,从而提升强化学习中的样本效率?
  • RQ2与从随机初始化训练相比,使用与任务无关的动力学先验如何影响策略学习速度与最终性能?
  • RQ3预训练的动力学模型在具有不同任务但相似物理动力学的环境中,其迁移能力有多大?
  • RQ4将动力学模型学习与策略学习解耦,是否能提升泛化能力与迁移性能?
  • RQ5在何种场景下,动力学预测能带来性能优势?在何种情况下可能产生负面影响?

主要发现

  • 所提方法在PhysShooter环境中的性能最高比最强基线(IPA)提升130%。
  • 在Atari游戏Asteroids中,该方法性能较基线提升56.5%,最终得分达2098(±102),高于基线的1340(±351)。
  • 将已在另一任务(如PhysForage)上微调的预训练SpatialNet模型进行迁移,性能相比仅使用PhysVideos的基线提升27%,在PhysShooter上达到53.66分。
  • 仅迁移动力学模型(不迁移策略)的性能(53.66)优于同时迁移模型与策略(40.40),证明了解耦的优越性。
  • 在Pong和Ice Hockey等环境中,智能体学习到可被利用的重复策略,此时动力学预测未带来任何优势,证实该方法的优势具有上下文依赖性。
  • 由于空间记忆机制能有效保留局部物理相互作用,SpatialNet架构在帧预测误差和泛化能力方面均优于先前方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。