Skip to main content
QUICK REVIEW

[论文解读] Motion Perception in Reinforcement Learning with Dynamic Objects

Artemij Amiranashvili, Alexey Dosovitskiy|arXiv (Cornell University)|Jan 10, 2019
Reinforcement Learning in Robotics参考文献 31被引用 10
一句话总结

本文提出通过光流或图像差分显式表示运动,将其整合到深度强化学习中,以提升动态环境中连续控制的性能。结果表明,使用预训练或自监督光流,尤其是图像差分作为输入,能显著提升在移动物体任务中的策略性能,优于标准帧堆叠方法,并使此前无法求解的任务得以学习。

ABSTRACT

In dynamic environments, learned controllers are supposed to take motion into account when selecting the action to be taken. However, in existing reinforcement learning works motion is rarely treated explicitly; it is rather assumed that the controller learns the necessary motion representation from temporal stacks of frames implicitly. In this paper, we show that for continuous control tasks learning an explicit representation of motion improves the quality of the learned controller in dynamic scenarios. We demonstrate this on common benchmark tasks (Walker, Swimmer, Hopper), on target reaching and ball catching tasks with simulated robotic arms, and on a dynamic single ball juggling task. Moreover, we find that when equipped with an appropriate network architecture, the agent can, on some tasks, learn motion features also with pure reinforcement learning, without additional supervision. Further we find that using an image difference between the current and the previous frame as an additional input leads to better results than a temporal stack of frames.

研究动机与目标

  • 探究显式运动表示是否能提升动态环境中移动物体存在下的强化学习性能。
  • 评估光流作为深度强化学习智能体在连续控制任务中辅助输入的有效性。
  • 确定仅通过强化学习奖励而无运动监督,是否可无监督地学习运动特征。
  • 比较图像差分输入与标准帧堆叠基线在动态强化学习任务中的性能表现。
  • 评估在实时推理约束下,轻量级光流网络在端到端强化学习训练中的可行性。

提出的方法

  • 提出一种基于FlowNet改进的小型高效光流网络(TinyFlowNet),专为强化学习训练期间的实时推理而优化。
  • 将光流网络作为策略网络的辅助输入,与原始观测并行提供运动线索。
  • 在两种模式下训练光流网络:在合成光流数据上进行监督预训练,以及仅通过强化学习奖励进行端到端微调。
  • 引入图像差分(当前帧减去前一帧)作为替代的运动表示输入,取代或补充帧堆叠。
  • 在Walker、Swimmer、Hopper等基准环境以及自定义机器人操控任务中,使用标准深度强化学习算法(如SAC)进行训练。
  • 通过可视化学习到的运动表示,分析网络是否能编码相关物体(如小球)的运动,同时忽略自身运动(如机械臂)。

实验结果

研究问题

  • RQ1与从帧堆叠中隐式学习运动相比,通过光流实现的显式运动表示是否能提升动态强化学习任务中的策略性能?
  • RQ2仅通过强化学习奖励而无任何运动监督,是否可成功无监督地学习运动特征?
  • RQ3在基于像素的强化学习中,图像差分(当前帧减去前一帧)是否比时间帧堆叠更有效的运动表示?
  • RQ4在哪些类型的动态控制任务中,显式运动表示对成功学习变得至关重要?
  • RQ5网络架构的选择如何影响仅通过奖励学习运动表示的能力?

主要发现

  • 将光流作为辅助输入在所有测试的动态控制任务中均一致提升了策略性能,尤其在高运动复杂度任务中表现更优。
  • 在3D KeepUp with High Motion Penalty任务中,仅使用帧堆叠从零开始训练完全失败,而使用预训练TinyFlowNet的策略则成功完成训练。
  • 在较简单任务(如2D Chaser)中,仅通过强化学习奖励对光流网络进行无监督训练,已足以学习到有用的运动特征,性能可与监督预训练相媲美。
  • 在更复杂任务(如3D KeepUp with High Motion Penalty)中,无监督训练未能学习到有效运动特征,表明需通过监督预训练来启动运动表示学习。
  • 图像差分输入在所有任务中均优于或至少匹配帧堆叠基线性能,表明其是更高效且计算更轻量的运动表示方式。
  • 对自监督TinyFlowNet的可视化显示,其能有效表示小球运动,同时基本忽略机械臂自身运动,表明对任务相关动态具有选择性注意力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。