Skip to main content
QUICK REVIEW

[论文解读] Attention-Privileged Reinforcement Learning

Sasha Salter, Dushyant Rao|arXiv (Cornell University)|Nov 19, 2019
Reinforcement Learning in Robotics参考文献 42被引用 6
一句话总结

本文提出注意力特权强化学习(APRiL),一种通过联合训练基于图像的智能体与基于状态的特权智能体,并利用注意力机制对齐和共享经验回放,以提升视觉深度强化学习中的样本效率与鲁棒性的方法。APRiL通过让基于图像的智能体在训练过程中接收来自基于状态智能体的注意力监督,使其能够聚焦于任务相关特征,从而实现更快的学习速度,并在训练分布内及分布外均展现出更优的泛化能力。

ABSTRACT

Image-based Reinforcement Learning is known to suffer from poor sample efficiency and generalisation to unseen visuals such as distractors (task-independent aspects of the observation space). Visual domain randomisation encourages transfer by training over visual factors of variation that may be encountered in the target domain. This increases learning complexity, can negatively impact learning rate and performance, and requires knowledge of potential variations during deployment. In this paper, we introduce Attention-Privileged Reinforcement Learning (APRiL) which uses a self-supervised attention mechanism to significantly alleviate these drawbacks: by focusing on task-relevant aspects of the observations, attention provides robustness to distractors as well as significantly increased learning efficiency. APRiL trains two attention-augmented actor-critic agents: one purely based on image observations, available across training and transfer domains; and one with access to privileged information (such as environment states) available only during training. Experience is shared between both agents and their attention mechanisms are aligned. The image-based policy can then be deployed without access to privileged information. We experimentally demonstrate accelerated and more robust learning on a diverse set of domains, leading to improved final performance for environments both within and outside the training distribution.

研究动机与目标

  • 解决在视觉领域随机化设置下,基于图像的深度强化学习中样本效率低和泛化能力差的问题。
  • 减少对耗时的视觉随机化的依赖,后者会增加训练难度并可能降低最终性能。
  • 在推理阶段无需访问特权信息的前提下,提升对干扰物和未见视觉变化的鲁棒性。
  • 通过在训练期间利用模拟器状态中的结构化、任务相关知识,加速基于图像策略的学习。

提出的方法

  • APRiL同时训练两个独立的演员-critic智能体:一个基于图像的智能体(部署时无需特权信息),以及一个基于状态的智能体(训练期间可访问环境状态)。
  • 两个智能体均使用注意力机制对输入进行过滤,且在训练过程中显式对齐其注意力模块,以引导基于图像的智能体关注任务相关特征。
  • 该方法在两个智能体之间采用共享的经验回放缓冲区,从而提升数据效率并加快基于图像策略的学习速度。
  • 基于状态智能体的注意力被训练为聚焦于任务相关元素(如目标物体、肢体等),并通过注意力对齐将该知识传递给基于图像的智能体。
  • 注意力对齐通过对比损失实现,该损失促使图像空间与状态空间中对应观测的注意力掩码趋于一致。
  • 该方法为无模型方法,并通过将注意力机制作为从特权智能体向图像智能体进行知识蒸馏的机制,扩展了非对称演员-critic方法。

实验结果

研究问题

  • RQ1注意力机制是否能提升在视觉领域随机化设置下的基于图像深度强化学习的样本效率与鲁棒性?
  • RQ2将基于图像与基于状态智能体的注意力对齐,是否能带来对训练期间未见干扰物的更好泛化能力?
  • RQ3在特权智能体与图像智能体之间共享经验回放缓冲区,在多大程度上能加速图像智能体策略的学习?
  • RQ4与强基线方法如asym-DDPG和s-map asym-DDPG相比,APRiL在最终性能与泛化能力方面表现如何?
  • RQ5注意力对齐与共享经验回放缓冲区在提升策略性能方面,各自贡献如何?

主要发现

  • 与asym-DDPG和s-map asym-DDPG相比,APRiL显著加速了学习过程,在多个模拟环境中均观察到更快的收敛速度。
  • 使用APRiL训练的基于图像的策略在训练期间未出现的额外干扰物环境中仍能稳健泛化,展现出强大的分布外泛化能力。
  • 在分布内及外推测试环境中,APRiL在最终性能上均优于基线方法,尤其在高视觉可变性的设置下表现更优。
  • 消融实验表明,注意力对齐对性能提升的贡献大于仅使用共享经验回放缓冲区,凸显了注意力引导特征学习的重要性。
  • 基于图像智能体的注意力机制能够有效抑制与任务无关的视觉噪声(如背景杂乱),仅聚焦于目标物体或机械臂等关键对象。
  • 在JacoReach环境中,即使干扰物数量不断增加,基于图像智能体的注意力掩码仍能持续仅突出显示目标物体和机械臂,证实了其任务驱动的注意力学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。