Skip to main content
QUICK REVIEW

[论文解读] An initial attempt of combining visual selective attention with deep reinforcement learning

Liu Yuezhang, Ruohan Zhang|arXiv (Cornell University)|Nov 11, 2018
Reinforcement Learning in Robotics参考文献 29被引用 15
一句话总结

本文通过在A2C和DQN智能体的策略网络中融合基于光流的注意力图,提出将视觉选择性注意机制整合到深度强化学习中。实验表明,该方法在Atari游戏和Catch环境中提升了样本效率与性能,关键发现为注意力与批量归一化之间存在协同作用。

ABSTRACT

Visual attention serves as a means of feature selection mechanism in the perceptual system. Motivated by Broadbent's leaky filter model of selective attention, we evaluate how such mechanism could be implemented and affect the learning process of deep reinforcement learning. We visualize and analyze the feature maps of DQN on a toy problem Catch, and propose an approach to combine visual selective attention with deep reinforcement learning. We experiment with optical flow-based attention and A2C on Atari games. Experiment results show that visual selective attention could lead to improvements in terms of sample efficiency on tested games. An intriguing relation between attention and batch normalization is also discovered.

研究动机与目标

  • 研究视觉选择性注意机制如何提升深度强化学习的性能。
  • 理解DQN中中间特征图的作用,并探究注意力是否能在更深的网络层实现有效融合。
  • 评估注意力对简单与复杂环境中样本效率和学习稳定性的影响。
  • 探索注意力机制与批量归一化等归一化层之间的相互作用。
  • 提出一种在特征层面而非仅输入层进行注意力融合的方法,受人类感知中分层注意力机制的启发。

提出的方法

  • 利用连续帧之间的光流生成视觉注意力,以突出移动物体作为显著特征。
  • 将注意力图与策略网络的最后一个卷积特征图逐元素相乘,随后进行批量归一化。
  • 该方法应用于A2C和DQN智能体,注意力在最终卷积层融合,以调制特征表示。
  • 使用一个简化环境(Catch)分析特征图,并验证注意力机制对学习动态的影响。
  • 实验将所提方法与基线A2C和DQN在四个Atari游戏中进行比较,采用标准OpenAI基线和默认超参数。
  • 该方法受Broadbent的漏斗过滤模型启发,其中未被注意的特征不会被丢弃,而是通过可学习的缩放因子进行衰减。

实验结果

研究问题

  • RQ1视觉选择性注意能否提升深度强化学习中的样本效率?
  • RQ2在特征层面(而非输入层面)融合注意力是否能改善复杂环境中的学习性能?
  • RQ3视觉注意力与批量归一化在深度强化学习智能体中存在何种交互效应?
  • RQ4基于运动的注意力(通过光流实现)能否有效突出视频游戏中的任务相关特征?
  • RQ5注意力机制是否可有意义地应用于网络的深层,而不仅限于输入阶段?

主要发现

  • 基于光流的注意力在Breakout和Seaquest中显著提升了样本效率,尤其在训练初期,这得益于这些游戏中移动物体的显著性。
  • 在所有四个测试的Atari游戏中(Breakout、Seaquest、MsPacman和Centipede),该方法均实现了适度的性能提升。
  • 发现注意力机制与批量归一化之间存在显著交互作用,表明归一化在稳定注意力融合表示方面起着关键作用。
  • 在Catch环境中,注意力降低了噪声并提升了学习稳定性,尤其在视觉杂乱输入下表现更优,证明了其在特征选择中的价值。
  • 在最后一个卷积层融合注意力比在输入层融合更有利于策略学习,支持了分层注意力融合的有效性。
  • 结果表明,注意力机制不仅可在输入阶段与深度强化学习结合,也可在中间特征层有效融合,从而增强表征学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。