Skip to main content
QUICK REVIEW

[论文解读] Look where you look! Saliency-guided Q-networks for generalization in visual Reinforcement Learning

David Bertoin, Adil Zouitine|arXiv (Cornell University)|Sep 16, 2022
Visual Attention and Saliency Detection被引用 5
一句话总结

本文提出显著性引导的Q网络(SGQN),一种通用方法,通过训练智能体自主识别并聚焦于关键输入像素,从而提升视觉强化学习的泛化能力和可解释性。SGQN将自监督显著性预测与一致性损失相结合,在DMControl基准测试中显著提升软演员评论家(Soft Actor-Critic)的性能,尤其在干扰物丰富的条件下表现突出,创下泛化能力和训练效率的新SOTA水平。

ABSTRACT

Deep reinforcement learning policies, despite their outstanding efficiency in simulated visual control tasks, have shown disappointing ability to generalize across disturbances in the input training images. Changes in image statistics or distracting background elements are pitfalls that prevent generalization and real-world applicability of such control policies. We elaborate on the intuition that a good visual policy should be able to identify which pixels are important for its decision, and preserve this identification of important sources of information across images. This implies that training of a policy with small generalization gap should focus on such important pixels and ignore the others. This leads to the introduction of saliency-guided Q-networks (SGQN), a generic method for visual reinforcement learning, that is compatible with any value function learning method. SGQN vastly improves the generalization capability of Soft Actor-Critic agents and outperforms existing stateof-the-art methods on the Deepmind Control Generalization benchmark, setting a new reference in terms of training efficiency, generalization gap, and policy interpretability.

研究动机与目标

  • 为解决深度强化学习智能体在视觉控制任务中泛化能力差的问题,尤其是在存在干扰物或统计分布多变的输入条件下。
  • 通过鼓励智能体关注因果相关的视觉特征并忽略干扰性背景元素,提升策略的鲁棒性。
  • 开发一种方法,在无需外部显著性图或额外推理开销的前提下,同时提升泛化能力和可解释性。
  • 建立一种通用、可插拔的框架,兼容任意基于值函数的深度强化学习算法,特别是软演员评论家(SAC)算法。

提出的方法

  • 引入一致性正则化项,促使Q值函数主要依赖于显著性图所识别出的决定性像素。
  • 采用自监督学习目标,使智能体预测自身Q值的显著性图,从而促进对决策相关特征的自我认知。
  • 采用双层循环机制:显著性图指导价值函数学习,而预测的显著性图则优化特征表示,形成良性学习循环。
  • 通过修改Q网络结构以集成显著性头(用于预测注意力图)的方式,将该方法应用于软演员评论家(SAC)。
  • 使用基于梯度的显著性图估计方法(如Grad-CAM或类似方法),实现可微分的显著性图估计,支持端到端训练。
  • 引入一致性损失,将Q值的显著性图与Q网络的梯度归因结果对齐,确保注意力机制与价值函数依赖关系的一致性。

实验结果

研究问题

  • RQ1自监督显著性预测是否能提升视觉强化学习智能体在存在干扰物和图像变化情况下的泛化能力?
  • RQ2强制Q值依赖性与显著性图之间的一致性,如何影响策略的鲁棒性与训练效率?
  • RQ3基于内在显著性预测的自注意力机制在不依赖外部解释工具的前提下,能在多大程度上提升可解释性?
  • RQ4像SGQN这样通用且模块化的方法能否有效应用于SAC,并在DMControl泛化基准测试中超越现有SOTA方法?
  • RQ5自监督显著性学习目标是否能带来更具泛化能力的特征表示,使其在分布偏移下依然表现良好?

主要发现

  • SGN-SAC(SGQN应用于SAC)在硬性泛化基准测试中的平均回报相比原始SAC提升了493%。
  • 在'finger spin'环境的硬版本中,SGN-SAC达到822±24的回报,相比原始SAC的20±10提升了4010%。
  • 该方法显著缩小了泛化差距,尤其在干扰物密集的环境中,优于此前的SOTA方法。
  • SGQN提供内在的、实时的归因图,无计算开销,实现无需事后解释工具的可解释决策。
  • 消融实验证实,若移除一致性损失,硬性基准测试中的性能将下降15%-20%,验证了其关键作用。
  • SGN-SAC的训练效率显著提升,即使在干净的训练环境中,也表现出更快的收敛速度和更高的样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。