Skip to main content
QUICK REVIEW

[论文解读] Finding and Visualizing Weaknesses of Deep Reinforcement Learning Agents

Christian Rupprecht, Cyril Ibrahim|arXiv (Cornell University)|Apr 2, 2019
Reinforcement Learning in Robotics参考文献 47被引用 9
一句话总结

本文提出一种生成建模方法,用于合成关键但未见过的状态,以揭示深度强化学习智能体的弱点。通过优化在环境状态上预训练的变分自编码器的潜在空间,该方法生成能引发高风险或高不确定性行为的输入,从而在不修改训练过程的情况下可视化智能体的失败行为,并在Atari游戏和驾驶模拟器中验证了其有效性。

ABSTRACT

As deep reinforcement learning driven by visual perception becomes more widely used there is a growing need to better understand and probe the learned agents. Understanding the decision making process and its relationship to visual inputs can be very valuable to identify problems in learned behavior. However, this topic has been relatively under-explored in the research community. In this work we present a method for synthesizing visual inputs of interest for a trained agent. Such inputs or states could be situations in which specific actions are necessary. Further, critical states in which a very high or a very low reward can be achieved are often interesting to understand the situational awareness of the system as they can correspond to risky states. To this end, we learn a generative model over the state space of the environment and use its latent space to optimize a target function for the state of interest. In our experiments we show that this method can generate insights for a variety of environments and reinforcement learning methods. We explore results in the standard Atari benchmark games as well as in an autonomous driving simulator. Based on the efficiency with which we have been able to identify behavioural weaknesses with this technique, we believe this general approach could serve as an important tool for AI safety applications.

研究动机与目标

  • 为解决深度强化学习智能体在可解释性方面的不足,特别是理解其在高风险或临界条件下的决策机制。
  • 开发一种无需修改训练过程即可识别已训练智能体故障模式的方法。
  • 生成新颖且未见过的环境状态,以引发智能体具有行为意义的特定响应。
  • 实现对智能体在安全关键场景(如不当刹车或未能检测行人)下行为的可视化。
  • 提供一种适用于多种强化学习算法和环境的通用工具,用于探测智能体的鲁棒性与情境感知能力。

提出的方法

  • 在从预训练的强化学习智能体收集的状态数据集上训练变分自编码器(VAE),以学习环境的解耦潜在表征。
  • 将VAE的潜在空间用作约束优化空间,以生成满足用户定义目标的新状态,避免无结构噪声的优化。
  • 定义目标函数,如'T+'(高未来回报)和'T-'(低未来回报),以针对智能体预期获得高或低奖励的状态。
  • 引入智能体感知损失,以确保生成的状态在感知上真实且与智能体策略相关,从而减少欺骗性样本。
  • 使用基于梯度的方法在潜在空间中优化,以寻找使目标函数最大化或最小化的状态,然后解码至图像空间。
  • 通过像素级均方误差和相对差异阈值(例如每通道25%)比较生成状态与训练数据,验证泛化能力。

实验结果

研究问题

  • RQ1我们能否生成新颖且未见过的环境状态,以引发训练好的强化学习智能体的高风险或高不确定性行为?
  • RQ2与随机或显著性基方法相比,通过VAE进行潜在空间优化在揭示行为弱点方面的有效性如何?
  • RQ3该方法在多大程度上能检测到智能体感知中的偏差或故障,例如遗漏关键障碍物(如分心的行人)?
  • RQ4即使智能体在真实数据上进行训练,该方法是否能识别出在安全场景中不必要刹车等故障模式?
  • RQ5生成的分布与训练数据相比泛化能力如何,有多少比例的像素与训练帧存在显著差异?

主要发现

  • 该方法成功生成了引发高风险行为的状态,例如在空旷道路上不必要地刹车,揭示了自动驾驶智能体中已知的故障模式。
  • 在“分心行人”环境中,智能体在行人低头看手机时未能检测到正在过马路的行人,证实该方法暴露了关键的感知盲区。
  • 平均而言,生成状态中25%的像素与最近的训练帧相比差异超过25%,表明其在训练分布之外具有强泛化能力和新颖性。
  • 可视化结果显示,智能体能正确感知交通灯、车辆和路口等关键元素,但在高风险场景中未能检测到行人。
  • 与基于噪声的优化相比,智能体感知损失显著减少了欺骗性样本的生成,提高了合成状态的相关性。
  • 该方法在50款Atari游戏和一个复杂的驾驶模拟器中均表现有效,证明其在多种强化学习环境和算法中具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。