Skip to main content
QUICK REVIEW

[论文解读] Transparency and Explanation in Deep Reinforcement Learning Neural Networks

Rahul Iyer, Yuezhang Li|D-Scholarship@Pitt (University of Pittsburgh)|Sep 17, 2018
Explainable Artificial Intelligence (XAI)参考文献 23被引用 16
一句话总结

本文提出了一种面向对象的深度强化学习(O-DRL)框架,将显式的对象识别与对象极性(正向/负向影响)整合到DRL模型中,以生成可解释的对象显著性图。这些图可视化了哪些游戏对象驱动了策略决策,从而实现人类可理解的解释;人类实验表明,它们在预测智能体行为方面与原始屏幕截图效果相当,尤其在奖励模糊的复杂场景中表现更优。

ABSTRACT

Autonomous AI systems will be entering human society in the near future to provide services and work alongside humans. For those systems to be accepted and trusted, the users should be able to understand the reasoning process of the system, i.e. the system should be transparent. System transparency enables humans to form coherent explanations of the system's decisions and actions. Transparency is important not only for user trust, but also for software debugging and certification. In recent years, Deep Neural Networks have made great advances in multiple application areas. However, deep neural networks are opaque. In this paper, we report on work in transparency in Deep Reinforcement Learning Networks (DRLN). Such networks have been extremely successful in accurately learning action control in image input domains, such as Atari games. In this paper, we propose a novel and general method that (a) incorporates explicit object recognition processing into deep reinforcement learning models, (b) forms the basis for the development of "object saliency maps", to provide visualization of internal states of DRLNs, thus enabling the formation of explanations and (c) can be incorporated in any existing deep reinforcement learning framework. We present computational results and human experiments to evaluate our approach.

研究动机与目标

  • 为解决深度强化学习(DRL)智能体的不透明性问题,该问题会阻碍用户信任与系统调试。
  • 通过在学习过程中引入对象级特征,使自主智能体能够提供人类可理解的决策解释。
  • 开发一种可泛化的技术,提升透明度,且无需对现有DRL框架进行架构层面的重大修改。
  • 通过计算实验与人类实验,评估对象显著性图在提升人类对DRL智能体行为理解方面的有效性。

提出的方法

  • 将显式的对象识别与对象极性(正向/负向奖励影响)整合到DRL网络架构中。
  • 通过增加一个处理对象特征及其显著性的分支,对现有DRL框架(如DQN、A3C)进行修改,以增强状态表示。
  • 使用标准DRL损失函数端到端训练O-DRL模型,同时保持显著性分数的反向传播能力。
  • 通过计算Q值或策略输出对对象特征的梯度,生成对象显著性图,突出显示最影响决策的对象。
  • 利用这些显著性图可视化对象的相对重要性(例如,点、幽灵、樱桃),以展示其存在性与极性。
  • 将该方法应用于Ms. Pac-Man等Atari游戏,其中对象具有明确的奖励影响,以测试可解释性与人类理解能力。

实验结果

研究问题

  • RQ1面向对象的DRL模型是否能通过使内部决策过程对人类可见,从而提升透明度?
  • RQ2与原始游戏截图相比,对象显著性图在帮助人类预测DRL智能体行为方面有多有效?
  • RQ3在涉及多个影响对象的复杂决策场景中,显著性图是否能提供比视觉帧更清晰的洞察?
  • RQ4对象显著性图是否有助于识别并解释DRL智能体的次优或意外行为?

主要发现

  • 在Ms. Pac-Man中,对象显著性图与原始游戏截图在帮助人类参与者预测DRL智能体行为方面效果相当。
  • 在复杂场景中(例如,智能体面临向左或向下移动的选择时),60%使用显著性图的参与者能根据对象极性(如下方的点)正确预测智能体的动作。
  • 相比之下,75%使用截图的参与者预测智能体会向左转,理由是左侧有樱桃,表明显著性图揭示了仅从视觉帧中难以察觉的决策驱动因素。
  • 结果表明,对象显著性图能够暴露DRL策略背后的真实决策逻辑,尤其在奖励结构导致非直观行为时更为显著。
  • 实验中不同试验间的表现差异表明,显著性图在视觉上下文不足的模糊或高认知负荷场景中尤为有价值。
  • 该方法具有可泛化性,可无缝集成到现有DRL框架(如DQN和A3C)中,无需进行重大的架构修改。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。