[论文解读] ProtoX: Explaining a Reinforcement Learning Agent via Prototyping
ProtoX 是一种基于原型的后训练解释器,用于黑箱强化学习智能体,通过视觉和场景相似性识别代表性行为模式(原型)来解释动作。它使用自监督对比学习来捕捉视觉相似性,并通过等距层捕捉上下文场景相似性,在保持与专家策略高保真度的同时,提供可解释的、基于行为模式的人类可理解的解释。
While deep reinforcement learning has proven to be successful in solving control tasks, the "black-box" nature of an agent has received increasing concerns. We propose a prototype-based post-hoc policy explainer, ProtoX, that explains a blackbox agent by prototyping the agent's behaviors into scenarios, each represented by a prototypical state. When learning prototypes, ProtoX considers both visual similarity and scenario similarity. The latter is unique to the reinforcement learning context, since it explains why the same action is taken in visually different states. To teach ProtoX about visual similarity, we pre-train an encoder using contrastive learning via self-supervised learning to recognize states as similar if they occur close together in time and receive the same action from the black-box agent. We then add an isometry layer to allow ProtoX to adapt scenario similarity to the downstream task. ProtoX is trained via imitation learning using behavior cloning, and thus requires no access to the environment or agent. In addition to explanation fidelity, we design different prototype shaping terms in the objective function to encourage better interpretability. We conduct various experiments to test ProtoX. Results show that ProtoX achieved high fidelity to the original black-box agent while providing meaningful and understandable explanations.
研究动机与目标
- 为解决在图像和文本等非结构化环境中的黑箱深度强化学习智能体的可解释性挑战。
- 开发一种后训练解释方法,为人提供关于智能体在特定状态下为何采取某项行动的可理解洞察。
- 通过代表显著行为模式的原型,克服注意力图和决策树方法的局限性,这些原型能跨越视觉差异但上下文相似的状态进行泛化。
- 联合建模视觉相似性(通过自监督对比学习)和场景相似性(通过等距层),以实现更鲁棒、更有意义的解释。
- 在无需访问智能体策略或环境的情况下,仅使用演示轨迹,实现高解释保真度与可解释性。
提出的方法
- 在专家演示轨迹上使用时间对比损失预训练卷积编码器,基于时间邻近性和共享动作学习视觉相似性。
- 采用孪生网络架构结合对比学习,在嵌入空间中对视觉上相似的状态进行聚类。
- 在行为克隆过程中引入等距层,以适应特征空间,捕捉场景相似性,使模型能够识别视觉上不同但具有相同潜在意图的状态。
- 通过模仿学习(行为克隆)在专家轨迹上训练ProtoX,损失函数中包含原型塑造项,以提升可解释性并减少冗余。
- 通过输入状态与原型之间相似性的加权和计算动作证据,其中权重反映动作关联性(即原型对特定动作的支持强度)。
- 通过块掩码生成重要性图,突出显示对相似性贡献最大的视觉区域,辅助诊断智能体行为。
实验结果
研究问题
- RQ1基于原型的方法能否有效解释在图像等非结构化观测空间中的黑箱DRL智能体?
- RQ2如何联合建模视觉相似性与场景相似性,以提升解释的保真度与可解释性?
- RQ3在专家演示上进行自监督预训练,在多大程度上可以替代环境访问来训练策略解释器?
- RQ4ProtoX能否检测并解释智能体的缺陷行为(如未能跳跃以躲避敌人),通过识别不匹配的原型?
- RQ5在人类可解释性与保真度方面,原型表示相较于基于注意力或基于树的解释方法有何差异?
主要发现
- ProtoX 实现了高解释保真度,与VIPER和GAIfO(两种具有相似网络架构的强基线)相当或更优。
- 该模型成功解释了Super Mario Bros.和Seaquest中的复杂行为,识别出如跳过管道、躲避Goombas以及预判敌人出现等原型场景。
- ProtoX 诊断出坏智能体未能跳跃的原因在于其依赖天空颜色相似性,重要性图仅显示天空为显著区域,表明其推理模式存在缺陷。
- 相比之下,基于好智能体训练的ProtoX 正确识别出关键策略要素,如击打砖块消灭敌人,重要性图突出显示了马里奥的位置和动作上下文。
- 引入等距层显著提升了场景相似性的建模能力,使模型能够识别出视觉上不同但代表相同行为意图的状态。
- 目标函数中的原型塑造项减少了冗余,提升了可解释性,从而得到更简洁、更有意义的行为原型集合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。