[论文解读] Complementary reinforcement learning towards explainable agents
本文提出了一种准符号化(QS)智能体,通过学习深度强化学习(RL)智能体的行为,构建一个透明的、基于规则的决策系统。通过识别高价值状态转移('hub states'),并结合简单的匹配网络与值网络,QS智能体在性能上可与原始RL智能体相媲美,同时实现了可解释性、可修改性和可修复性,为高风险应用场景中的可解释AI提供了可行路径。
Reinforcement learning (RL) algorithms allow agents to learn skills and strategies to perform complex tasks without detailed instructions or expensive labelled training examples. That is, RL agents can learn, as we learn. Given the importance of learning in our intelligence, RL has been thought to be one of key components to general artificial intelligence, and recent breakthroughs in deep reinforcement learning suggest that neural networks (NN) are natural platforms for RL agents. However, despite the efficiency and versatility of NN-based RL agents, their decision-making remains incomprehensible, reducing their utilities. To deploy RL into a wider range of applications, it is imperative to develop explainable NN-based RL agents. Here, we propose a method to derive a secondary comprehensible agent from a NN-based RL agent, whose decision-makings are based on simple rules. Our empirical evaluation of this secondary agent's performance supports the possibility of building a comprehensible and transparent agent using a NN-based RL agent.
研究动机与目标
- 为解决深度强化学习(RL)智能体在医疗保健和自动驾驶等高风险领域部署中因缺乏透明性而带来的关键问题。
- 开发一种次级的、可理解的智能体,能够解释并复现复杂、黑箱式RL智能体的决策过程。
- 通过透明的、基于规则的机制,实现对智能体行为的手动修正与渐进式改进。
- 探索是否能够构建一个简单、可解释的智能体,在复杂任务中达到与深度RL智能体相当的性能。
提出的方法
- QS智能体使用值网络存储并检索与状态转移($\Delta S$)相关的累积奖励,将这些视为学习到的值。
- 匹配网络使用余弦相似度识别与当前状态转移最相似的存储转移($\Delta S$),并基于最高值匹配选择最佳动作。
- 智能体识别出'hub states'——即对有效策略至关重要的高价值转移,并通过动作规划优先到达这些状态。
- 若无法找到通往hub状态的有效路径,智能体将默认选择具有最高即时转移值的动作。
- 系统设计为模块化、独立的组件(匹配节点与值网络),支持对特定状态-转移规则的手动添加、删除或修改。
- 该方法在OpenAI Gym的'lunar-lander'环境中进行评估,将QS智能体的性能与原始RL智能体进行对比。
实验结果
研究问题
- RQ1是否可以训练一个次级的、基于规则的智能体,在保持决策过程完全透明的同时,复现深度RL智能体的性能?
- RQ2复杂、黑箱式的RL智能体的决策过程是否可以被提炼为一组简单、可解释的规则,供人类分析?
- RQ3是否能够构建一个系统,使智能体的行为可通过对其内部规则的手动干预实现渐进式修正或改进?
- RQ4在连续控制基准测试中,透明的准符号化智能体的性能与深度RL智能体相比如何?
主要发现
- 准符号化(QS)智能体在'lunar-lander'环境中实现了与原始深度强化学习智能体相当的性能,证明了透明智能体可达到复杂RL智能体的性能水平。
- 由于采用简单、模块化的架构,QS智能体的决策过程完全透明,其独立的匹配网络与值网络可被人工分析与修改。
- 该系统支持渐进式改进:性能不佳或存在安全隐患的状态-转移规则可被移除,新且有价值的转移可被添加,而不会破坏现有功能。
- QS智能体成功识别并优先处理了'hub states'——构成有效策略核心的关键转移,展示了其从RL行为中学习与泛化的能力。
- 值网络有效存储并检索了转移值,匹配网络也可靠地基于与先前观察到的高价值转移的相似性,选择了最佳动作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。