Skip to main content
QUICK REVIEW

[论文解读] A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges

Yunpeng Qing, Shunyu Liu|arXiv (Cornell University)|Nov 12, 2022
Explainable Artificial Intelligence (XAI)被引用 13
一句话总结

本综述提出了一种用于可解释强化学习(XRL)的统一分类法,将方法分类为代理模型解释、奖励解释、状态解释和任务解释四类。它强调了人类知识在提升学习效率中的作用,并指出了评估、多部分可解释性以及性能与可解释性之间平衡等方面的关键挑战。

ABSTRACT

Reinforcement Learning (RL) is a popular machine learning paradigm where intelligent agents interact with the environment to fulfill a long-term goal. Driven by the resurgence of deep learning, Deep RL (DRL) has witnessed great success over a wide spectrum of complex control tasks. Despite the encouraging results achieved, the deep neural network-based backbone is widely deemed as a black box that impedes practitioners to trust and employ trained agents in realistic scenarios where high security and reliability are essential. To alleviate this issue, a large volume of literature devoted to shedding light on the inner workings of the intelligent agents has been proposed, by constructing intrinsic interpretability or post-hoc explainability. In this survey, we provide a comprehensive review of existing works on eXplainable RL (XRL) and introduce a new taxonomy where prior works are clearly categorized into model-explaining, reward-explaining, state-explaining, and task-explaining methods. We also review and highlight RL methods that conversely leverage human knowledge to promote learning efficiency and performance of agents while this kind of method is often ignored in XRL field. Some challenges and opportunities in XRL are discussed. This survey intends to provide a high-level summarization of XRL and to motivate future research on more effective XRL solutions. Corresponding open source codes are collected and categorized at https://github.com/Plankson/awesome-explainable-reinforcement-learning.

研究动机与目标

  • 为解决深度强化学习(DRL)智能体因黑箱特性导致的透明度不足问题,特别是在安全关键应用中。
  • 建立现有XRL方法的统一分类法,根据其解释强化学习过程的哪一部分(代理模型、奖励、状态或任务)进行分类。
  • 突出强调以往综述中被忽视的XRL方法,这些方法利用人类知识以提升学习效率和性能。
  • 识别XRL中的关键挑战,包括评估标准化、多部分可解释性,以及可解释性与训练效率之间的平衡。
  • 提供一个精心整理的开源资源,涵盖XRL工具与方法,以支持未来的研究与开发。

提出的方法

  • 提出一个四分支分类法:代理模型解释(例如,使用可解释模型如决策树)、奖励解释(例如,对奖励函数进行正则化以提升可解释性)、状态解释(例如,使用注意力图进行观测解释)和任务解释(例如,分层任务分解)。
  • 引入一个框架,将事后解释技术(例如,显著性图)与内在可解释性(例如,稀疏模型)相结合,以提升透明度。
  • 综述将人类知识融入学习过程的方法,如奖励塑形和奖励建模,以同时提升性能与可解释性。
  • 分析模型复杂度、性能与可解释性之间的权衡,主张使用稀疏或受限模型,以在不牺牲性能的前提下保持高可解释性。
  • 提出整合多种解释类型(例如,全局策略摘要与局部显著性图)以实现全面的、多部分的可解释性。
  • 对开源XRL实现进行分类与收集,详见 https://github.com/Plankson/awesome-explainable-reinforcement-learning,以支持可复现性与社区使用。

实验结果

研究问题

  • RQ1我们如何基于XRL方法所解释的强化学习流程组件,系统性地对现有方法进行分类?
  • RQ2XRL方法的评估面临哪些关键挑战?如何建立标准化的基准?
  • RQ3在强化学习智能体中,人类知识在多大程度上可被利用以同时提升学习效率与可解释性?
  • RQ4如何实现多部分可解释性,以在整个强化学习过程中提供全面的透明度?
  • RQ5是否存在高性能与高可解释性之间的可行平衡,还是存在根本性的权衡?

主要发现

  • 本综述提出了一种新颖的四部分XRL分类法——代理模型解释、奖励解释、状态解释和任务解释,为现有方法的分类提供了结构化框架。
  • 许多将人类知识融入的XRL方法(如奖励塑形和人机协同训练)在以往综述中被低估,但对提升学习效率与可解释性至关重要。
  • 事后解释技术(如显著性图和基于注意力的解释)广泛用于状态解释,而内在方法(如稀疏模型或决策树)在代理模型解释中表现优异。
  • 性能与可解释性之间并无固有权衡;线性模型和决策树等更简单、更可解释的模型可在保持透明性的同时实现强大性能。
  • 整合多种解释类型(如全局策略摘要与局部显著性图)为实现全面的、多部分可解释性提供了有前景的路径。
  • 缺乏标准化的评估指标仍是主要挑战,仅有少数平台(如Shen et al. (2021))提出了用于自动驾驶场景中XRL的比较评估框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。