Skip to main content
QUICK REVIEW

[论文解读] Bridging the Gap: Providing Post-Hoc Symbolic Explanations for Sequential Decision-Making Problems with Inscrutable Representations

Sarath Sreedharan, Utkarsh Soni|arXiv (Cornell University)|Feb 4, 2020
Explainable Artificial Intelligence (XAI)参考文献 40被引用 7
一句话总结

本文提出了一种框架,用于为具有难以理解的内部表示的顺序决策智能体,在用户指定的概念下生成对比性的事后符号解释。通过从智能体轨迹中学习局部符号动力学模型(例如,类似PDDL的模型),该框架解释为何一种动作序列优于另一种替代序列,并在《Mazetuma's Revenge》和《Sokoban》变体上的用户研究中验证了其高解释置信度和感知有用性。

ABSTRACT

As increasingly complex AI systems are introduced into our daily lives, it becomes important for such systems to be capable of explaining the rationale for their decisions and allowing users to contest these decisions. A significant hurdle to allowing for such explanatory dialogue could be the vocabulary mismatch between the user and the AI system. This paper introduces methods for providing contrastive explanations in terms of user-specified concepts for sequential decision-making settings where the system's model of the task may be best represented as an inscrutable model. We do this by building partial symbolic models of a local approximation of the task that can be leveraged to answer the user queries. We test these methods on a popular Atari game (Montezuma's Revenge) and variants of Sokoban (a well-known planning benchmark) and report the results of user studies to evaluate whether people find explanations generated in this form useful.

研究动机与目标

  • 解决在顺序决策场景中AI系统与人类用户之间的词汇不匹配问题。
  • 使AI系统能够使用人类可理解的概念,生成对比性解释——即为何一个动作优于另一个替代动作。
  • 开发对智能体内部模型的局部符号近似,以用户指定的术语捕捉前提条件和效果。
  • 通过引入解释置信度(一种基于阈值的保真度度量)来确保解释质量。
  • 通过经IRB批准的用户研究,在真实世界的顺序决策任务中评估此类解释的实用性。

提出的方法

  • 从智能体执行过程中收集的状态-动作-状态轨迹中构建局部符号动力学模型(例如,PDDL风格)。
  • 使用学习到的分类器将用户指定的概念映射到智能体的内部表示。
  • 利用学习到的符号模型通过分析替代动作序列的前提条件和效果来回答对比性查询。
  • 将解释置信度计算为反映模型对智能体实际行为保真度的概率估计。
  • 集成一种元顺序决策框架,以在当前词汇不足以支持解释时,主动引导新概念的获取。
  • 将该方法应用于确定性顺序决策任务,并为随机设置提供扩展路径。

实验结果

研究问题

  • RQ1AI系统能否为具有难以理解内部模型的智能体所做出的顺序决策,在用户指定的概念下生成对比性解释?
  • RQ2这些解释在提升用户理解力和信任度方面的有效性如何,其衡量标准为用户研究结果?
  • RQ3解释置信度在多大程度上与解释质量和用户对可靠性的感知相关?
  • RQ4系统能否检测到用户词汇不足的情况,并引导获取新的、相关的概念?
  • RQ5与基于显著性或特征的解释方法相比,该方法在用户理解力和实用性方面表现如何?

主要发现

  • 在《Mazetuma's Revenge》和《Sokoban》变体上的用户研究显示,参与者认为使用该方法生成的对比性解释具有用且易懂。
  • 系统的解释置信度度量有效过滤了低保真度的解释,提升了解释过程的可靠性。
  • 即使智能体的内部模型是非符号且不透明的,该方法仍能成功以用户定义的概念生成解释。
  • 该框架在识别当前概念集不足的场景方面表现出可行性,并支持结构化的概念获取方法。
  • 置信度阈值的集成降低了误导性解释的风险,从而增强了人机交互中的可信度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。