Skip to main content
QUICK REVIEW

[论文解读] Sequential Explanations with Mental Model-Based Policies

Arnold YS Yeung, Shalmali Joshi|arXiv (Cornell University)|Jul 17, 2020
Explainable Artificial Intelligence (XAI)参考文献 31被引用 4
一句话总结

本文提出了一种强化学习框架,能够根据用户不断演化的心理模型生成顺序性解释,从而随时间推移提升可解释性。通过观察用户理解程度的行为代理指标,该方法选择的解释在提升可模拟性方面优于随机选择,尤其在原型和组合解释类型中表现更佳。

ABSTRACT

The act of explaining across two parties is a feedback loop, where one provides information on what needs to be explained and the other provides an explanation relevant to this information. We apply a reinforcement learning framework which emulates this format by providing explanations based on the explainee's current mental model. We conduct novel online human experiments where explanations generated by various explanation methods are selected and presented to participants, using policies which observe participants' mental models, in order to optimize an interpretability proxy. Our results suggest that mental model-based policies (anchored in our proposed state representation) may increase interpretability over multiple sequential explanations, when compared to a random selection baseline. This work provides insight into how to select explanations which increase relevant information for users, and into conducting human-grounded experimentation to understand interpretability.

研究动机与目标

  • 为弥合以用户为中心的解释设计差距,将解释建模为解释者与被解释者之间的反馈回路。
  • 通过根据被解释者当前心理模型动态选择解释,提升黑箱模型的可解释性。
  • 评估基于心理模型的策略是否在提升用户可模拟性方面优于随机选择。
  • 通过在 MTurk 上开展在线人类实验,将可解释性度量建立在真实用户行为基础之上。
  • 探索利用实证心理模型观测结果作为强化学习框架中状态表示的可行性。

提出的方法

  • 该框架将解释建模为使用强化学习的顺序决策过程,其中智能体根据观测到的用户心理模型选择解释。
  • 心理模型通过实证行为代理(如用户响应和交互模式)表示,这些代理在在线人类实验中被测量。
  • 策略根据其对可解释性的预期影响,从多种解释类型(例如显著性图、原型、组合)中选择解释,使用可模拟性代理作为奖励信号。
  • 解释通过既有的解释器生成:使用深度泰勒分解生成显著性图,使用基于原型的方法生成局部表示。
  • 在 Amazon MTurk 上开展了在线实验,参与者按顺序与解释互动,其理解程度通过可模拟性得分进行测量。
  • 计算了 Cohen’s d 效应量,以评估基于心理模型的策略与随机基线在可模拟性提升方面的差异程度。

实验结果

研究问题

  • RQ1能否通过适应用户不断演化的心理模型的强化学习策略,在顺序解释中提升可解释性?
  • RQ2基于心理模型的解释策略在用户可模拟性方面与随机选择相比表现如何?
  • RQ3当基于心理模型选择时,不同解释类型(如显著性图与原型)在有效性上是否存在差异?
  • RQ4心理模型观测在多大程度上减少了无关信息并随时间提升理解力?
  • RQ5解释多样性与互补性对长期可解释性提升有何影响?

主要发现

  • 基于心理模型的策略显著提升了可模拟性得分,尤其在原型和组合解释类型中表现突出。
  • 基于心理模型的策略的效应量(Cohen’s d)为中等到大(d > 0.5),表明可解释性有实质性提升。
  • 基于显著性图的策略在心理模型基线与随机基线之间表现相似,表明该解释类型收益有限。
  • 显著性图和原型实验中可模拟性得分趋于平稳,可能表明多次解释后出现收益递减或认知过载。
  • 组合解释中未出现得分平台期,表明不同解释类型提供了日益互补的信息,持续维持可解释性提升。
  • 可模拟性得分的高标准误表明用户响应存在较大变异性,可能源于疲劳、注意力转移或在线实验中未监测到的个体差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。