[论文解读] A Psychological Theory of Explainability
本文提出了一种可解释性的心理学理论,通过在相似性空间中运用谢泼德的普遍泛化定律,建模人类如何解释由AI生成的显著性图解释。该理论在一项预先注册的用户研究中,对人类推断的定量预测达到了皮尔逊等级相关系数0.86,提供了首个经过实证验证、数学形式化的XAI中人类解释理解模型。
The goal of explainable Artificial Intelligence (XAI) is to generate human-interpretable explanations, but there are no computationally precise theories of how humans interpret AI generated explanations. The lack of theory means that validation of XAI must be done empirically, on a case-by-case basis, which prevents systematic theory-building in XAI. We propose a psychological theory of how humans draw conclusions from saliency maps, the most common form of XAI explanation, which for the first time allows for precise prediction of explainee inference conditioned on explanation. Our theory posits that absent explanation humans expect the AI to make similar decisions to themselves, and that they interpret an explanation by comparison to the explanations they themselves would give. Comparison is formalized via Shepard's universal law of generalization in a similarity space, a classic theory from cognitive science. A pre-registered user study on AI image classifications with saliency map explanations demonstrate that our theory quantitatively matches participants' predictions of the AI.
研究动机与目标
- 为解决当前缺乏形式化、计算精确的理论来解释人类如何理解AI解释的问题,因为这使得XAI的验证方法只能依赖于经验性且案例特定的手段。
- 开发一种理论,利用认知科学原理(特别是信念投射和相似性空间中的泛化)来形式化人类从显著性图解释中进行推断的过程。
- 构建一个心理上合理且可实证检验的人类解释理解预测模型。
- 通过理论驱动的评估与设计,减少对临时用户研究的依赖,从而降低对重复、高成本用户研究的依赖。
- 通过将XAI建立在人类认知的既定理论(如谢泼德的普遍泛化定律)基础上,弥合认知科学与机器学习之间的鸿沟。
提出的方法
- 该理论假设人类会将自己的信念投射到AI系统上,并通过在共享的相似性空间中比较自动生成的解释与AI生成的解释来更新这些信念。
- 泛化过程通过谢泼德的普遍泛化定律形式化,该定律将相似性定义为心理空间中距离的函数。
- 构建一个认知模型,基于自动生成解释与AI生成解释之间的相似性,计算人类推断的可能性。
- 通过一项预先注册的用户研究对模型进行验证,参与者需根据显著性图推断AI的图像分类结果。
- 使用非参数相关性(斯皮尔曼等级相关系数)将模型预测与人类反应进行比较,以评估预测准确性。
- 通过敏感性分析测试模型的鲁棒性,通过改变相似性空间和泛化定律,确认其心理上的合理性。
实验结果
研究问题
- RQ1人类如何从显著性图解释中推断AI决策?
- RQ2在基于信念投射与相似性泛化的认知模型下,人类从AI解释中进行推断在多大程度上可以被预测?
- RQ3基于认知科学的心理学理论是否在预测人类解释理解方面优于黑箱机器学习模型?
- RQ4相似性空间或泛化定律的变化如何影响模型的预测性能与心理合理性?
- RQ5一个形式化的可解释性理论是否能够减少XAI评估中对重复、高成本用户研究的依赖?
主要发现
- 所提出的认知模型对人类从显著性图解释中进行推断的预测,其斯皮尔曼等级相关系数达到0.86,表明与人类反应具有强烈的定量一致性。
- 当相似性空间或泛化定律被调整为降低心理合理性时,预测性能下降,证实了模型的理论基础坚实可靠。
- 该模型成功捕捉了解释保真度的变化,包括在33张图像中解释反而降低模型性能的情况(共89张图像),表明其对低质量解释具有鲁棒性。
- 该理论通过显式建模人类推断过程,优于黑箱机器学习方法,避免了泛化能力差和可审计性差等问题。
- 结果验证了既有的认知科学原理(尤其是信念投射与基于相似性的泛化)可用于构建准确且可复用的人类解释理解模型。
- 该框架具有可扩展性,可通过借鉴抽象领域中相似性判断的心理学文献,推广至非视觉数据(如表格数据、文本数据)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。