[论文解读] Roadmap of Designing Cognitive Metrics for Explainable Artificial Intelligence (XAI)
本文通过整合心理学与认知科学原理,提出了一套用于评估可解释人工智能(XAI)系统的认知度量路线图。该路线图识别出七个关键维度——质量、满意度、理解度、好奇心、信任度、可控性与学习曲线,提供主观与客观度量方法,以量化用户理解程度与系统有效性,并在视觉分类XAI系统上展示了其应用。
More recently, Explainable Artificial Intelligence (XAI) research has shifted to focus on a more pragmatic or naturalistic account of understanding, that is, whether the stakeholders understand the explanation. This point is especially important for research on evaluation methods for XAI systems. Thus, another direction where XAI research can benefit significantly from cognitive science and psychology research is ways to measure understanding of users, responses and attitudes. These measures can be used to quantify explanation quality and as feedback to the XAI system to improve the explanations. The current report aims to propose suitable metrics for evaluating XAI systems from the perspective of the cognitive states and processes of stakeholders. We elaborate on 7 dimensions, i.e., goodness, satisfaction, user understanding, curiosity & engagement, trust & reliance, controllability & interactivity, and learning curve & productivity, together with the recommended subjective and objective psychological measures. We then provide more details about how we can use the recommended measures to evaluate a visual classification XAI system according to the recommended cognitive metrics.
研究动机与目标
- 解决现有XAI系统评估中仅关注技术性能而忽视利益相关者认知状态的不足。
- 识别并定义用户在XAI交互中理解度、信任度与参与度的可度量维度。
- 弥合XAI研究与认知科学、心理学之间的鸿沟,发展基于实证的评估度量方法。
- 提供一个实用框架,结合主观与客观的心理度量方法,衡量解释质量。
- 在视觉分类任务中展示这些度量方法在真实XAI系统评估中的应用。
提出的方法
- 识别七个核心认知维度:质量、满意度、用户理解度、好奇心与参与度、信任与依赖度、可控性与交互性,以及学习曲线与生产力。
- 将每个认知维度映射到既定的心理测量技术,包括主观自评量表与客观行为度量。
- 在度量设计中整合认知负荷、心智模型构建与信任校准等认知科学理论。
- 将所提出的度量应用于一个真实世界的视觉分类XAI系统,以验证其可行性与实用性。
- 采用混合方法评估:结合问卷调查(如任务后问卷)与交互日志记录及任务表现追踪。
- 通过用户反馈与XAI系统优化之间的迭代反馈回路,验证度量框架的有效性。
实验结果
研究问题
- RQ1如何系统性地应用认知科学原理,设计用于评估XAI系统的度量方法?
- RQ2哪些心理维度最能准确反映用户对AI解释的理解度与信任度?
- RQ3哪些主观与客观度量最能捕捉用户在XAI交互过程中认知状态的变化?
- RQ4这些度量如何被具体化并应用于真实XAI系统在视觉分类任务中的评估?
- RQ5这些度量在何种方式上支持基于用户反馈的XAI解释的迭代改进?
主要发现
- 所提出的认知度量框架提供了一套全面、理论驱动的XAI系统评估方法,超越了准确率或保真度的范畴。
- 主观度量如解释后满意度与信任度问卷能有效捕捉用户对解释质量的感知。
- 客观度量如任务完成时间、错误率与交互频率与认知负荷及理解水平密切相关。
- 将好奇心与参与度度量整合后发现,互动性与动态性解释能显著提升用户参与度与记忆保持。
- 当解释具有可控性并支持迭代探索时,用户的学习曲线明显改善。
- 该框架支持可操作的反馈回路,使XAI系统能够基于用户实时认知反应动态调整解释。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。