Skip to main content
QUICK REVIEW

[论文解读] Should We Trust (X)AI? Design Dimensions for Structured Experimental Evaluations

Fabian Sperrle, Mennatallah El‐Assady|arXiv (Cornell University)|Sep 14, 2020
Explainable Artificial Intelligence (XAI)参考文献 63被引用 10
一句话总结

本文提出了一套用于评估可解释人工智能(XAI)系统的结构化设计维度框架,重点关注用户信任、解释质量、模型特性、任务背景和研究设计。该研究识别出现有XAI评估实践中的关键缺口,并提出了一种信任与偏见传播的依赖模型,从而在人机交互(HCI)、数据可视化和机器学习领域实现更严谨、以用户为中心的实验评估。

ABSTRACT

This paper systematically derives design dimensions for the structured evaluation of explainable artificial intelligence (XAI) approaches. These dimensions enable a descriptive characterization, facilitating comparisons between different study designs. They further structure the design space of XAI, converging towards a precise terminology required for a rigorous study of XAI. Our literature review differentiates between comparative studies and application papers, revealing methodological differences between the fields of machine learning, human-computer interaction, and visual analytics. Generally, each of these disciplines targets specific parts of the XAI process. Bridging the resulting gaps enables a holistic evaluation of XAI in real-world scenarios, as proposed by our conceptual model characterizing bias sources and trust-building. Furthermore, we identify and discuss the potential for future work based on observed research gaps that should lead to better coverage of the proposed model.

研究动机与目标

  • 为跨多样化研究领域的可解释人工智能(XAI)系统缺乏标准化、结构化的评估方法提供解决方案。
  • 识别并系统化关键设计维度,以实现XAI研究设计的有意义比较与表征。
  • 弥合机器学习、人机交互(HCI)与可视化分析在XAI评估中的方法论差距。
  • 构建一个依赖模型,映射XAI过程中信任建立与偏见传播的路径,实现整体性评估。
  • 通过识别未被充分利用的设计维度及提升XAI评估实验严谨性的机会,为未来研究提供指导。

提出的方法

  • 对过去五年内人机交互(HCI)与可视化领域中XAI评估研究的文献进行了全面综述。
  • 将比较研究与应用论文中的设计维度分类并整合为五大核心类别:用户、解释、模型、任务与环境,以及研究设计。
  • 提出一种依赖模型,说明信任与偏见如何在XAI过程中通过用户、解释器、模型与环境传播。
  • 分析不同学科间的评估方法差异,突出各领域特有的评估优先事项与缺口。
  • 识别信任的代理指标(如可模拟性、建议权重)以减少对主观事后问卷的依赖。
  • 通过报告维度的定性编码,推导出适用于各类XAI评估情境的通用化框架。

实验结果

研究问题

  • RQ1哪些关键设计维度构成了XAI系统严谨、可比较评估的结构基础?
  • RQ2在XAI研究中,机器学习、HCI与可视化分析社区的评估实践有何差异?
  • RQ3当前XAI评估方法论中存在哪些主要研究缺口,特别是关于信任校准与解释保真度方面?
  • RQ4信任与偏见在XAI过程中如何传播?哪些组件在该链条中至关重要?
  • RQ5在不依赖主观自报数据的情况下,哪些隐含或代理的信任度量方式最有效?

主要发现

  • 文献综述显示,大多数比较性XAI研究严重依赖李克特量表的信任度评分,可能因用户先验认知而引入偏差。
  • 大量XAI评估未能系统性地评估可解释性、问责制与用户动机等核心维度。
  • 解释保真度常被忽视,存在生成看似合理但具有误导性的解释的风险,从而利用用户信任。
  • 依赖模型识别出多个信任与偏见可传播的参与方——用户、解释器、模型与环境,强调了整体性评估的必要性。
  • 可模拟性与建议权重等代理指标在替代自报信任度方面展现出潜力,有助于减少对可能带有偏见的问卷的依赖。
  • 亟需根据领域特性对设计维度进行定制化调整,以契合可视化分析、推荐系统与专家驱动应用的独特目标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。