Skip to main content
QUICK REVIEW

[论文解读] Towards Human-centered Explainable AI: A Survey of User Studies for Model Explanations

Yao Rong, Tobias Leemann|arXiv (Cornell University)|Oct 20, 2022
Explainable Artificial Intelligence (XAI)参考文献 224被引用 7
一句话总结

本文对97项可解释人工智能(XAI)用户研究进行了系统性文献回顾,识别出关键的评估维度——信任、理解、可用性及人机协作表现。研究提出了实用的、以用户为中心的设计指南,用于XAI用户研究,并强调需整合认知科学与社会科学,以提升评估的严谨性与现实相关性。

ABSTRACT

Explainable AI (XAI) is widely viewed as a sine qua non for ever-expanding AI research. A better understanding of the needs of XAI users, as well as human-centered evaluations of explainable models are both a necessity and a challenge. In this paper, we explore how HCI and AI researchers conduct user studies in XAI applications based on a systematic literature review. After identifying and thoroughly analyzing 97core papers with human-based XAI evaluations over the past five years, we categorize them along the measured characteristics of explanatory methods, namely trust, understanding, usability, and human-AI collaboration performance. Our research shows that XAI is spreading more rapidly in certain application domains, such as recommender systems than in others, but that user evaluations are still rather sparse and incorporate hardly any insights from cognitive or social sciences. Based on a comprehensive discussion of best practices, i.e., common models, design choices, and measures in user studies, we propose practical guidelines on designing and conducting user studies for XAI researchers and practitioners. Lastly, this survey also highlights several open research directions, particularly linking psychological science and human-centered XAI.

研究动机与目标

  • 通过分析近期用户研究,解决可解释人工智能(XAI)中缺乏标准化、以人为本的评估问题。
  • 识别并分类XAI用户研究中使用的评估维度,包括信任、理解(主观与客观)、可用性(工作量、满意度、帮助性)以及人机协作表现。
  • 提取用户研究设计的最佳实践,如模型选择、任务设计与测量技术,为XAI研究人员和从业者提供参考。
  • 强调当前XAI评估中对认知与社会科学洞察的利用不足。
  • 提出可操作的指导建议,并指出未来研究方向,以实现更透明、可靠且与人类对齐的XAI评估。

提出的方法

  • 对过去五年内在顶级人机交互(HCI)与机器学习(ML)会议(如CHI、NeurIPS、AAAI)发表的97篇核心论文进行了系统性文献回顾。
  • 根据测量特征对用户研究进行分类:信任、理解(主观与客观)、可用性(工作量、满意度、帮助性)以及人机协作表现。
  • 分析常见设计选择,包括代理任务、解释类型与评估指标,以识别重复出现的模式与最佳实践。
  • 通过比较模拟任务与真实世界决策情境下的结果,评估代理任务的有效性。
  • 提出一种模拟评估框架(SimEvals),通过测量预测信息预先筛选解释,减少对昂贵人工实验的依赖。
  • 探索利用大语言模型在评估环境中模拟人类反应的可能性,同时警惕认知偏差复制的风险。

实验结果

研究问题

  • RQ1近期XAI用户研究中占主导地位的评估维度是什么?它们是如何被测量的?
  • RQ2不同应用领域中的研究发现是否具有一致性?哪些因素影响了解释的有效性?
  • RQ3当前XAI用户研究中的代理任务在多大程度上能预测真实世界决策表现?
  • RQ4XAI用户研究中最常见的方法论模式与设计选择是什么?可以提炼出哪些最佳实践?
  • RQ5如何更好地将认知与社会科学见解整合到XAI评估中,以提升有效性与人类相关性?

主要发现

  • 仅有约20%的XAI评估项目涉及人类受试者,表明在以人为本的验证方面存在显著缺口。
  • 信任与理解是最常被测量的维度,其中主观理解通常通过心智模型构建任务进行评估。
  • 如心智模型构建等代理任务无法可靠预测实际决策任务中的表现,表明评估与真实世界应用之间存在脱节。
  • 尽管认知或社会科学理论在提升评估有效性方面具有潜力,但当前XAI用户研究中对此类理论的整合仍有限。
  • 像SimEvals这样的模拟评估框架可通过测量预测信息有效预筛解释,为完整人工实验提供成本更低的替代方案。
  • 大语言模型在模拟人类反应方面展现出潜力,但由于无法建模认知偏差与语境细微差别,尚无法完全取代人工评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。