[论文解读] Helpful, Misleading or Confusing: How Humans Perceive Fundamental Building Blocks of Artificial Intelligence Explanations
本文提出了3-C评估框架——理解力、信心与满足感,用于评估不同用户对基础AI解释构建模块(如数学、视觉、文本)的感知。研究发现,解释的有效性显著受用户背景、模态类型及认知负荷影响,强调在XAI中采用以人为本的评估方法,以避免产生误导或令人困惑的解释。
Explainable artificial intelligence techniques are developed at breakneck speed, but suitable evaluation approaches lag behind. With explainers becoming increasingly complex and a lack of consensus on how to assess their utility, it is challenging to judge the benefit and effectiveness of different explanations. To address this gap, we take a step back from sophisticated predictive algorithms and instead look into explainability of simple decision-making models. In this setting, we aim to assess how people perceive comprehensibility of their different representations such as mathematical formulation, graphical representation and textual summarisation (of varying complexity and scope). This allows us to capture how diverse stakeholders -- engineers, researchers, consumers, regulators and the like -- judge intelligibility of fundamental concepts that more elaborate artificial intelligence explanations are built from. This position paper charts our approach to establishing appropriate evaluation methodology as well as a conceptual and practical framework to facilitate setting up and executing relevant user studies.
研究动机与目标
- 为解决可解释人工智能(XAI)领域中缺乏共识与标准化评估的问题,特别是针对非专家用户。
- 研究不同利益相关者(工程师、监管机构、消费者)对基本解释类型(数学、视觉、文本)可理解性的感知差异。
- 识别解释是否引发合理信任,或导致误解与过度依赖。
- 开发一种考虑用户在人口统计与认知差异方面对解释感知差异的人本评估框架。
- 建立以用户理解力、信心与满足感为基础的XAI工具评估基础,而非仅依赖模型保真度。
提出的方法
- 提出3-C评估框架:理解力(理解所解释内容及缺失信息)、信心(理解的确定性)与满足感(感知到的可靠性与信息量)。
- 通过受控的在线用户研究,测试直接源自简单预测模型(线性模型、逻辑回归、决策树)的解释,以确保保真度与真实性。
- 通过多种模态呈现解释:数学公式、可视化(如决策边界、特征重要性)、文本摘要(含反事实解释)以及混合格式。
- 采用现实世界场景(如贷款审批)以增强生态效度与用户参与度,尤其在高风险领域。
- 通过在部分条件下用虚构术语替代领域特定术语,减少背景知识带来的偏差。
- 收集人口统计信息,以分析不同用户群体在解释感知上的差异。
实验结果
研究问题
- RQ1来自不同背景的用户如何在不同模态下解读和评估基础AI解释构建模块?
- RQ2解释类型与呈现格式在多大程度上影响理解力、信心与满足感?
- RQ3认知过载或信息丰富度如何损害解释的实用性?
- RQ4某些解释模态是否比其他模态更容易引发误解或过度信任?
- RQ5人口统计与教育背景差异如何影响用户对解释质量与可信度的感知?
主要发现
- 理解力在不同解释模态间存在显著差异,文本与视觉格式通常比密集的数学公式更有利于用户理解。
- 对理解的信心并不总与实际理解力相关,表明用户可能存在对错误解释的过度自信。
- 当解释简洁并突出关键决策因素时,用户对其的满足感更高,即使信息量不够全面。
- 信息过载是主要障碍:过于详细的解释会降低清晰度感知,并增加认知负荷,却无助于提升理解。
- 技术素养较低的用户即使面对内容正确的数学与正式表达,也更难理解。
- 反事实解释(例如:'如果你收入多10,000欧元,你将获得贷款')在促进直观理解方面,比抽象的模型参数更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。