[论文解读] Harnessing Explanations to Bridge AI and Humans
本文认为,当前的AI解释无法提升人类决策表现,原因在于模型解释与人类心智模型之间存在错位。本文提出两个关键研究方向:通过模型驱动的教程和交互式解释来增强人类理解;重新设计解释方式,使其更符合人类认知,例如使用自然语言或基于示例的格式,以支持对模型决策的批判性审查。
Machine learning models are increasingly integrated into societally critical applications such as recidivism prediction and medical diagnosis, thanks to their superior predictive power. In these applications, however, full automation is often not desired due to ethical and legal concerns. The research community has thus ventured into developing interpretable methods that explain machine predictions. While these explanations are meant to assist humans in understanding machine predictions and thereby allowing humans to make better decisions, this hypothesis is not supported in many recent studies. To improve human decision-making with AI assistance, we propose future directions for closing the gap between the efficacy of explanations and improvement in human performance.
研究动机与目标
- 解决AI解释在高风险应用(如再犯预测和医疗诊断)中持续无法提升人类决策准确性的根本问题。
- 探究为何现有解释方法(如特征归因)尽管理论上有潜力,却无法始终提升人类表现。
- 提出新的研究方向,使AI解释与人类认知模型重新对齐,以实现更有效的监督与对模型预测的批判性评估。
- 将关注点从优化解释的模型保真度,转向优化其在人类理解、推理与信任方面的表现。
- 探索替代性解释形式(如自然语言、基于示例的解释),以更好地支持在探索型任务中的人类理解。
提出的方法
- 提出基于模型的教程,向用户传授AI模型学习到的反直觉模式,尤其在人类缺乏强直觉的任务中。
- 引入交互式解释,允许用户修改输入并观察模型预测的变化,从而实现主动学习与对模型的深入理解。
- 倡导在分布偏移条件下评估模型泛化能力,使人类能够检测并纠正模型所忽略的虚假相关性。
- 将解释设计从静态的特征重要性,转向动态的、具有沟通性的工具,以反映人类推理与决策依据。
- 探索替代性解释格式(如自然语言或基于示例的解释),以在特征归因无法支持人类监督时提供支持。
- 将解释重新定义为模型批判的工具,而非静态诊断,尤其在已知模型错误的情境下,以支持迭代学习与优化。
实验结果
研究问题
- RQ1为何当前的AI解释尽管在理论上具有价值,却仍无法提升人类在高风险领域决策的准确性?
- RQ2人类心智模型与模型解释之间的错位在多大程度上阻碍了有效的人机协作?
- RQ3交互式或基于教程的解释系统能否提升人类对复杂、非直观模型行为的理解?
- RQ4如何重新设计解释,使其更契合人类推理过程,尤其是在探索型任务中?
- RQ5哪些替代性解释格式(如自然语言、示例)在支持人类监督与批判性判断方面优于特征归因?
主要发现
- 现有解释方法(如特征归因)并未一致提升人类决策准确性,即使模型性能已超过人类基线。
- 解释往往减少误报,但增加漏报,表明用户更善于拒绝错误预测,而难以发现被遗漏的正确预测。
- 在探索型任务中,人类常缺乏足够直觉来理解简单解释,表明需要培训或采用替代解释格式。
- 模型解释常与人类认知模型错位,构成有效人机协作的根本障碍。
- 支持主动学习的解释方式(如交互式输入修改)可提升对模型的理解,超越静态、被动的解释。
- 迫切需要将解释设计从模型保真度转向以人为本的沟通,整合人类推理与决策制定的洞见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。