Skip to main content
QUICK REVIEW

[论文解读] A Human-Grounded Evaluation Benchmark for Local Explanations of Machine Learning

Sina Mohseni, Eric D. Ragan|arXiv (Cornell University)|Jan 16, 2018
Explainable Artificial Intelligence (XAI)参考文献 30被引用 46
一句话总结

引入一个人类注意力基线基准,用于定量评估模型显著性解释,比较多层人类注意力掩码与分割掩码和使用 Grad-CAM 与 LIME 解释的人类判断。

ABSTRACT

Research in interpretable machine learning proposes different computational and human subject approaches to evaluate model saliency explanations. These approaches measure different qualities of explanations to achieve diverse goals in designing interpretable machine learning systems. In this paper, we propose a human attention benchmark for image and text domains using multi-layer human attention masks aggregated from multiple human annotators. We then present an evaluation study to evaluate model saliency explanations obtained using Grad-cam and LIME techniques. We demonstrate our benchmark's utility for quantitative evaluation of model explanations by comparing it with human subjective ratings and ground-truth single-layer segmentation masks evaluations. Our study results show that our threshold agnostic evaluation method with the human attention baseline is more effective than single-layer object segmentation masks to ground truth. Our experiments also reveal user biases in the subjective rating of model saliency explanations.

研究动机与目标

  • 为局部解释方法的客观、基于人类的评估提供动机。
  • 提出一个多层人类注意力基准,作为显著性解释的地面真相。
  • 实现对图像和文本领域的显著性方法的快速、可重复、客观评估。

提出的方法

  • 从每个样本的 10 个标注者收集图像和文本的多层人类注意力掩码。
  • 通过区域/词的并集来聚合标注,形成多层掩码。
  • 在像素级 MAE 无阈值情况下,将 Grad-CAM 和 LIME 的显著性图与三种基线进行比较。
  • 对于图像,可选使用精确分割掩码来遮罩背景,从而仅保留目标像素。
  • 进行以人为主体的研究,比较地面真相基线与主观评分。
  • 分别分析 FP 和 FN 错误,以了解解释错误的类型。

实验结果

研究问题

  • RQ1多层人类注意力基线是否提供与单层分割掩码不同的客观地面真相?
  • RQ2Grad-CAM 和 LIME 的显著性图对不同地面真相基线(人类注意力 vs 分割)以及对人类判断的得分如何?
  • RQ3在显著性解释的主观评分中存在哪些偏见,FP 与 FN 错误如何影响评分?
  • RQ4在地面真相基线与主观评分之间,一致性或不一致性方面有什么关系?

主要发现

  • 人类注意力基线与基于分割的地面真相相关,但在 FN 错误处理上存在差异,指示更高的粒度和潜在的假阴性。
  • 主观人类评分与两种地面真相基线均不同,显示在解释和评估中存在可衡量的偏见。
  • 具有人工注意力掩码的地面真相实现了阈值不可知的 MAE 评估,不需要二元掩码生成,提供比单层掩码更细粒度的优点。
  • LIME 解释引发的用户反应与 Grad-CAM 解释不同,揭示视觉外观对判断的影响。
  • 用户对 FP 错误的敏感性较低,对 FN 错误的敏感性较高,暗示前景覆盖不全影响感知的解释质量。
  • 研究表明客观地面真相基线与主观判断可能存在分歧,强调需要互补的评估方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。