Skip to main content
QUICK REVIEW

[论文解读] Minimalistic Explanations: Capturing the Essence of Decisions

Martin Schuessler, Philipp Weiß|arXiv (Cornell University)|May 8, 2019
Explainable Artificial Intelligence (XAI)参考文献 11被引用 5
一句话总结

本文研究了使用 LIME 和人工生成的锚点对图像分类进行最小化后处理解释的效果,发现此类解释显著提升了用户识别被解释对象的准确率(75.64% vs. 18.52%),且人工生成的解释比算法生成的解释更受信任(高 79%)。研究结果表明,最小化解释能够捕捉决策的核心,但在传达图像区域之间上下文关系方面存在局限。

ABSTRACT

The use of complex machine learning models can make systems opaque to users. Machine learning research proposes the use of post-hoc explanations. However, it is unclear if they give users insights into otherwise uninterpretable models. One minimalistic way of explaining image classifications by a deep neural network is to show only the areas that were decisive for the assignment of a label. In a pilot study, 20 participants looked at 14 of such explanations generated either by a human or the LIME algorithm. For explanations of correct decisions, they identified the explained object with significantly higher accuracy (75.64% vs. 18.52%). We argue that this shows that explanations can be very minimalistic while retaining the essence of a decision, but the decision-making contexts that can be conveyed in this manner is limited. Finally, we found that explanations are unique to the explainer and human-generated explanations were assigned 79% higher trust ratings. As a starting point for further studies, this work shares our first insights into quality criteria of post-hoc explanations.

研究动机与目标

  • 评估最小化后处理解释是否能有效传达图像分类决策的本质。
  • 比较人工生成与算法生成(LIME)解释在用户准确率与信任度方面的差异。
  • 探究解释的独特性及其与人类直觉的一致性在用户理解中的作用。
  • 基于人类感知与认知过程,识别后处理解释的质量标准。
  • 探索当前解释方法在捕捉关系性或上下文性决策因素方面的局限性。

提出的方法

  • 参与者被展示 14 张图像解释——分别为人工生成的锚点或 LIME 生成的锚点——对象为数字手表和开瓶器。
  • 人工锚点由参与者标记其认为对分类具有决定性作用的区域(例如“钟表”或“钥匙”),而 LIME 则基于特征重要性计算显著性图。
  • 锚点被打印、剪裁并打磨,以统一视觉呈现并减少感知噪声。
  • 参与者完成识别任务,仅根据解释判断被标记的对象。
  • 信任度通过 5 点李克特量表测量,分数越高表示对解释的信心越强。
  • 试点研究采用便利抽样,共 20 名参与者,重点评估解释有效性的定性与定量指标。

实验结果

研究问题

  • RQ1最小化后处理解释是否能显著提升用户识别被分类对象的准确率?
  • RQ2人工生成解释的信任度与算法生成解释相比如何?
  • RQ3解释在多大程度上与人类直觉和认知预期保持一致?
  • RQ4解释是否具有来源特异性(人工 vs. 算法),这种特性如何影响用户感知?
  • RQ5解释是否不仅能传达为何分配某一标签,还能说明为何未选择其他标签?

主要发现

  • 当展示人工生成的解释时,参与者在 75.64% 的情况下正确识别了目标对象,而使用 LIME 生成的解释时仅正确识别了 18.52%。
  • 人工生成的解释信任度评分高出 79%(5 分制下分别为 3.89 和 2.17),表明其被感知为更可靠。
  • 参与者认为解释具有来源特异性,能够轻松区分人工与算法生成的锚点。
  • 参与者表示,人工解释聚焦于整体形状与区域的空间共现关系,而 LIME 更强调子区域的模式。
  • 研究发现,锚点仅能传达决策的少数几个原因,限制了其表达图像区域之间复杂关系的能力。
  • 参与者期望解释与直觉一致,当解释出现重叠或相似时感到意外,表明用户对独特、富含上下文的解释存在认知期待。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。