Skip to main content
QUICK REVIEW

[论文解读] Play MNIST For Me! User Studies on the Effects of Post-Hoc, Example-Based Explanations & Error Rates on Debugging a Deep Learning, Black-Box Classifier.

Courtney Ford, Eoin M. Kenny|arXiv (Cornell University)|Sep 10, 2020
Explainable Artificial Intelligence (XAI)参考文献 29被引用 5
一句话总结

本研究探讨了事后、基于实例的解释与错误率如何影响人类对黑箱深度学习分类器在MNIST数字上的感知。通过使用一种ANN-CBR双系统来检索相似的训练案例以解释预测结果,研究发现此类解释会增加对误分类的正确性感知,而当错误率超过约4%时,用户的信任度、合理性判断和感知正确性显著下降。

ABSTRACT

The IJCAI-20 Workshop on Explainable AI (XAI), Online Conference, 8 January 2021

研究动机与目标

  • 评估事后、基于实例的解释对人类感知黑箱深度学习分类器的心理影响。
  • 考察不同错误率如何影响用户对分类器的信任度、正确性判断及合理性感知。
  • 评估ANN-CBR双系统在生成直观、基于案例的深度神经网络预测解释方面的有效性。
  • 通过在真实调试情境中测试人类对解释的反应,为XAI提供实证验证。

提出的方法

  • 实现了ANN-CBR双系统,用于解释在MNIST数据集上训练的卷积神经网络(CNN)的预测结果。
  • 采用特征加权技术从CNN中提取显著特征,并将其映射到MNIST数据集上的k-NN搜索,以检索相关且相似的训练样本。
  • 参与者被展示单个MNIST图像的分类结果——包括正确与错误分类——并附带或不附带基于案例的解释。
  • 参与者使用标准化问卷对每项预测的正确性、合理性、信任度和满意度进行评分。
  • 进行了两次用户实验(N=349),分别改变解释的存在与否以及分类器的错误率(从约1%到约10%)。
  • 本研究采用混合方法,结合定量评分与定性洞察,遵循局部-全局评估框架。

实验结果

研究问题

  • RQ1事后、基于实例的解释如何影响用户对误分类MNIST数字正确性的感知?
  • RQ2错误率上升如何影响用户对黑箱分类器的信任度、合理性及感知正确性?
  • RQ3基于案例的解释在多大程度上缓解了用户对模型错误的负面感知?
  • RQ4当错误率较低与较高时,用户是否认为解释更具可信度?

主要发现

  • 事后、基于实例的解释使参与者对误分类的正确性评分高于其实际正确性,表明存在对解释错误的感知偏差。
  • 当错误率超过约4%时,参与者对分类器的信任度显著下降,认为其正确性更低、合理性更差、可信度更低。
  • 基于案例的解释增加了对正确与错误预测的感知正确性,表明解释可能制造出一种虚假的可靠性错觉。
  • 当错误率超过约4%时,参与者的信任度与满意度出现急剧下降,表明用户接受度存在阈值效应。
  • 本研究证实,仅靠解释无法弥补高错误率的影响,错误率是用户信任度与系统感知的关键因素。
  • 研究结果强调了在实际部署中,必须将解释质量与模型可靠性相结合,才能实现有效的XAI。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。