Skip to main content
QUICK REVIEW

[论文解读] Explaining Deep Neural Networks using Unsupervised Clustering

Yu-han Liu, Sercan Ö. Arık|arXiv (Cornell University)|Jul 15, 2020
Explainable Artificial Intelligence (XAI)参考文献 25被引用 10
一句话总结

本文提出了一种用于深度神经网络(DNNs)的后训练可解释性方法,通过无监督聚类中间层激活来构建代理模型。通过在多层中聚类表征,该方法识别出相似的训练样本和学习到的概念,从而在保持与原始DNN高保真度的同时,通过用户研究提升了模型的可信度。

ABSTRACT

We propose a novel method to explain trained deep neural networks (DNNs), by distilling them into surrogate models using unsupervised clustering. Our method can be applied flexibly to any subset of layers of a DNN architecture and can incorporate low-level and high-level information. On image datasets given pre-trained DNNs, we demonstrate the strength of our method in finding similar training samples, and shedding light on the concepts the DNNs base their decisions on. Via user studies, we show that our model can improve the user trust in model's prediction.

研究动机与目标

  • 为解决通过系统分析各层中的低级与高级表征来解释黑箱DNN的挑战。
  • 开发一种无需架构修改或标注概念的后训练解释框架。
  • 通过提供直观的、相似的训练样本作为支持证据,提升人类对DNN预测结果的信任。
  • 在不依赖人工提供概念或启发式相似性度量的情况下,实现基于概念和基于样本的可解释性。

提出的方法

  • 该方法从预训练DNN的多个层中提取中间激活,并应用无监督聚类来在无标签的情况下对相似表征进行分组。
  • 通过从聚类后的表征中学习,训练一个代理模型以模仿原始DNN的输出,从而在保持保真度的同时提升可解释性。
  • 聚类过程捕捉了各层中的低级(如颜色、纹理)和高级(如物体构成、语义内容)模式。
  • 通过聚类中心嵌入空间中的接近程度来确定测试样本与训练样本之间的相似性,从而实现基于样本的解释。
  • 该方法采用编码器-解码器架构,从激活中重建并优化聚类分配,从而提升聚类质量。
  • 该方法在训练后应用,因此具有高度灵活性,可兼容任意DNN架构及任意层的子集。

实验结果

研究问题

  • RQ1无监督聚类中间DNN激活是否能有效识别语义和视觉上相似的训练样本?
  • RQ2基于聚类的代理模型在多大程度上能捕捉DNN所学习到的低级与高级概念?
  • RQ3与基线解释方法相比,提供基于聚类的相似示例是否能提升人类对DNN预测结果的信任?
  • RQ4即使DNN的准确率不完美,该方法在用户感知的相似性与信任度方面是否仍优于基于标签的过滤方法(如相同粗粒度或细粒度标签)?
  • RQ5在使用基于聚类的蒸馏方法时,代理模型的保真度与原始DNN相比如何?

主要发现

  • 在CIFAR-100数据集上,该方法实现了0.51的代理模型准确率和0.61的保真度,表明其与原始DNN具有高度一致性。
  • 在18名参与者的用户研究中,该方法在316次试验中的130次选择了最相似的训练图像,优于最近邻方法和基于标签的过滤方法。
  • 在磁性瓷砖缺陷数据集上,当使用相同预测粗粒度标签下的相似示例时,该方法显著提升了用户对模型预测的信任度(平均得分3.91 ± 0.24),优于基线方法。
  • 即使在无法获取测试图像的细粒度标签(该标签未用于训练)的情况下,该方法在信任度得分上仍优于基于标签的过滤方法,表明其具备鲁棒性与泛化能力。
  • 聚类识别出的概念揭示了低级特征(如颜色调色板)和高级语义模式(如细粒度于粗粒度标签的缺陷类型),展示了多层次的可解释性。
  • 即使原始DNN对测试图像分类错误,该方法仍能成功识别出相关训练样本,证实了其在真实场景中的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。