Skip to main content
QUICK REVIEW

[论文解读] Deep Learning Reproducibility and Explainable AI (XAI)

Anastasia Leventi-Peetz, T. Östreich|arXiv (Cornell University)|Feb 23, 2022
Explainable Artificial Intelligence (XAI)被引用 7
一句话总结

本文研究了深度学习(DL)训练中的非确定性对模型可解释性的影响,并提出了一种实现确定性、可复现深度学习模型的框架。通过固定随机种子并消除硬件相关的方差,作者在两种CNN架构上展示了可复现的推理和可解释人工智能(XAI),使用Grad-CAM实现跨不同硬件平台的一致模型预测和解释。

ABSTRACT

The nondeterminism of Deep Learning (DL) training algorithms and its influence on the explainability of neural network (NN) models are investigated in this work with the help of image classification examples. To discuss the issue, two convolutional neural networks (CNN) have been trained and their results compared. The comparison serves the exploration of the feasibility of creating deterministic, robust DL models and deterministic explainable artificial intelligence (XAI) in practice. Successes and limitation of all here carried out efforts are described in detail. The source code of the attained deterministic models has been listed in this work. Reproducibility is indexed as a development-phase-component of the Model Governance Framework, proposed by the EU within their excellence in AI approach. Furthermore, reproducibility is a requirement for establishing causality for the interpretation of model results and building of trust towards the overwhelming expansion of AI systems applications. Problems that have to be solved on the way to reproducibility and ways to deal with some of them, are examined in this work.

研究动机与目标

  • 研究深度学习训练中的非确定性如何影响神经网络模型的可解释性和可复现性。
  • 通过在算法和硬件层面存在差异的情况下实现确定性训练结果,解决机器学习中的可复现性危机。
  • 证明通过受控训练配置,确定性模型推理和可解释人工智能(XAI)在实践中是可行的。
  • 提供开源代码和技术指南,实现与硬件无关、可复现的深度学习模型,并确保解释一致。
  • 探索将模型属性如实现不变性和完备性整合到训练流水线中的可行性,以支持可信人工智能。

提出的方法

  • 在所有随机组件(如权重初始化、数据打乱、Dropout)中固定随机种子,以消除算法随机性。
  • 在相同软件和硬件条件下,对两种不同的CNN架构(ConvNet和第二个原型)进行训练,以确保可复现性。
  • 在仅使用CPU的环境中执行训练和推理(AMD Zen架构),以隔离硬件相关的方差。
  • 通过使用相同代码、数据和超参数,在多次运行中验证了确定性行为。
  • 应用Grad-CAM对预测结果进行可视化解释,确保解释在多次运行中可复现。
  • 研究了GPU使用对可复现性的影响,并证明即使使用GPU加速,也能实现确定性推理(针对其中一个模型)。

实验结果

研究问题

  • RQ1在存在固有的算法和硬件层面差异的情况下,深度学习训练能在多大程度上实现确定性?
  • RQ2当使用不同硬件平台(包括GPU)时,能否实现并维持可复现的模型预测?
  • RQ3训练非确定性在多大程度上影响可解释人工智能(XAI)方法(如Grad-CAM)的一致性和可靠性?
  • RQ4需要采取哪些技术措施,才能在不同硬件和软件环境中实现深度学习模型的实现不变性?
  • RQ5可复现训练能否作为在安全关键领域中构建因果可解释、可信人工智能系统的基础?

主要发现

  • 通过固定随机种子并使用一致的硬件(仅CPU的AMD Zen),成功实现了两种CNN架构的确定性训练,使得多次运行中模型参数和预测完全相同。
  • 首个模型(确定性ConvNet)不仅在CPU上实现了可复现推理,即使在使用GPU支持的情况下也保持了可复现性,证明GPU加速并不必然破坏确定性。
  • 对两个模型均通过视觉验证了可复现的Grad-CAM解释,显示在重复推理中注意力图保持一致。
  • 尽管代码和数据完全相同,深度学习框架(如TensorFlow、cuDNN)和硬件平台(如不同CPU/GPU)之间的实现层面差异仍可能引入非确定性行为。
  • 研究证实,即使功能等价的模型在不同硬件平台上也可能产生不同的归因结果,违反了实现不变性。
  • 作者证明,可复现性对于信任、容错能力以及客观评估模型鲁棒性和可解释性等属性在安全关键应用中至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。