Skip to main content
QUICK REVIEW

[论文解读] Thermodynamics-inspired Explanations of Artificial Intelligence

Mehdi Shams, Pratyush Tiwary|arXiv (Cornell University)|Jun 27, 2022
Machine Learning in Materials Science被引用 8
一句话总结

本文提出TERP,一种受热力学启发的后训练可解释性框架,用于解释黑箱AI模型。通过将可解释性建模为模型简洁性与不忠实性之间的权衡,并引入类似热力学自由能的‘解释自由能’ζ,TERP利用前向特征选择法选择最优的局部代理模型,在分子、图像和文本等不同领域的CNN、RNN和自编码器等复杂AI模型中均展现出稳健的可解释性。

ABSTRACT

In recent years, predictive machine learning methods have gained prominence in various scientific domains. However, due to their black-box nature, it is essential to establish trust in these models before accepting them as accurate. One promising strategy for assigning trust involves employing explanation techniques that elucidate the rationale behind a black-box model's predictions in a manner that humans can understand. However, assessing the degree of human interpretability of the rationale generated by such methods is a nontrivial challenge. In this work, we introduce interpretation entropy as a universal solution for assessing the degree of human interpretability associated with any linear model. Using this concept and drawing inspiration from classical thermodynamics, we present Thermodynamics-inspired Explainable Representations of AI and other black-box Paradigms (TERP), a method for generating accurate, and human-interpretable explanations for black-box predictions in a model-agnostic manner. To demonstrate the wide-ranging applicability of TERP, we successfully employ it to explain various black-box model architectures, including deep learning Autoencoders, Recurrent Neural Networks, and Convolutional Neural Networks, across diverse domains such as molecular simulations, text, and image classification.

研究动机与目标

  • 为解决黑箱AI模型的信任缺失问题,开发一种严格、可解释的后训练解释框架。
  • 将模型可解释性形式化为热力学自由能最小化的物理类比。
  • 实现对复杂AI模型(如深度神经网络和自编码器)的模型无关、局部有效的解释。
  • 提供一种稳定且数学基础坚实的代理模型选择方法,以平衡简洁性与预测忠实性。
  • 在分子模拟、图像分类和文本处理等多样化领域中验证该框架。

提出的方法

  • 将可解释性形式化为最小化‘解释自由能’ζ = U − θS,其中U表示不忠实性,S表示简洁性,θ为可调的类似温度的参数。
  • 对简洁性S采用对数定义,以平衡不忠实性的降低,确保模型选择过程中的稳定权衡。
  • 采用前向特征选择算法,迭代构建围绕单个预测的局部线性代理模型。
  • 通过最小化ζ选择最优代理模型,由于凸性与单调性特性,可保证唯一全局最小值。
  • 利用最终代理模型中的非零权重进行特征重要性归因,提供局部、实例特定的解释。
  • 调节θ以探索一系列稳定的解释,类比于热力学相变,识别出一组合理的解释集合。

实验结果

研究问题

  • RQ1热力学类比能否有效形式化可解释性中简洁性与对黑箱模型忠实性之间的权衡?
  • RQ2在此热力学框架下,如何选择全局最优的局部代理模型,以同时保证忠实性与简洁性?
  • RQ3该框架是否可普遍适用于CNN、RNN和自编码器等多样化的黑箱模型架构?
  • RQ4该方法是否能在图像、文本和表格数据等多种数据模态中产生稳定可靠的特征归因?
  • RQ5该框架是否能检测并解释AI预测中的正确推理过程,即使在模型复杂或对某些输入失效时亦可?

主要发现

  • TERP通过最小化解释自由能ζ,为每个预测成功识别出唯一的最优代理模型,确保了数学上的稳健性。
  • 在θ = 20时,TERP识别出16个对新闻标题‘AI预测蛋白质结构’最具影响力的特征,其中‘Science’的归因权重最高。
  • 该方法证实AttBLSTM模型的正确预测是基于语义相关的关键词,而非偶然特征,从而增强了模型可信度。
  • TERP在多种模型类型中均展现出可靠的可解释性,包括用于图像分类的CNN、用于文本的RNN以及用于分子模拟的自编码器。
  • 该框架揭示了模型的成功源于多个关键词的集体影响,而非依赖于孤立的术语。
  • 在黑箱模型失效的情况下,TERP仍能提供有意义的解释,揭示模型推理中的缺陷,支持诊断分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。