Skip to main content
QUICK REVIEW

[论文解读] Neural Basis Models for Interpretability

Filip Radenović, Abhimanyu Dubey|arXiv (Cornell University)|May 27, 2022
Explainable Artificial Intelligence (XAI)被引用 13
一句话总结

该论文提出了神经基函数模型(NBM),这是一种新型广义可加模型(GAMs)家族,利用共享的、通过深度神经网络学习的基函数来表示特征形状函数。通过将每个特征的贡献分解为一组少量共享基函数的线性组合,NBM在保持高准确率的同时,显著提升了模型效率与吞吐量——相比先前的GAM模型(如NAMs),参数量减少了5倍至50倍,吞吐量提升了4倍至7倍,尤其在高维和稀疏数据集上表现突出。

ABSTRACT

Due to the widespread use of complex machine learning models in real-world applications, it is becoming critical to explain model predictions. However, these models are typically black-box deep neural networks, explained post-hoc via methods with known faithfulness limitations. Generalized Additive Models (GAMs) are an inherently interpretable class of models that address this limitation by learning a non-linear shape function for each feature separately, followed by a linear model on top. However, these models are typically difficult to train, require numerous parameters, and are difficult to scale. We propose an entirely new subfamily of GAMs that utilizes basis decomposition of shape functions. A small number of basis functions are shared among all features, and are learned jointly for a given task, thus making our model scale much better to large-scale data with high-dimensional features, especially when features are sparse. We propose an architecture denoted as the Neural Basis Model (NBM) which uses a single neural network to learn these bases. On a variety of tabular and image datasets, we demonstrate that for interpretable machine learning, NBMs are the state-of-the-art in accuracy, model size, and, throughput and can easily model all higher-order feature interactions. Source code is available at https://github.com/facebookresearch/nbm-spam.

研究动机与目标

  • 为解决现有内在可解释模型(如NAMs和EBMs)在可扩展性和参数效率方面的局限性,这些模型需要为每个特征单独建模,导致参数量过高。
  • 通过在特征间共享基函数,实现对复杂高维数据(尤其是稀疏特征)的忠实且可解释的建模。
  • 在保持GAMs可解释性的同时,通过基函数分解与深度学习技术,显著减少模型大小与推理时间。
  • 通过高效支持高阶特征交互,避免GA2Ms和NA2Ms等模型中出现的参数量二次增长问题。
  • 提供一种可扩展、可微分且支持GPU的架构,可无缝集成至深度学习流水线中。

提出的方法

  • 提出GAMs的一个新子类,其中每个特征的形状函数表示为一组少量共享基函数的线性组合,这些基函数由单一深度神经网络联合学习。
  • 使用单一神经网络学习基函数,支持在GPU上通过小批量随机梯度下降进行端到端训练。
  • 借鉴信号处理中的基函数思想(如傅里叶、勒让德多项式),但学习的是任务特定的基函数,而非固定函数。
  • 将框架扩展至通过额外一组共享基函数建模成对交互,实现高阶交互,且参数量仅线性增长。
  • 利用Rademacher复杂度推导泛化界,证明模型在基函数数量相对于输入维度呈对数增长时仍能良好泛化。
  • 采用结合经验风险与正则化的损失函数,确保模型拟合与泛化能力,并提供近似误差的理论保证。

实验结果

研究问题

  • RQ1在不牺牲准确率的前提下,跨特征共享基函数是否能有效降低可解释模型的参数量并提升可扩展性?
  • RQ2单一深度神经网络能否有效学习出在多样化特征与任务中具有良好泛化能力的基函数?
  • RQ3在高维和稀疏数据集上,NBM架构在准确率、模型大小与吞吐量方面与SOTA GAM模型(如NAMs和EBMs)相比表现如何?
  • RQ4该模型是否能避免GA2Ms和NA2Ms中出现的参数量二次增长问题,高效捕捉高阶特征交互?
  • RQ5与固定基函数或独立的每特征模型相比,使用任务特定学习的基函数是否能带来更好的泛化能力与模型忠实度?

主要发现

  • 在表格数据与图像数据集上,NBM在准确率、模型大小与推理吞吐量方面均达到SOTA水平,优于NAMs与EBMs。
  • 对于特征数超过十个的数据集,NBM相比NAMs将参数量减少了5倍至50倍,显著提升了可扩展性。
  • NBM相比NAMs将吞吐量提升了4倍至7倍,适用于实时与大规模部署场景。
  • 通过扩展至成对基函数,模型能有效捕捉高阶特征交互,且仅导致线性参数增长,而GA2Ms与NA2Ms则呈现二次增长。
  • 理论分析表明,近似误差随基函数数量呈指数衰减,意味着仅需相对于输入维度的对数级基函数数量即可实现良好性能。
  • 在具有超过10万个特征的稀疏数据集上,NBM能有效扩展,而其他GAM模型则失效,展现出在工业级应用中的实际价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。