Skip to main content
QUICK REVIEW

[论文解读] NODE-GAM: Neural Generalized Additive Model for Interpretable Deep Learning

Chun‐Hao Chang, Rich Caruana|arXiv (Cornell University)|Jun 3, 2021
Explainable Artificial Intelligence (XAI)参考文献 27被引用 14
一句话总结

本文提出 NODE-GAM 和 NODE-GAM2,一种可微分的神经广义加法模型,结合了 GAM 的可解释性与深度学习的可扩展性和性能。通过将 NODE 架构与新型门控机制相结合,该模型实现了端到端训练、自动特征选择以及自监督预训练——在保持可解释性的同时,实现了大规模表格数据上的最先进准确率。

ABSTRACT

Deployment of machine learning models in real high-risk settings (e.g. healthcare) often depends not only on the model's accuracy but also on its fairness, robustness, and interpretability. Generalized Additive Models (GAMs) are a class of interpretable models with a long history of use in these high-risk domains, but they lack desirable features of deep learning such as differentiability and scalability. In this work, we propose a neural GAM (NODE-GAM) and neural GA$^2$M (NODE-GA$^2$M) that scale well and perform better than other GAMs on large datasets, while remaining interpretable compared to other ensemble and deep learning models. We demonstrate that our models find interesting patterns in the data. Lastly, we show that we improve model accuracy via self-supervised pre-training, an improvement that is not possible for non-differentiable GAMs.

研究动机与目标

  • 开发一种可微分、可扩展的广义加法模型(GAM)深度学习变体,保留可解释性的同时提升在大规模表格数据集上的性能。
  • 通过将 GAM 集成到深度学习框架中,解决非可微 GAM 模型的局限性,如缺乏 GPU 优化能力以及无法利用自监督预训练。
  • 通过反向传播实现自动特征与成对交互选择,消除以往方法中所需的两阶段训练或模型集成。
  • 证明所提出的模型能够发现有意义的数据模式,并在低标签数据设置下,优于现有 GAM 模型与深度学习模型,尤其在准确率方面表现更优。

提出的方法

  • 将 NODE(Popov 等,2019)的可微分树基架构适配为神经 GAM(NODE-GAM)与神经 GA2M(NODE-GAM2),通过加法结构保持可解释性。
  • 引入新型门控机制,逐步抑制高阶特征交互,实现在端到端训练过程中自动的边际与成对特征选择。
  • 通过在标注数据微调前,先在掩码特征预测任务上训练模型,实现自监督预训练,从而在标签数据有限时提升性能。
  • 采用单阶段训练流程,共享嵌入层并使用最终的线性头,避免以往方法(如 NIT 或 NAM)所需的迭代训练或模型集成。
  • 采用基于梯度的优化方法,在 GPU 上进行批量训练,实现对大规模数据集的可扩展性,并相比非可微 GAM 模型实现更快收敛。
  • 在预训练中使用基于注意力的掩码与重建目标,以在微调到下游任务前学习鲁棒表征。

实验结果

研究问题

  • RQ1能否设计一种可微分的深度学习架构,在保持 GAM 可解释性的同时,实现在大规模表格数据集上的最先进性能?
  • RQ2在标签数据稀缺时,自监督预训练是否能提升可解释模型的性能?该目标能否在可微分 GAM 框架中实现?
  • RQ3所提出的模型能否通过反向传播自动选择相关的主要与成对特征交互,从而消除对外部选择算法或集成方法的依赖?
  • RQ4在高风险领域(如医疗保健)中,NODE-GAM 与 NODE-GAM2 的形状函数与传统 GAM 的形状函数相比,能否更清晰地揭示有意义的数据模式?

主要发现

  • 采用自监督预训练的 NODE-GAM 在 7 个数据集中的 6 个上优于未预训练版本,其中在 MIMIC2 上实现 6% 的相对性能提升,在 Churn 数据集上最高达 10% 的提升。
  • 在 6 个数据集中的 3 个(Churn、MIMIC2、Credit)上,自监督 NODE-GAM 的性能优于 EBM,证明了在低数据量场景下预训练的优势。
  • 在更大规模数据集上,NODE-GAM 与 NODE-GAM2 均优于其他 GAM 模型,显示出相比样条基与树基 GAM 模型更强的可扩展性与更高准确率。
  • 通过形状函数,模型能发现可解释且有意义的数据模式,该结论已通过先前研究中的临床与领域特定分析得到验证。
  • 所提出的架构通过基于梯度的剪枝实现自动特征选择,消除了树基 GAM 模型中常用的后处理选择算法。
  • 该方法在性能上与深度神经网络相当,同时通过加法结构与加法-交互结构保持了完全的可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。