[论文解读] GAM(e) changer or not? An evaluation of interpretable machine learning models based on additive model constraints
本文基于广义可加模型(GAMs)评估了五种内在可解释的机器学习模型,并将其与十二个数据集上的六种传统机器学习模型进行比较。研究发现,基于GAM的模型在保持优异预测性能的同时,通过形状函数提供了更优的可解释性,但其计算成本较高,且由于基于相关性的学习方式,因果解释能力仍有限。
The number of information systems (IS) studies dealing with explainable artificial intelligence (XAI) is currently exploding as the field demands more transparency about the internal decision logic of machine learning (ML) models. However, most techniques subsumed under XAI provide post-hoc-analytical explanations, which have to be considered with caution as they only use approximations of the underlying ML model. Therefore, our paper investigates a series of intrinsically interpretable ML models and discusses their suitability for the IS community. More specifically, our focus is on advanced extensions of generalized additive models (GAM) in which predictors are modeled independently in a non-linear way to generate shape functions that can capture arbitrary patterns but remain fully interpretable. In our study, we evaluate the prediction qualities of five GAMs as compared to six traditional ML models and assess their visual outputs for model interpretability. On this basis, we investigate their merits and limitations and derive design implications for further improvements.
研究动机与目标
- 评估基于加法约束的内在可解释模型是否能与传统白盒和黑盒机器学习模型在预测性能上达到相当水平。
- 客观比较不同基于GAM的模型在可解释性和模型行为方面的可视化与结构化输出差异。
- 基于实证评估与观察到的局限性,推导未来可解释机器学习模型开发的设计原则。
- 解决在信息系统研究背景下,先进GAM扩展模型之间缺乏中立、全面的跨模型比较的问题。
- 为实际信息系统应用中既强调准确性又强调可解释性的模型选择提供实用指导。
提出的方法
- 本研究评估了五种基于GAM/GAIM的模型:样条(pyGAM)、可解释提升机(EBM)、神经加法模型(NAM)、GAMI-Net和ExNN,所有模型均使用默认超参数。
- 为对比,纳入六种传统机器学习模型:逻辑回归、决策树、随机森林、梯度提升机(GBM)、XGBoost和多层感知机(MLP),所有模型均配置为默认或标准设置。
- 评估在十二个表格型数据集上进行,聚焦于使用AUC、准确率和均方误差等标准指标的预测性能。
- 通过分析形状函数——输入特征与预测之间的单变量非线性映射——定性评估模型可解释性,突出其平滑性、灵活性和稳定性差异。
- 通过训练时间衡量计算效率,通过超参数设置和数据规模的敏感性评估模型鲁棒性。
- 本研究采用系统化、公平的比较框架,避免对超参数进行大规模调优,以确保不同模型类型之间的可比性。
实验结果
研究问题
- RQ1RQ1:基于加法模型约束的可解释模型是否能与传统白盒和黑盒机器学习模型在预测结果上达到相当水平?
- RQ2RQ2:基于加法模型约束的可解释机器学习模型在形状函数行为和可解释性方面,其输出客观上如何相互区别?
- RQ3RQ3:在预测准确性、计算成本和可解释性方面,不同GAM基础模型的关键优势与局限性是什么?
- RQ4RQ4:可否推导出指导未来信息系统应用中内在可解释机器学习模型开发的设计原则?
主要发现
- 基于GAM的模型,特别是EBM和NAM,在大多数数据集上实现了与XGBoost和GBM等传统模型相当或更优的预测性能,尤其在AUC和准确率方面表现突出。
- EBM和NAM的形状函数表现出高度的灵活性与平滑性,能够清晰可视化非线性特征效应,而样条模型在小样本数据集中对噪声和过拟合更敏感。
- GAMI-Net和ExNN在捕捉复杂非线性模式方面表现强劲,但训练时间显著更长,使其在大规模数据集上可扩展性较差。
- 尽管预测性能出色,所有基于GAM的模型仍受限于基于相关性的学习方式,无法建立因果关系,即使形状函数看似具有意义。
- 基于GAM的模型计算成本显著更高,尤其是GAMI-Net和ExNN,若无优化,不适合实时或大规模应用。
- 本研究识别出未来可解释模型的四项设计原则:(1)在模型灵活性与计算效率之间取得平衡,(2)确保形状函数稳定且平滑,(3)在不牺牲准确率的前提下支持特征层面的可解释性,(4)在真实决策场景中支持以用户为中心的评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。