[论文解读] Sparse Interaction Additive Networks via Feature Interaction Detection and Sparse Selection
本文提出稀疏交互加法网络(SIAN),一种通过交互检测与稀疏性约束,高效选择表格数据中高阶特征交互的算法。通过利用继承性原则与基于SHAP的交互检测,SIAN实现了可解释的深度学习模型,在保持模型可解释性与训练效率的同时,通过分块稀疏架构设计,在大规模表格数据集上实现了最先进性能。
There is currently a large gap in performance between the statistically rigorous methods like linear regression or additive splines and the powerful deep methods using neural networks. Previous works attempting to close this gap have failed to fully investigate the exponentially growing number of feature combinations which deep networks consider automatically during training. In this work, we develop a tractable selection algorithm to efficiently identify the necessary feature combinations by leveraging techniques in feature interaction detection. Our proposed Sparse Interaction Additive Networks (SIAN) construct a bridge from these simple and interpretable models to fully connected neural networks. SIAN achieves competitive performance against state-of-the-art methods across multiple large-scale tabular datasets and consistently finds an optimal tradeoff between the modeling capacity of neural networks and the generalizability of simpler methods.
研究动机与目标
- 解决可解释加法模型与强大深度神经网络在建模复杂高阶特征交互方面的差距。
- 开发一种高效且可计算的筛选算法,从可能组合的指数级空间中识别出显著的高阶特征交互。
- 通过稀疏可微分架构,弥合广义加法模型的可解释性与深度神经网络的功能表达能力之间的鸿沟。
- 通过分块稀疏实现改进神经加法模型的训练效率与内存使用,实现中等规模数据集的可扩展训练。
- 证明通过超参数调节模型容量,可在简单加法模型与完整神经网络之间实现平滑插值,揭示泛化性与表达能力之间的权衡。
提出的方法
- 该方法使用基于SHAP的交互检测来估计特征交互的重要性,重点关注高阶(阶数≥3)交互。
- 应用继承性原则剪枝非显著交互,将搜索空间从指数级规模压缩至可计算规模。
- 采用稀疏筛选算法仅选择最具影响力的特征交互项,确保模型可解释性并减少过拟合。
- 模型采用分块稀疏神经网络架构,支持形状函数的并行计算,显著提升训练速度与内存效率。
- 该框架支持渐进式容量扩展:从单变量加法模型到完整神经网络,实现对偏差-方差权衡的可控研究。
- 该方法兼容任意黑箱模型,本文通过将其应用于NODE-GAM以实现特征三元组筛选,验证了其有效性。
实验结果
研究问题
- RQ1能否使用可解释方法在表格数据中高效且准确地检测高阶特征交互(阶数≥3)?
- RQ2如何设计一种稀疏筛选机制,在无需穷举搜索的前提下识别最具信息量的特征交互?
- RQ3稀疏可解释模型在表格数据集上能否实现与最先进深度学习模型相当的性能?
- RQ4通过高阶交互提升模型容量,对神经加法模型中的泛化差距有何影响?
- RQ5分块稀疏架构设计能否显著提升神经加法模型的训练效率与内存使用?
主要发现
- SIAN在多个大规模表格数据集上实现了最先进性能,其准确率与泛化能力优于传统加法模型与深度神经网络。
- 该模型始终能在建模能力与泛化能力之间找到最优平衡,随着高阶交互的引入,性能持续提升。
- 分块稀疏实现显著降低了训练时间与内存使用,使更大规模模型的可扩展训练成为可能。
- 基于SHAP的交互检测可可靠识别高维特征空间中的有意义高阶交互。
- 该方法表明,通过超参数调优实现的渐进容量扩展,可揭示深度学习模型中偏差-方差权衡的细粒度洞察。
- 在训练后的NODE-GAM模型上,使用Archipelago管道进行特征三元组筛选,显著提升了加州住房数据集的性能,验证了该方法的通用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。