[论文解读] Shap-Select: Lightweight Feature Selection Using SHAP Values and Regression
该论文提出 shap-select,一种轻量级、可解释的特征选择框架,通过在验证集上使用 SHAP 值和统计显著性检验,结合线性或逻辑回归指导特征选择。该方法以极低的计算成本实现了最先进性能,在信用卡欺诈数据集上仅选择 6 个特征,同时保持了高准确率(0.9996)和 F1 分数(0.8701),在效率和有效性方面均优于 Boruta、RFE、HISEL 和基线 SHAP 方法。
Feature selection is an essential process in machine learning, especially when dealing with high-dimensional datasets. It helps reduce the complexity of machine learning models, improve performance, mitigate overfitting, and decrease computation time. This paper presents a novel feature selection framework, shap-select. The framework conducts a linear or logistic regression of the target on the Shapley values of the features, on the validation set, and uses the signs and significance levels of the regression coefficients to implement an efficient heuristic for feature selection in tabular regression and classification tasks. We evaluate shap-select on the Kaggle credit card fraud dataset, demonstrating its effectiveness compared to established methods such as Recursive Feature Elimination (RFE), HISEL (a mutual information-based feature selection method), Boruta and a simpler Shapley value-based method. Our findings show that shap-select combines interpretability, computational efficiency, and performance, offering a robust solution for feature selection.
研究动机与目标
- 为解决机器学习中高维数据的挑战,其中无关或冗余特征会降低模型性能并增加过拟合风险。
- 开发一种计算高效且可解释的特征选择方法,在保持预测性能的同时降低模型复杂度。
- 将 SHAP 值与统计显著性检验相结合,构建一个稳健的、基于启发式的特征选择框架。
- 在真实世界的表格数据集上评估该方法,特别是在金融和医疗保健领域,其中可解释性和效率至关重要。
- 提供一个开源工具,使从业者能够轻松地将该方法集成到生产机器学习流水线中。
提出的方法
- 该框架使用训练好的模型在验证集上计算所有特征的 SHAP 值。
- 对每个特征的 SHAP 值与目标变量进行线性或逻辑回归。
- 根据回归系数的符号和统计显著性(p 值)选择特征。
- 在单次遍历中迭代移除回归系数不显著(p > 0.05)的特征。
- 该方法避免在不同特征子集上重新训练基础模型,从而确保计算效率。
- 通过置信度阈值(默认为 5%)控制特征选择,同时通过敏感性分析验证其鲁棒性。
实验结果
研究问题
- RQ1SHAP 值结合回归显著性检验是否能为高维表格数据中的特征选择提供一种有效且高效的启发式方法?
- RQ2与 Boruta、RFE、HISEL 和简单 SHAP 基础选择等成熟方法相比,shap-select 在准确率、F1 分数和运行时间方面的表现如何?
- RQ3该方法的迭代应用是否能提升模型性能,还是反而导致性能下降?
- RQ4特征选择的最优置信度阈值是什么?性能对此选择的敏感性如何?
- RQ5该框架是否能在最小化所选特征数量的同时保持高性能,特别是在低数据量或噪声较大的场景下?
主要发现
- shap-select 仅选择了 6 个特征,却实现了最高的 F1 分数(0.870056)和近乎完美的准确率(0.999596),在两项指标上均优于 Boruta 和 RFE。
- 该方法运行时间为 21.8 秒,显著快于 Boruta(95.85 秒)和 HISEL(109.03 秒),尽管 Boruta 的准确率略高。
- RFE 和 shap-selection 在 F1 分数和准确率上表现均不如 shap-select,尽管其运行时间更短。
- HISEL 选择了全部 30 个特征,运行时间最长(109.03 秒),F1 分数最低(0.858757),表明其效率与性能之间存在严重权衡。
- 对 shap-select 进行迭代应用会降低模型性能,表明单次遍历为最优策略。
- 5% 的置信度阈值被证明是有效且鲁棒的,敏感性分析显示其在不同阈值下性能保持稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。