[论文解读] Efficient nonparametric statistical inference on population feature importance using Shapley values
本文提出了一种计算高效的非参数方法,用于基于Shapley值对总体特征重要性进行统计推断。通过仅从n个观测值中采样Θ(n)个特征子集,该方法实现了渐近最优收敛速度,并支持有效的置信区间和假设检验,经模拟实验和ICU死亡率预测验证,结果在多种机器学习模型中保持一致。
The true population-level importance of a variable in a prediction task provides useful knowledge about the underlying data-generating mechanism and can help in deciding which measurements to collect in subsequent experiments. Valid statistical inference on this importance is a key component in understanding the population of interest. We present a computationally efficient procedure for estimating and obtaining valid statistical inference on the <b>S</b>hapley <b>P</b>opulation <b>V</b>ariable <b>I</b>mportance <b>M</b>easure (SPVIM). Although the computational complexity of the true SPVIM scales exponentially with the number of variables, we propose an estimator based on randomly sampling only Θ(<i>n</i>) feature subsets given <i>n</i> observations. We prove that our estimator converges at an asymptotically optimal rate. Moreover, by deriving the asymptotic distribution of our estimator, we construct valid confidence intervals and hypothesis tests. Our procedure has good finite-sample performance in simulations, and for an in-hospital mortality prediction task produces similar variable importance estimates when different machine learning algorithms are applied.
研究动机与目标
- 开发一种在非参数设定下对总体水平变量重要性进行计算可行的统计推断方法。
- 解决精确Shapley值估计在特征重要性计算中面临的指数级计算复杂度问题。
- 利用渐近分布理论,为总体变量重要性构建有效的置信区间和假设检验。
- 将现有的基于Shapley的度量方法推广至超越参数假设和相关性诱导偏差的场景。
- 在多种机器学习模型和真实世界数据(如ICU死亡率预测)中展示方法的稳健性能。
提出的方法
- 提出一种基于采样的估计器,通过随机抽取Θ(n)个特征子集来近似真实的基于Shapley值的总体变量重要性度量(SPVIM)。
- 推导该估计器的渐近分布,将误差分解为模型估计误差和子集遗漏误差两部分。
- 利用估计器的渐近分布构造具有适当第一类错误控制的有效置信区间和假设检验。
- 将该方法应用于任意可预测性度量V,不限于决定系数或参数模型。
- 采用偏斜的采样分布,实际中使用的唯一子集数量低于样本量m = Θ(n)。
- 在开源软件包(Python中的vimpy,R中的vimp)中实现该方法,并在GitHub上提供可复现的代码。
实验结果
研究问题
- RQ1能否开发一种计算高效的估计器,用于基于Shapley值的总体特征重要性推断,且其计算复杂度随样本量增长而有利扩展?
- RQ2尽管遗漏了大多数特征子集,该提出的基于采样的估计器是否仍能达到渐近最优收敛速度?
- RQ3能否利用估计器的渐近分布为SPVIM构建有效的置信区间和假设检验?
- RQ4该方法在有限样本下在不同机器学习模型和真实世界数据集中的表现如何?
- RQ5当在相同数据上应用于不同预测模型时,SPVIM估计值在多大程度上保持一致性?
主要发现
- 所提出的估计器仅通过采样Θ(n)个特征子集,即可实现渐近最优收敛速度,显著降低计算成本。
- 该方法通过渐近分布理论支持有效的统计推断,可构建具有正确第一类错误控制的置信区间和假设检验。
- 在200个变量的模拟实验中,SPVIM估计值在不同样本量下保持一致,并准确恢复了真实重要性值,包括非预测性特征的近零值。
- 在ICU死亡率预测任务中,SPVIM估计值在多种机器学习模型间保持稳定,表明其对算法选择具有鲁棒性。
- 由于采样分布的偏斜性,实际使用的唯一特征子集数量显著低于样本量m = Θ(n)。
- 在弱条件下,平均绝对SHAP值与SPVIM相关,尤其当可预测性度量V为凸函数时(如均方误差)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。