[论文解读] Explaining Classification Models Built on High-Dimensional Sparse Data
本文提出了两种新方法——证据反事实(EC)与基于Shapley值的特征排序——以提升在高维稀疏行为数据上训练的线性模型的可解释性。通过结合特征系数与特征覆盖率(出现频率),这些方法识别出能解释最多预测结果的特征,相较于仅基于系数的排序方法,实现了两倍的‘性价比’。
Predictive modeling applications increasingly use data representing people's behavior, opinions, and interactions. Fine-grained behavior data often has different structure from traditional data, being very high-dimensional and sparse. Models built from these data are quite difficult to interpret, since they contain many thousands or even many millions of features. Listing features with large model coefficients is not sufficient, because the model coefficients do not incorporate information on feature presence, which is key when analysing sparse data. In this paper we introduce two alternatives for explaining predictive models by listing important features. We evaluate these alternatives in terms of explanation "bang for the buck,", i.e., how many examples' inferences are explained for a given number of features listed. The bottom line: (i) The proposed alternatives have double the bang-for-the-buck as compared to just listing the high-coefficient features, and (ii) interestingly, although they come from different sources and motivations, the two new alternatives provide strikingly similar rankings of important features.
研究动机与目标
- 为解决在高维稀疏行为数据上训练的线性模型的可解释性挑战,其中标准的基于系数的特征排序因特征覆盖率低而失效。
- 开发一种在模型系数大小与特征存在性(覆盖率)之间取得平衡的解释方法,以提升可解释性与实际应用价值。
- 评估并比较这些方法在‘解释性价比’(即每列出一个特征能解释多少预测)方面的有效性。
- 探究两种理论基础截然不同的方法(EC与Shapley)是否能产生相似且稳健的特征重要性排序。
提出的方法
- 提出证据反事实(EC)方法,识别出移除后会改变特定样本模型预测结果的最小特征集合。
- 应用合作博弈论中的Shapley值,计算每个特征在所有可能特征子集中的预测贡献,确保贡献分配的公平性。
- 将所有数据样本的实例级EC或Shapley得分聚合并归一化,生成同时考虑系数大小与覆盖率的全局特征重要性排序。
- 使用‘解释曲线’——一种可视化与评估指标——其中x轴为前k个特征的数量(对数尺度),y轴为仅使用这些特征即可正确预测的样本数量。
- 以逻辑回归作为基础模型,在包含数百万个二值特征(访问过的URL)的真实奢侈品零售浏览数据集上进行实验,采用基于阈值的正样本预测结果进行评估。
- 通过Spearman等级相关系数评估不同方法之间的特征排序质量,并利用top-k特征列表比较其解释能力。
实验结果
研究问题
- RQ1如何通过同时结合特征系数与特征覆盖率,提升在高维稀疏行为数据上训练的线性模型的可解释性?
- RQ2EC与基于Shapley的方法在解释效率(‘性价比’)方面是否显著优于标准的基于系数的特征排序?
- RQ3尽管理论基础不同,EC与Shapley方法在多大程度上产生相似的特征重要性排序?
- RQ4仅基于覆盖率的排序与基于系数或混合方法相比,在解释模型预测方面表现如何?
- RQ5解释曲线是否能有效量化并比较不同解释方法在真实稀疏数据场景下的性能?
主要发现
- EC与基于Shapley的方法相较于仅基于最大模型系数选择特征的方法,实现了约两倍的‘性价比’,即每列出一个特征可解释的预测数量翻倍。
- EC与Shapley方法的前10名特征排序几乎完全一致,Spearman相关系数达0.97,表明两种方法在排序上具有极强的一致性。
- EC/Shapley排序与基于系数的排序(β)之间的相关系数为中等水平(0.60–0.75),表明仅凭系数大小在稀疏数据中无法准确反映特征的解释重要性。
- 特征‘ebay.com’在EC方法中排名第一(解释贡献7%),但在系数大小排序中仅位列第17位(0.17%),表明EC方法能有效识别出覆盖率高、影响力大的特征,而这些特征常被系数排序所遗漏。
- 仅基于覆盖率的排序优于基于系数的排序,但仍逊色于EC与Shapley方法,其相关系数分别为0.39与0.16。
- 解释曲线显示,基于系数的排序即使使用前10%的特征,也仅能解释约一半的样本,而EC与Shapley方法在整个特征数量范围内均显著提升了解释能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。