[论文解读] Probability Series Expansion Classifier that is Interpretable by Design
该论文提出了一种新颖的、内在可解释的分类器,通过分层级数展开直接从测量的训练数据概率估计类别概率。通过多级特征组合的迭代优化并加重极端概率的权重,该方法在实现随机森林级别准确率的同时,实现了对特征贡献和模型行为的完整可审计性。
This work presents a new classifier that is specifically designed to be fully interpretable. This technique determines the probability of a class outcome, based directly on probability assignments measured from the training data. The accuracy of the predicted probability can be improved by measuring more probability estimates from the training data to create a series expansion that refines the predicted probability. We use this work to classify four standard datasets and achieve accuracies comparable to that of Random Forests. Because this technique is interpretable by design, it is capable of determining the combinations of features that contribute to a particular classification probability for individual cases as well as the weightings of each of combination of features.
研究动机与目标
- 解决高风险决策系统中对可解释机器学习的迫切需求,其中模型透明性至关重要。
- 克服随机森林等复杂模型固有的不透明性,这些模型为追求准确率而牺牲了可解释性。
- 开发一种分类器,直接使用测量的训练数据概率来估计类别结果,避免复杂的优化和正则化过程。
- 实现对哪些特征组合和单个特征对特定预测贡献最大的直接审计。
- 在确保可解释性设计的前提下,保持与随机森林等最先进模型相当的预测准确率。
提出的方法
- 使用训练数据中测量概率的分层级数展开来估计类别概率,从最具体的特征组合开始。
- 通过加权平均将低层级概率(例如 P(Y|xi) 和 P(Y|xi,xj))组合为更高级别的估计值,迭代优化概率估计。
- 应用缩放权重 Si = 1 / (Pi′ × (1 − Pi′)),以强调接近 0 或 1 的概率,确保强证据具有更大的影响力。
- 通过归一化项 (Ni / N) 和效用权重 (Ui) 纳入数据计数和不确定性校正,降低低样本估计带来的噪声。
- 使用基尼不纯度或熵选择性剪枝信息量较少的特征组合,限制模型规模而不损失准确率。
- 通过在估计过程中省略缺失特征对应的概率项,处理缺失特征,保持在现实场景中的鲁棒性。
实验结果
研究问题
- RQ1能否从零开始设计一种分类器,使其完全可解释而不牺牲预测准确率?
- RQ2如何系统性地组合测量的训练数据概率,以生成准确且可解释的类别预测?
- RQ3在多大程度上可以量化并可视化特征层级和组合层级对预测的贡献?
- RQ4极端概率估计(接近 0 或 1)如何影响整体预测的稳定性,以及如何适当地加权?
- RQ5概率的级数展开能否实现与随机森林等集成方法相当的性能,同时保持完全透明?
主要发现
- 概率级数展开分类器在四个标准数据集上的分类准确率与 scikit-learn 的随机森林实现相当。
- 该模型通过明确标识对预测贡献最大的特征组合及其贡献权重,实现了完全可解释性。
- 在国会议员投票记录数据集的一个误分类样本中,特征组合 x3=1, x9=1, x15=0 的贡献权重为 12.5%,且对共和党分类的概率为 100%。
- 由于在特定组合中具有强大的预测能力,单个特征 x9=1 和 x3=1 分别被赋予高权重(17% 和 16%)。
- 该模型成功识别出训练数据中的矛盾证据,例如某些特征组合同时预测 0% 和 100% 的共和党归属。
- 引入数据计数和不确定性校正显著提升了鲁棒性,防止了因低样本估计导致的缩放权重爆炸。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。