[论文解读] Rashomon Capacity: A Metric for Predictive Multiplicity in Classification
本文提出了Rashomon容量这一新度量方法,通过衡量Rashomon集合中性能统计上无显著差异的模型之间得分的变异程度,来量化概率分类中的预测多重性。与以往仅限于阈值化预测的度量方法不同,Rashomon容量能够捕捉细微的概率分歧。作者证明该度量可由最多$c$个模型完全表征(其中$c$为类别数),从而实现高效估计,并通过贪心选择算法实现利益相关方的透明披露。实证结果表明,随机森林等集成模型的预测多重性显著降低。
Predictive multiplicity occurs when classification models with statistically indistinguishable performances assign conflicting predictions to individual samples. When used for decision-making in applications of consequence (e.g., lending, education, criminal justice), models developed without regard for predictive multiplicity may result in unjustified and arbitrary decisions for specific individuals. We introduce a new metric, called Rashomon Capacity, to measure predictive multiplicity in probabilistic classification. Prior metrics for predictive multiplicity focus on classifiers that output thresholded (i.e., 0-1) predicted classes. In contrast, Rashomon Capacity applies to probabilistic classifiers, capturing more nuanced score variations for individual samples. We provide a rigorous derivation for Rashomon Capacity, argue its intuitive appeal, and demonstrate how to estimate it in practice. We show that Rashomon Capacity yields principled strategies for disclosing conflicting models to stakeholders. Our numerical experiments illustrate how Rashomon Capacity captures predictive multiplicity in various datasets and learning models, including neural networks. The tools introduced in this paper can help data scientists measure and report predictive multiplicity prior to model deployment.
研究动机与目标
- 解决由于预测多重性导致的高风险AI应用中任意且缺乏依据的决策问题——即性能相近的模型对同一输入样本给出冲突的预测。
- 为概率分类器开发一种正式且可解释的预测多重性度量方法,而不仅限于阈值化(0-1)输出。
- 提供一种实用框架,在模型部署前对预测多重性进行估计和披露。
- 证明Rashomon容量可由少量模型(最多$c$个,即类别数)完全捕获,从而实现高效计算和模型子集选择。
提出的方法
- 提出Rashomon容量作为度量,量化给定输入样本在Rashomon集合中不同模型预测概率的范围变化。
- 推导理论边界,表明任意样本的得分变异均可由最多$c$个模型完全捕获,其中$c$为类别数。
- 提出一种贪心算法,从Rashomon集合中识别出最小模型子集,以保留数据集中大部分的得分变异。
- 通过多次重新训练模型(如不同随机初始化)获得的经验分布来估计Rashomon容量,并在多种数据集和架构上应用该度量。
- 将该度量应用于神经网络、决策树、随机森林及带不同正则化的逻辑回归模型,以评估其鲁棒性和实用性。
- 利用该度量指导模型披露策略,如随机化或装袋法,以解决预测冲突。
实验结果
研究问题
- RQ1如何在概率分类模型中正式度量预测多重性,尤其是在性能相近的模型对同一输入给出不同预测时?
- RQ2一个可解释且对高风险决策中利益相关方有用的预测多重性度量应具备哪些属性?
- RQ3Rashomon容量能否被高效估计和计算?其在复杂模型(如深度神经网络)中是否具备可扩展性?
- RQ4随机森林等集成方法在Rashomon容量度量下在多大程度上减少了预测多重性?
- RQ5Rashomon集合中的少量模型能否捕获给定输入的全部预测变异范围,从而支持实际的模型披露策略?
主要发现
- 对于任意输入样本,Rashomon容量的边界最多由$c$个模型决定,其中$c$为类别数,这使得无论Rashomon集合大小如何,均可实现高效估计。
- 随机森林分类器的Rashomon容量始终显著低于决策树,表明集成方法可减少预测多重性。
- 在UCI Adult和HSLS数据集上,逻辑回归的$\ell_1$与$\ell_2$正则化均降低了Rashomon容量,表明正则化可作为缓解策略。
- 在所有测试数据集(包括CIFAR-10、AG News和UrbanSound8k)中,Rashomon容量均有效捕捉了不同模型和架构之间的得分变异。
- 用于选择代表性模型的贪心算法能捕获数据集中大部分的得分变异,从而支持向利益相关方实际披露冲突预测。
- 模型校准无法消除预测多重性:即使校准良好的模型,对同一输入仍可能分配差异巨大的概率,凸显了Rashomon容量等度量的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。