[论文解读] DIVINE: Diverse Influential Training Points for Data Visualization and Model Refinement
本文提出DIVINE方法,用于识别具有多样性 yet 高影响力的训练样本子集,以提升模型可解释性与公平性分析。通过结合影响度分数与多样性正则化,DIVINE 选择出具有代表性且非冗余的样本,更好地揭示模型在特征空间中的行为,相较于现有方法在可信赖度与可模拟性方面的用户研究中表现更优,并能识别出影响公平性的数据点,从而实现模型优化。
As the complexity of machine learning (ML) models increases, resulting in a lack of prediction explainability, several methods have been developed to explain a model's behavior in terms of the training data points that most influence the model. However, these methods tend to mark outliers as highly influential points, limiting the insights that practitioners can draw from points that are not representative of the training data. In this work, we take a step towards finding influential training points that also represent the training data well. We first review methods for assigning importance scores to training points. Given importance scores, we propose a method to select a set of DIVerse INfluEntial (DIVINE) training points as a useful explanation of model behavior. As practitioners might not only be interested in finding data points influential with respect to model accuracy, but also with respect to other important metrics, we show how to evaluate training data points on the basis of group fairness. Our method can identify unfairness-inducing training points, which can be removed to improve fairness outcomes. Our quantitative experiments and user studies show that visualizing DIVINE points helps practitioners understand and explain model behavior better than earlier approaches.
研究动机与目标
- 为解决现有训练样本重要性方法返回冗余、异常值密集样本的问题,从而降低对模型行为的理解深度。
- 开发一种方法,选择出既具有高度影响力又能代表完整特征空间的训练样本。
- 将训练样本重要性扩展至公平性度量,以识别出损害群体公平性的数据点。
- 通过有针对性地移除导致不公平性的样本,实现模型优化,同时保持其他指标的性能。
- 通过定量实验与关于可信度和模型可模拟性的用户研究,评估DIVINE的有效性。
提出的方法
- 该方法基于现有的影响度分数方法(如影响函数 IF 和数据Shapley DS),以它们的分数作为输入。
- 通过正则化目标函数,在影响度(如 IF 或 DS 分数)与多样性之间建立权衡,促进在特征空间中选择非冗余的样本。
- 通过基于核函数的正则化项强制实现多样性,惩罚所选样本之间的相似性,确保覆盖数据流形的不同区域。
- 该方法具有灵活性,可应用于任意影响度分数,支持与多种现有方法集成。
- 在公平性方面,计算相对于群体公平性度量(如平等机会)的影响度分数,识别出显著影响公平性结果的样本。
- 通过识别并移除最具不公平性影响的样本,实现模型优化,且对准确率或其他指标的影响最小。
实验结果
研究问题
- RQ1一种在训练样本选择中平衡影响度与多样性的方法,是否能比仅依赖影响度的现有方法提供更全面的模型行为洞察?
- RQ2包含多样化高影响力样本是否能提升用户对模型决策的模拟与信任能力?
- RQ3能否有意义地将训练样本影响度扩展至公平性度量,以识别并缓解模型结果中的偏见?
- RQ4移除识别出的不公平性诱导样本在多大程度上能提升公平性,同时不降低整体模型性能?
- RQ5所选训练样本的多样性在多大程度上影响用户在模型可模拟性任务中推断决策边界的准确性?
主要发现
- 用户研究表明,与影响函数(IF)相比,DIVINE 样本的可信度评分显著更高(平均分 4.3/5),而 IF 的平均分为 3.1/5,参与者指出 DIVINE 样本更具代表性且更清晰。
- 在可模拟性任务中,基于 DIVINE 样本推断出的决策边界与真实边界之间的余弦相似度为 0.85(m=10),优于 IF(0.68)和随机样本(0.52)。
- 当仅展示 5 个样本时,用户基于 DIVINE 样本推断的决策边界余弦相似度仍达 0.72,显著高于 IF(0.58)和随机样本(0.48)。
- 在多样性偏好调查中,100% 的参与者在 10 人试点研究中选择 DIVINE 比 IF 或数据Shapley 更具多样性。
- 该方法成功识别出影响公平性的样本,移除后公平性指标得到改善(例如,平等机会差异减少 40%),且准确率下降极小(<1%)。
- 定量评估证实,与 IF 或 DS 相比,DIVINE 样本覆盖了更广阔的特征空间区域,避免了在高影响力但狭窄区域的聚集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。