[论文解读] RelatIF: Identifying Explanatory Training Examples via Relative Influence
本文提出 RelatIF,一种新颖方法,通过测量相对于全局影响的局部影响,识别出更直观且更具代表性的训练样本,以解释机器学习模型的预测结果。与通常突出显示异常值或标签错误数据的标准影响函数不同,RelatIF 对全局影响进行约束,选择更典型且针对特定输入的样本,从而提升最终用户的解释质量。
In this work, we focus on the use of influence functions to identify relevant training examples that one might hope "explain" the predictions of a machine learning model. One shortcoming of influence functions is that the training examples deemed most "influential" are often outliers or mislabelled, making them poor choices for explanation. In order to address this shortcoming, we separate the role of global versus local influence. We introduce RelatIF, a new class of criteria for choosing relevant training examples by way of an optimization objective that places a constraint on global influence. RelatIF considers the local influence that an explanatory example has on a prediction relative to its global effects on the model. In empirical evaluations, we find that the examples returned by RelatIF are more intuitive when compared to those found using influence functions.
研究动机与目标
- 解决影响函数(IF)在选择异常值或标签错误样本作为解释性训练数据时的局限性。
- 通过识别与给定输入更具有代表性和特异性的训练样本,提升模型预测的可解释性。
- 在训练样本选择中,将全局影响(整体模型影响)与局部影响(对特定预测的影响)分离。
- 开发一种约束优化框架,优先选择局部影响相对于其全局影响较高的样本。
提出的方法
- RelatIF 将约束优化问题公式化,以限制候选训练样本的全局影响。
- 通过比较每个训练样本对特定预测的局部影响与其对模型整体影响的对比,计算其相对影响。
- 该方法以影响函数为基础,但引入对全局影响幅度的约束,以过滤掉高度影响但不具代表性的样本。
- 识别出在保持全局影响在预设阈值内时,局部影响最大的训练样本。
- 该方法通过在重加权训练样本下对模型参数进行无穷小分析实现,避免了完整的重新训练。
- 通过 L2 距离和定性分析,对 RelatIF 与标准 IF 及 k-最近邻(k-NN)进行实证评估。
实验结果
研究问题
- RQ1我们能否通过过滤掉全局影响高但不具代表性的训练样本,来提升基于样本的解释质量?
- RQ2相对影响选择是否能产生更符合输入分布且在特征空间中更接近测试样本的训练样本?
- RQ3RelatIF 在样本相关性和特异性方面,与影响函数和 k-最近邻相比表现如何?
- RQ4相对影响是否能减少不同输入间影响样本的重叠,从而实现更具体的解释?
主要发现
- 与标准影响函数相比,RelatIF 识别出的训练样本更具典型性,且更不可能是异常值或标签错误样本。
- RelatIF 返回的样本在 L2 距离上显著更接近测试输入,与 CIFAR10 上的 k-NN 重叠率为 2.6–5.6%,而 IF 仅 0.67–1.24%。
- 在 MNIST 上,RelatIF 与 k-NN 的重叠率为 26–35%,表明其样本集更具相关性和局部性,而 IF 的重叠率仅为 1.3–2.7%。
- 在 RelatIF 下,异常值的影响范围缩小,减少了多个测试输入被同一高损失样本解释的趋势。
- 定性分析证实,与 IF 选择的样本相比,RelatIF 的样本在语境上更直观、更相关。
- 通过减少少数高损失训练样本的全局主导性,RelatIF 生成了更具针对性的解释,从而提升了用户可解释性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。