[论文解读] ModelDiff: A Framework for Comparing Learning Algorithms
ModelDiff 是一种用于通过识别区分不同学习算法训练的模型的输入变换来比较机器学习算法的框架。它利用数据建模检测训练数据依赖性,并揭示由于数据增强、预训练和SGD超参数导致的模型行为的细粒度差异。
We study the problem of (learning) algorithm comparison, where the goal is to find differences between models trained with two different learning algorithms. We begin by formalizing this goal as one of finding distinguishing feature transformations, i.e., input transformations that change the predictions of models trained with one learning algorithm but not the other. We then present ModelDiff, a method that leverages the datamodels framework (Ilyas et al., 2022) to compare learning algorithms based on how they use their training data. We demonstrate ModelDiff through three case studies, comparing models trained with/without data augmentation, with/without pre-training, and with different SGD hyperparameters. Our code is available at https://github.com/MadryLab/modeldiff .
研究动机与目标
- 将学习算法比较问题形式化为在输入空间中识别区分性特征变换。
- 开发一种通用方法,用于在不预先假设其差异的情况下比较任意两个学习算法。
- 通过数据建模分析模型预测,量化学习算法在使用训练数据方面的差异。
- 实现对设计选择对模型行为影响的细粒度剖析,例如偏差和泛化能力。
- 通过子群体分析和反事实验证,提供可解释且可验证的算法差异洞察。
提出的方法
- 将算法比较形式化为寻找在输入空间中持续改变一个模型预测但不影响另一个模型的输入变换。
- 利用数据建模框架 [IPE+22] 来量化每个训练样本对模型预测的贡献。
- 为每个测试样本计算残差数据建模向量,以识别模型在训练数据依赖性上存在差异的子群体。
- 提取残差数据建模的主成分,以识别特征空间中的区分性方向。
- 使用视觉-语言模型(例如 CLIP)通过从区分性子群体中提取对比性描述来验证候选变换。
- 执行反事实分析,以验证所设计的变换是否能以预期方式可靠地改变预测。
实验结果
研究问题
- RQ1我们如何正式定义以特征使用为基准的学习算法比较问题?
- RQ2哪些输入变换能可靠地区分使用不同学习算法训练的模型?
- RQ3数据增强、预训练和SGD超参数如何改变模型对特定训练样本的依赖性?
- RQ4我们能否自动识别出在预测行为上系统性不同的测试样本子群体?
- RQ5视觉-语言模型(如 CLIP)在解释和验证区分性特征变换方面能提供多大程度的帮助?
主要发现
- 使用数据增强训练的模型在图像中添加蜘蛛网时,对 'spider' 类别的平均置信度提高15%,而未使用增强的模型仅提高1%。
- 在 ImageNet 上进行预训练会使模型在添加黄色斑块时对 'landbird' 类别的置信度提高+12%,而从零开始微调的模型则降低4%。
- 在背景中添加人脸会使预训练模型对 'landbird' 类别的置信度提高+4%,而从零开始训练的模型则降低1%。
- 使用较小学习率训练的模型在添加类似窗户的图案时,'truck' 类别的置信度平均提高7%,而学习率较大的模型仅提高2%。
- 基于 CLIP 的描述提取成功识别出 'yellow'、'lemon' 和 'faces' 等区分性特征,与人工推断的偏差一致。
- 残差数据建模的主成分在所有案例研究中均有效揭示了具有连贯且可解释的模型行为差异的子群体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。