[论文解读] Why do classifier accuracies show linear trends under distribution shift?
本文解释了为何深度学习分类器在分布偏移下评估时,准确率表现出近似线性趋势,归因于模型相似性:当高准确率模型正确分类了大多数低准确率模型也正确的样本时,这种现象便产生。在此假设下,除非分布偏移较大,否则在两个分布上的准确率之间会形成线性关系,为模型鲁棒性和泛化能力提供了洞见。
Recent studies of generalization in deep learning have observed a puzzling trend: accuracies of models on one data distribution are approximately linear functions of the accuracies on another distribution. We explain this trend under an intuitive assumption on model similarity, which was verified empirically in prior work. More precisely, we assume the probability that two models agree in their predictions is higher than what we can infer from their accuracy levels alone. Then, we show that a linear trend must occur when evaluating models on two distributions unless the size of the distribution shift is large. This work emphasizes the value of understanding model similarity, which can have an impact on the generalization and robustness of classification models.
研究动机与目标
- 理解深度学习模型为何在原始分布和偏移分布上的准确率之间表现出近似线性关系。
- 研究此类线性趋势出现的条件,特别是在分布偏移背景下的表现。
- 为在CIFAR-10.1和ImageNetV2等数据集上观察到的模型性能共线性现象提供理论基础。
- 探讨模型相似性如何影响泛化与鲁棒性,尤其是在近期分布偏移基准的背景下。
- 识别模型偏离线性趋势的情境,这可能预示着超越当前模型行为的有效鲁棒性潜力。
提出的方法
- 使用两个数据分布 P(原始)和 Q(偏移)来形式化问题,并在每种分布下定义模型准确率 μ_i 和 μ̃_i。
- 基于模型相似性提出一个假设:高准确率模型正确而低准确率模型错误的概率很小。
- 利用该假设推导出 μ_i 与 μ̃_i 之间关系的理论边界,表明除非分布偏移较大,否则线性趋势必然出现。
- 分析在何种条件下 probit 标度的线性拟合优于标准线性回归,将其与模型饱和及上界联系起来。
- 使用分段线性拟合表明,具有两个区段的线性趋势可与 probit 线性拟合一样好地拟合数据,暗示其适用范围更广。
- 通过 ImageNet 和 CIFAR-10 模型的实证验证,比较线性、probit 和分段拟合的理论发现。
实验结果
研究问题
- RQ1为何在分布偏移下,两个分布上的分类器准确率会表现出近似线性关系?
- RQ2该线性趋势在何种条件下会失效,又在何种条件下可被预期成立?
- RQ3模型相似性——特别是对正确预测的一致性——如何解释观察到的线性趋势?
- RQ4为何 probit 标度变换能为 ImageNet 模型提供更优的线性拟合?该现象是否具有普适性?
- RQ5分段线性拟合是否能比简单线性或 probit 线性拟合更好地解释数据?这又对模型性能的潜在结构意味着什么?
主要发现
- 在高准确率模型正确分类了大多数低准确率模型也正确的样本这一假设下,除非分布偏移较大,否则两个分布上的准确率之间必须存在线性关系。
- 该线性趋势对中等程度的分布偏移具有鲁棒性,解释了在 CIFAR-10.1 和 ImageNetV2 等基准中持续观察到的共线性现象。
- 对于 ImageNet 模型,probit 标度线性拟合表现更优,作者将其归因于模型饱和及紧密的理论上限。
- 具有两个区段的分段线性拟合达到 R² = 0.997,与 probit 线性拟合性能相当(R² 差异为 4×10⁻⁴),表明分段趋势可能比以往认为的更具普适性。
- CLIP 模型在更大规模数据集上进行训练,其在 ImageNetV2 上打破了线性趋势,表明其可能与先前模型差异较大,因而表现出更强的鲁棒性,尽管仍需进一步分析。
- 当模型之间不相似时,即使在小规模分布偏移下,新模型也可能位于线性趋势之上或之下,从而实现超越该趋势预测的有效鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。