[论文解读] No One Representation to Rule Them All: Overlapping Features of Training Methods
本文表明,不同的训练方法——如监督学习与对比自监督预训练——会产生误差不相关的模型和专业化特征表示,从而实现高效的模型集成。通过结合不同目标和数据训练的模型,即使准确率较低的模型也能提升集成性能,在 Pascal VOC 上达到 86.7% 的准确率,前提是与高准确率模型配对。
Despite being able to capture a range of features of the data, high accuracy models trained with supervision tend to make similar predictions. This seemingly implies that high-performing models share similar biases regardless of training methodology, which would limit ensembling benefits and render low-accuracy models as having little practical use. Against this backdrop, recent work has developed quite different training techniques, such as large-scale contrastive learning, yielding competitively high accuracy on generalization and robustness benchmarks. This motivates us to revisit the assumption that models necessarily learn similar functions. We conduct a large-scale empirical study of models across hyper-parameters, architectures, frameworks, and datasets. We find that model pairs that diverge more in training methodology display categorically different generalization behavior, producing increasingly uncorrelated errors. We show these models specialize in subdomains of the data, leading to higher ensemble performance: with just 2 models (each with ImageNet accuracy ~76.5%), we can create ensembles with 83.4% (+7% boost). Surprisingly, we find that even significantly low-accuracy models can be used to improve high-accuracy models. Finally, we show diverging training methodology yield representations that capture overlapping (but not supersetting) feature sets which, when combined, lead to increased downstream performance.
研究动机与目标
- 探究以不同方法训练的高性能模型是否具有相似偏差,或表现出行为多样性。
- 确定以不同方法训练的低准确率模型是否仍能对集成性能产生贡献。
- 检查不同训练方法所学的表征是否包含重叠但非超集的特征,从而提升下游性能。
- 评估训练方法如何影响模型的泛化行为及误差相关性。
- 探索特征多样性在迁移学习与集成效率中的作用。
提出的方法
- 作者在多种超参数、架构、训练目标、框架和数据集上训练或收集了 82 个模型,包括 CLIP、ALIGN、SimCLR、BiT、ViT-G/14 和 MPL 等最先进模型。
- 基于模型对之间的训练方法差异(从重新初始化到数据集变化)评估其配对,并在 ImageNet 上测量其误差相关性。
- 通过平均模型对的预测结果评估集成性能,准确率在 ImageNet 和 Pascal VOC 上进行测量。
- 通过将两个模型的特征嵌入拼接并微调下游任务的线性分类头,应用堆叠泛化。
- 通过测量 Pascal VOC 上的 11 点 mAP 并与 ImageNet 准确率进行比较,分析预测多样性。
- 通过分析模型在自然图像与人为图像子集上的表现,评估子域专业化,揭示不同数据子域中的独特优势。
实验结果
研究问题
- RQ1即使个体准确率相似,使用显著不同的训练方法训练的模型是否仍会产生误差不相关的预测?
- RQ2以不同方法训练的低准确率模型在与高准确率模型结合时,是否仍能提升集成性能?
- RQ3以不同目标训练的模型是否学习到重叠但非超集的特征集合,且这些特征在组合后能提升下游性能?
- RQ4训练目标和数据分布的选择如何影响模型在不同数据子域中的专业化表现?
- RQ5预测多样性是否比单个模型的准确率更能预测下游性能?
主要发现
- 训练方法差异越大(尤其是目标和数据方面)的模型对,其误差越不相关,从而带来更高的集成准确率。
- 将标准 ResNet-50(ImageNet 准确率为 76.5%)与最差异化的模型 ALIGN-ZS(准确率为 75.5%)进行集成,实现了 83.4% 的准确率,提升达 +7%。
- 对比学习训练的模型如 CLIP-S 在人为图像上表现优异,而 ResNet-50 在自然图像上表现更佳,显示出子域专业化特征。
- 将高准确率模型(BiT-1k,准确率为 82.9%)与低准确率模型(最高 77.4%)结合,使 Pascal VOC 上的集成性能最高达到 86.7%。
- 将差异训练模型的嵌入特征进行成对拼接后,在 Pascal VOC 上达到 91.4% 的准确率,优于表现最好的单个模型(90.7% 准确率)。
- 在下游任务中表现最佳的模型组合并未包含 ImageNet 准确率最高的模型(MPL),表明在集成性能中,多样性可能优于单纯的高准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。