[论文解读] Pre-Train Your Loss: Easy Bayesian Transfer Learning with Informative Priors
本文提出了一种新颖的贝叶斯迁移学习框架,该框架用从源任务后验分布中学习得到的、具有信息量的先验分布替代标准预训练模型权重。通过利用监督或自监督预训练学习得到的这一先验,对下游任务的损失曲面进行重加权,该方法在图像分类和语义分割基准测试中显著提升了准确率和数据效率,优于标准微调方法以及非学习型贝叶斯基线模型。
Deep learning is increasingly moving towards a transfer learning paradigm whereby large foundation models are fine-tuned on downstream tasks, starting from an initialization learned on the source task. But an initialization contains relatively little information about the source task. Instead, we show that we can learn highly informative posteriors from the source task, through supervised or self-supervised approaches, which then serve as the basis for priors that modify the whole loss surface on the downstream task. This simple modular approach enables significant performance gains and more data-efficient learning on a variety of downstream classification and segmentation tasks, serving as a drop-in replacement for standard pre-training strategies. These highly informative priors also can be saved for future use, similar to pre-trained weights, and stand in contrast to the zero-mean isotropic uninformative priors that are typically used in Bayesian deep learning.
研究动机与目标
- 为解决标准迁移学习依赖参数初始化而非丰富任务特异性归纳偏置的局限性。
- 通过利用源任务表征中的信息丰富先验,提升下游任务的数据效率与模型泛化能力。
- 证明采用学习型先验的贝叶斯迁移学习优于标准微调方法和非学习型先验。
- 探索通过自监督与监督预训练学习得到的先验在迁移中的可转移性。
- 提供一种可直接替换标准预训练的方案,同时增强优化过程与贝叶斯推理能力。
提出的方法
- 使用监督或自监督预训练(如 SimCLR)从源任务中学习模型权重的后验分布。
- 将源任务后验表示为具有低秩加对角协方差矩阵的高斯分布,以捕捉参数空间中的信息性方向。
- 对源后验进行重标度,作为下游任务的先验,反映源任务与目标任务之间的分布差异。
- 利用重标度后的先验来修改下游任务的负对数后验(即损失函数),从而重塑损失曲面。
- 通过标准 SGD 或基于蒙特卡洛采样对后验进行完整贝叶斯推理的方式执行下游训练。
- 将学习到的先验保存为可重用组件,类似于预训练权重,以供未来下游任务使用。
实验结果
研究问题
- RQ1从源任务中学习到的信息丰富先验是否能显著提升迁移学习中的下游性能?
- RQ2与标准微调和非学习型先验相比,采用学习型先验的贝叶斯推理在准确率和似然性方面是否表现更优?
- RQ3预训练目标的选择(监督 vs. 自监督)如何影响先验的可转移性与下游性能?
- RQ4信息丰富先验在多大程度上提升了微调中的数据效率?
- RQ5预训练先验是否可作为标准预训练权重在下游模型中的即插即用替代品?
主要发现
- 在 CIFAR-10.1 上,该方法在所有训练集规模下均优于 SGD 微调和非学习型先验的贝叶斯推理,表现出对分布偏移更强的鲁棒性。
- 在 PASCAL VOC 2012 上使用 ResNet-50 时,采用自监督学习先验的贝叶斯推理达到 74.15% 的平均交并比(Mean-IoU),优于基线 SGD 方法(73.17%)和非学习型先验(73.72%)。
- 在 Cityscapes 上使用 ResNet-101 时,该方法采用自监督学习先验达到 77.63% 的平均交并比(Mean-IoU),超过 SGD 基线(77.04%)和非学习型先验(77.02%)。
- 采用学习型先验的贝叶斯推理在测试集上的负对数似然低于所有其他方法,表明其不确定性估计更校准。
- 即使在使用 MAP 估计(SGD)时,该方法仍能提升性能,表明信息丰富先验的优势不仅限于完整贝叶斯推理。
- 通过自监督预训练(SimCLR)学习到的先验比通过监督预训练学习到的先验具有更好的可转移性,表明其为下游任务提供了更强的归纳偏置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。