[论文解读] Elastic Weight Consolidation Improves the Robustness of Self-Supervised Learning Methods under Transfer
本文提出将弹性权重固化(Elastic Weight Consolidation, EWC)与费雪信息矩阵(Fisher Information Matrix, FIM)结合,用于正则化自监督学习(SSL)微调,从而提升下游任务中对分布偏移的鲁棒性。通过将微调后的模型约束在初始SSL表征附近,该方法在使用ViT-B/16时,使Waterbirds数据集的最差组准确率提升5%,Celeb-A数据集提升2%;同时公开发布了DINO预训练模型的FIM。
Self-supervised representation learning (SSL) methods provide an effective label-free initial condition for fine-tuning downstream tasks. However, in numerous realistic scenarios, the downstream task might be biased with respect to the target label distribution. This in turn moves the learned fine-tuned model posterior away from the initial (label) bias-free self-supervised model posterior. In this work, we re-interpret SSL fine-tuning under the lens of Bayesian continual learning and consider regularization through the Elastic Weight Consolidation (EWC) framework. We demonstrate that self-regularization against an initial SSL backbone improves worst sub-group performance in Waterbirds by 5% and Celeb-A by 2% when using the ViT-B/16 architecture. Furthermore, to help simplify the use of EWC with SSL, we pre-compute and publicly release the Fisher Information Matrix (FIM), evaluated with 10,000 ImageNet-1K variates evaluated on large modern SSL architectures including ViT-B/16 and ResNet50 trained with DINO.
研究动机与目标
- 为解决下游数据分布存在偏差时,微调模型偏离标签无关的SSL表征的问题。
- 通过将微调模型正则化至其初始SSL参数,提升下游任务的鲁棒性,特别是对低资源子群体的性能。
- 将贝叶斯持续学习原则(特别是EWC)应用于SSL微调,将预训练与微调视为顺序学习任务。
- 解决视觉变换器(如ViT-B/16)中FIM条件数差的问题,该问题阻碍了SSL性能的完全恢复。
- 通过预计算并发布现代SSL架构(如使用DINO训练的ViT-B/16和ResNet50)的FIM,实现FIM正则化的实用化。
提出的方法
- 该方法将弹性权重固化(EWC)应用于SSL模型的微调,利用费雪信息矩阵(FIM)计算参数正则化权重。
- FIM通过经验费雪信息近似计算,基于10,000张ImageNet-1K图像,类别概率从模型输出分布中采样获得。
- 为解决ViT-B/16中FIM条件数差的问题,引入一种改进的FIM形式:$ F_{\alpha} = (1-\alpha)F + \alpha\bar{F} $,其中$ \bar{F} $为FIM的平均值,$ \alpha \in [0,1] $。
- 正则化项$ \frac{1}{2} \| \theta - \theta_{\text{SSL}} \|_{F}^2 $惩罚参数$ \theta $与SSL学习得到的参数$ \theta_{\text{SSL}} $之间的偏离,FIM值用于衡量参数的重要性。
- 通过在20次随机搜索试验中选择超参数,验证过程基于整体top-1准确率,且不访问组标签信息。
- 在Waterbirds和Celeb-A数据集上验证该方法,比较EWC-FIM、调整后的FIM、L2和ERM基线方法,共使用5个随机种子。
实验结果
研究问题
- RQ1基于EWC的正则化方法是否能通过约束至初始SSL表征,提升在存在数据分布偏差的下游任务中的最差组性能?
- RQ2为何标准FIM正则化在ViT-B/16上无法恢复SSL性能?该问题如何缓解?
- RQ3在Waterbirds和Celeb-A等基准数据集上,FIM正则化是否优于标准ERM微调,在最差组准确率方面表现更优?
- RQ4FIM的条件数如何影响EWC在视觉变换器(ViT)中相对于ResNet50等CNN的有效性?
- RQ5能否为现代SSL模型预计算并发布FIM,以实现在现实场景中实用且鲁棒的微调?
主要发现
- 使用ViT-B/16时,EWC结合FIM正则化使Waterbirds数据集的最差组准确率(WGA)相比ERM基线提升5%。
- 在Celeb-A数据集上,相同方法使用ViT-B/16使WGA相比ERM基线提升2%。
- 对于ResNet50,FIM正则化在Celeb-A上使WGA提升约1%,但在Waterbirds上表现不如ERM。
- ViT-B/16的FIM条件极差,许多值接近零或$ 10^{-30} $,导致其成为伪范数,阻碍了SSL模型性能的完全恢复。
- 使用$ \alpha = 10^{-3} $对FIM进行重标度后,正则化性能的Pareto前沿得到改善,优于未经调整的FIM和L2正则化。
- 作者公开发布了在ImageNet-1K上使用DINO预训练的ViT-B/16和ResNet50的预计算FIM,支持结果复现与实际应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。