[论文解读] Diverse Weight Averaging for Out-of-Distribution Generalization
本文提出了一种名为Diverse Weight Averaging(DiWA)的新颖权重平均方法,通过从共享相同初始化的多个独立训练模型中平均权重,提升分布外(OOD)泛化能力。DiWA增强了模型的功能多样性,从而在DomainBed基准上实现最先进性能,且无需推理开销,尤其在多样性偏移(协变量偏移)下表现优异,这一结论通过一种新的偏差-方差-协方差-局部性误差分解得到验证。
Standard neural networks struggle to generalize under distribution shifts in computer vision. Fortunately, combining multiple networks can consistently improve out-of-distribution generalization. In particular, weight averaging (WA) strategies were shown to perform best on the competitive DomainBed benchmark; they directly average the weights of multiple networks despite their nonlinearities. In this paper, we propose Diverse Weight Averaging (DiWA), a new WA strategy whose main motivation is to increase the functional diversity across averaged models. To this end, DiWA averages weights obtained from several independent training runs: indeed, models obtained from different runs are more diverse than those collected along a single run thanks to differences in hyperparameters and training procedures. We motivate the need for diversity by a new bias-variance-covariance-locality decomposition of the expected error, exploiting similarities between WA and standard functional ensembling. Moreover, this decomposition highlights that WA succeeds when the variance term dominates, which we show occurs when the marginal distribution changes at test time. Experimentally, DiWA consistently improves the state of the art on DomainBed without inference overhead.
研究动机与目标
- 在分布偏移,尤其是协变量偏移条件下,提升视觉模型的分布外泛化能力。
- 解决现有权重平均(WA)方法未显式促进模型多样性的局限性。
- 基于偏差-方差-协方差-局部性分解,为WA在OOD泛化中的成功提供理论基础。
- 通过实证验证,增加平均模型之间的多样性可提升OOD性能。
- 确立DiWA作为现有领域自适应方法的强而高效的替代方案。
提出的方法
- DiWA通过从多个独立训练过程的模型权重中进行平均,这些过程均从同一随机种子初始化,从而提升功能多样性。
- 该方法利用权重空间中的线性模式连通性,当模型从共享的预训练初始化开始时,该现象在实验中得到验证。
- 采用期望误差的理论分解,将其划分为偏差、方差、协方差和局部性四项,以支持该方法的合理性。
- 在边缘分布偏移(多样性偏移)下,方差项增大,DiWA通过提升模型多样性来增强该方差项。
- 该方法避免了重新训练或架构修改,仅依赖于训练后的权重平均。
- DiWA被应用于DomainBed基准中在多个领域上训练的模型,且不增加任何推理成本。
实验结果
研究问题
- RQ1为何权重平均能提升分布外泛化能力?它在何种分布偏移下最为有效?
- RQ2模型多样性如何影响权重平均模型在OOD设置下的性能?
- RQ3能否通过将误差分解为偏差、方差、协方差和局部性四项,解释WA的成功?
- RQ4从独立训练过程(共享初始化)中平均模型,是否比沿单一训练轨迹平均能带来更好的OOD泛化?
- RQ5在不同类型的分布偏移下,DiWA与最先进领域自适应方法(如IRM和Fishr)相比表现如何?
主要发现
- DiWA在DomainBed基准的所有真实世界数据集上均实现了最先进性能,且无任何推理开销。
- 在ColoredMNIST数据集上,DiWA-uniform和DiWA-restricted在多样性偏移下优于ERM和MA,其中DiWA-restricted在测试领域模型选择下达到55.7%的准确率。
- 在相关性偏移(如存在虚假相关性的ColoredMNIST)下,WA无法提升性能,证实DiWA主要在多样性偏移下有效。
- DiWA在所有DomainBed数据集上均持续提升OOD泛化能力,尤其当从多样化训练过程中选取模型时效果更显著。
- 当在目标领域数据上进行最后层微调(如Office-Home)时,基于DiWA的特征提取器优于基于ERM的模型,准确率达到78.1%(使用80%目标数据)。
- 理论分解表明,当方差项占主导时WA表现优异,这种情况发生在边缘分布偏移(即多样性偏移)下,验证了DiWA的核心设计原理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。