[论文解读] Domain Generalization by Mutual-Information Regularization with Pre-trained Models
本文提出MIRO,一种领域泛化方法,通过最大化预训练模型与目标模型之间的互信息,学习鲁棒的、领域不变的表征。通过使用大规模预训练主干网络近似理想oracle模型,MIRO在DomainBed基准上实现了最先进性能,尤其在CLIP和SWAG等大模型上表现显著。
Domain generalization (DG) aims to learn a generalized model to an unseen target domain using only limited source domains. Previous attempts to DG fail to learn domain-invariant representations only from the source domains due to the significant domain shifts between training and test domains. Instead, we re-formulate the DG objective using mutual information with the oracle model, a model generalized to any possible domain. We derive a tractable variational lower bound via approximating the oracle model by a pre-trained model, called Mutual Information Regularization with Oracle (MIRO). Our extensive experiments show that MIRO significantly improves the out-of-distribution performance. Furthermore, our scaling experiments show that the larger the scale of the pre-trained model, the greater the performance improvement of MIRO. Source code is available at https://github.com/kakaobrain/miro.
研究动机与目标
- 解决现有领域泛化方法在面临大规模分布偏移时因对源域偏差过拟合而失效的局限性。
- 将领域泛化重新定义为最大化目标模型与一个在所有领域上都具有泛化能力的oracle模型之间互信息。
- 开发一种实用方法,利用大规模预训练模型近似难以计算的oracle模型,从而实现可计算的优化。
- 证明当与MIRO结合时,更大的预训练模型能显著提升泛化性能,而普通微调则不能。
- 提供一种即插即用的正则化方法,在不改变网络结构或复杂训练协议的前提下增强模型鲁棒性。
提出的方法
- 将领域泛化目标重新表述为最大化目标模型特征与oracle模型特征之间的互信息。
- 使用大规模预训练模型(如ImageNet、CLIP、SWAG)近似oracle模型,使目标可计算。
- 推导互信息目标的变分下界,从而得到一个可微的正则化项,连接预训练模型与目标模型的表征。
- 将标准的经验风险最小化(ERM)目标与互信息正则化项结合,由超参数λ控制。
- 同时将预训练模型用作初始化和oracle近似,实现与任意主干网络和数据集的即插即用集成。
- 在微调设置中应用该方法,其中正则化项促使目标模型与预训练模型的鲁棒、泛化性特征对齐。
实验结果
研究问题
- RQ1最大化与假设性oracle模型的互信息是否能超越学习领域不变特征,从而提升领域泛化性能?
- RQ2使用大规模预训练模型近似oracle模型是否能带来比标准微调更好的分布外泛化性能?
- RQ3预训练模型的规模如何影响MIRO带来的性能增益?
- RQ4在如ImageNet与医学影像数据集之间的大规模分布偏移下,互信息正则化是否依然有效?
- RQ5MIRO能否与现有集成方法结合以进一步提升鲁棒性?
主要发现
- MIRO在DomainBed基准上实现了最先进性能,优于所有现有方法,涵盖所有设置,包括不同优化器和预训练模型。
- 使用ImageNet预训练的ResNet-50时,MIRO将平均准确率从64.2%(ERM)提升至65.9%,提升+1.7%。
- 使用CLIP预训练的ViT-B时,MIRO将平均准确率从61.1%(ERM)提升至73.7%,提升+12.6%,表明在大规模预训练模型上具有显著增益。
- 使用SWAG预训练的RegNetY-16GF时,MIRO将平均准确率从68.0%(ERM)提升至74.1%,提升+6.1%。
- 将MIRO与SWAD集成方法结合后,SWAG主干网络的平均准确率进一步提升至77.3%。
- 与普通微调相比,MIRO在使用CLIP和SWAG等大规模预训练模型时,与oracle模型的互信息更高,尤其显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。