[论文解读] A Broad Study of Pre-training for Domain Generalization and Adaptation
本文对现代预训练在领域泛化与适应中的应用进行了全面分析,表明在 ImageNet-22K 等大规模数据集上预训练的最先进主干网络,在 Office-Home 和 DomainNet 上的表现优于现有的领域自适应方法,设立了新的 SOTA 基线。研究发现,先进的预训练显著降低了对复杂自适应技术的依赖,挑战了当前领域迁移学习中的评估范式。
Deep models must learn robust and transferable representations in order to perform well on new domains. While domain transfer methods (e.g., domain adaptation, domain generalization) have been proposed to learn transferable representations across domains, they are typically applied to ResNet backbones pre-trained on ImageNet. Thus, existing works pay little attention to the effects of pre-training on domain transfer tasks. In this paper, we provide a broad study and in-depth analysis of pre-training for domain adaptation and generalization, namely: network architectures, size, pre-training loss, and datasets. We observe that simply using a state-of-the-art backbone outperforms existing state-of-the-art domain adaptation baselines and set new baselines on Office-Home and DomainNet improving by 10.7\% and 5.5\%. We hope that this work can provide more insights for future domain transfer research.
研究动机与目标
- 探究现代预训练对领域泛化与适应的影响,挑战‘复杂自适应方法必不可少’的假设。
- 评估网络架构、预训练数据集和损失函数对领域迁移性能的影响。
- 确定最先进预训练是否可减少对复杂领域自适应技术的需求。
- 通过对比 SOTA 预训练与现有 DA/DG 方法,建立领域迁移的新基准。
- 提供关于现代预训练模型在不同领域间特征可迁移性与表征质量的见解。
提出的方法
- 作者在四个标准多领域基准上开展广泛实验:Office-Home、DomainNet 和两个 Office-31 数据集的变体。
- 他们在不同预训练数据集(ImageNet-1K、ImageNet-22K、JFT-300M 和图文数据集)上评估了多种预训练主干网络,包括 ResNets、ConvNeXt、Swin Transformers 和 ViT。
- 他们对比了监督式与自监督式预训练损失(如交叉熵和对比学习,例如 ALBEF),以评估其对领域迁移的影响。
- 所有模型均采用简单的微调策略——仅增加一个全连接层,以隔离预训练效果与自适应复杂度的影响。
- 他们使用 t-SNE 可视化和 LogME 分析预训练表征的特征可分性和可迁移性。
- 他们评估了单源与多源领域自适应设置,并对比了 SOTA DA 方法与仅源域基线的性能。
实验结果
研究问题
- RQ1不同网络架构(CNN 与 Transformer)如何影响领域泛化与自适应性能?
- RQ2预训练数据集的规模与多样性(如 ImageNet-22K 与 JFT-300M)对领域迁移鲁棒性有何影响?
- RQ3自监督预训练是否在领域自适应任务中优于监督预训练?
- RQ4在采用现代预训练的前提下,现有领域自适应方法是否仍能带来显著增益,抑或已过时?
- RQ5强大的预训练是否可单独超越复杂领域自适应方法?若能,其适用条件为何?
主要发现
- 使用在 ImageNet-22K 上预训练的 ConvNeXt-XL 主干网络,不进行任何领域自适应,其在 Office-Home 上的准确率比所有现有 SOTA 领域自适应基线高出 10.7%。
- 在 DomainNet 上,相同的强大预训练设置使准确率比先前 SOTA 方法高出 5.5%,设立了新的基准。
- 尽管在 ImageNet-22K 上进行监督式预训练,自监督预训练(如 ALBEF)产生的特征聚类性更弱、可分性更差,尤其在领域对齐方面表现更差。
- 尽管采用了现代预训练,领域自适应方法的相对性能排名发生反转:一种更早、更简单的 DA 方法反而优于更新、更复杂的模型。
- 通过 LogME 测量的特征可迁移性显示,SOTA 预训练模型(如 ConvNeXt-XL、Swin-L)的可迁移性显著高于在 ImageNet-1K 上预训练的标准 ResNet-50。
- 本研究发现,DA 损失权重(λ 和 η)的默认超参数在不同网络深度间具有可迁移性,尽管深层网络对超参数变化的敏感度更低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。