[论文解读] Exploiting Both Domain-specific and Invariant Knowledge via a Win-win Transformer for Unsupervised Domain Adaptation
该论文提出WinTR,一种用于无监督域自适应的双赢Transformer框架,通过为源域和目标域分别使用独立分类器来独立学习领域特定知识,同时通过源引导的标签优化和单边特征对齐实现跨领域知识迁移。实验表明,WinTR实现了最先进性能,在DomainNet上相比之前方法最高提升12.2%,且在迁移能力上优于CNN模型。
Unsupervised Domain Adaptation (UDA) aims to transfer knowledge from a labeled source domain to an unlabeled target domain. Most existing UDA approaches enable knowledge transfer via learning domain-invariant representation and sharing one classifier across two domains. However, ignoring the domain-specific information that are related to the task, and forcing a unified classifier to fit both domains will limit the feature expressiveness in each domain. In this paper, by observing that the Transformer architecture with comparable parameters can generate more transferable representations than CNN counterparts, we propose a Win-Win TRansformer framework (WinTR) that separately explores the domain-specific knowledge for each domain and meanwhile interchanges cross-domain knowledge. Specifically, we learn two different mappings using two individual classification tokens in the Transformer, and design for each one a domain-specific classifier. The cross-domain knowledge is transferred via source guided label refinement and single-sided feature alignment with respect to source or target, which keeps the integrity of domain-specific information. Extensive experiments on three benchmark datasets show that our method outperforms the state-of-the-art UDA methods, validating the effectiveness of exploiting both domain-specific and invariant
研究动机与目标
- 为解决现有UDA方法强制在源域和目标域上使用单一分类器所带来的局限性,该方法损害了领域特定特征的表达能力。
- 探究视觉Transformer相较于CNN是否能在更好地保留领域内知识的同时,实现更有效的跨领域知识迁移。
- 解决UDA中领域不变表示学习与领域特定特征学习之间的固有权衡。
- 验证使用两个独立分类头配合共享主干网络,并通过伪标签优化实现跨领域知识蒸馏的有效性。
提出的方法
- 该方法采用视觉Transformer主干网络(DeiT),并配备两个独立的分类标记——一个用于源域,一个用于目标域,从而实现领域特定表征的独立学习。
- 提出一种源引导的标签优化机制,利用源分类器的预测结果来提升目标域伪标签的质量。
- 应用单边特征对齐策略,将某一领域的特征对齐至另一领域(如目标域对齐至源域),同时通过梯度截断操作保留领域特定特征。
- 训练过程分为两个阶段:首先,使用ImageNet预训练权重训练一个仅基于源域的模型,以生成初始目标域伪标签;其次,模型重新初始化,并联合优化领域特定分类器与对比损失。
- 对比损失在源域和目标域特征上独立计算,同时对相反领域特征的梯度进行截断,以保持领域特定特征的完整性。
- 在训练过程中,通过最新模型预测结果迭代更新伪标签,以提升一致性与鲁棒性。
实验结果
研究问题
- RQ1在无监督域自适应中,一个配备两个独立分类头的单一Transformer主干网络,能否有效学习到领域特定与领域不变特征?
- RQ2相较于CNN,使用视觉Transformer是否能提升UDA中的迁移能力,特别是在存在较大领域差异的情况下?
- RQ3源引导的标签优化与单边特征对齐是否能协同增强知识迁移,同时不牺牲领域特定特征的表达能力?
- RQ4在基于Transformer的UDA框架中,仅使用未标注的目标域数据与伪标签训练专用目标分类器是否可行且有效?
主要发现
- WinTR-B在DomainNet基准上的平均准确率达到46.8%,比其DeiT-B主干网络高出12.2%。
- WinTR-S在DomainNet上平均性能比CDTrans-B高出4.8%,并超越所有基于ResNet-50的UDA方法。
- 在Office-Home数据集上,WinTR实现了最先进性能,相较于基于CNN的模型在迁移能力方面有显著提升。
- 可视化结果表明,视觉Transformer能聚焦于目标域中的相关物体,而CNN则常关注背景或风格伪影。
- 消融实验验证了源引导的标签优化与单边特征对齐均对性能提升有显著贡献。
- 该方法在大领域差异场景下表现出更优的鲁棒性,例如在Office-Home数据集中Ar→Cl的域迁移中,CNN模型无法有效关注主要物体,而WinTR表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。