Skip to main content
QUICK REVIEW

[论文解读] Safe Self-Refinement for Transformer-based Domain Adaptation

Tong Sun, Cheng Lu|arXiv (Cornell University)|Apr 16, 2022
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

该论文提出SSRT,一种新颖的无监督域自适应方法,结合视觉变换器主干网络与基于扰动目标数据的安全自精炼策略,以提升泛化能力。通过在扰动潜在标记上的预测上应用基于KL散度的正则化,并采用自适应安全训练机制,SSRT在Office-Home、VisDA-2017和DomainNet上均取得最先进性能,准确率分别为85.43%、88.76%和45.2%。

ABSTRACT

Unsupervised Domain Adaptation (UDA) aims to leverage a label-rich source domain to solve tasks on a related unlabeled target domain. It is a challenging problem especially when a large domain gap lies between the source and target domains. In this paper we propose a novel solution named SSRT (Safe Self-Refinement for Transformer-based domain adaptation), which brings improvement from two aspects. First, encouraged by the success of vision transformers in various vision tasks, we arm SSRT with a transformer backbone. We find that the combination of vision transformer with simple adversarial adaptation surpasses best reported Convolutional Neural Network (CNN)-based results on the challenging DomainNet benchmark, showing its strong transferable feature representation. Second, to reduce the risk of model collapse and improve the effectiveness of knowledge transfer between domains with large gaps, we propose a Safe Self-Refinement strategy. Specifically, SSRT utilizes predictions of perturbed target domain data to refine the model. Since the model capacity of vision transformer is large and predictions in such challenging tasks can be noisy, a safe training mechanism is designed to adaptively adjust learning configuration. Extensive evaluations are conducted on several widely tested UDA benchmarks and SSRT achieves consistently the best performances, including 85.43% on Office-Home, 88.76% on VisDA-2017 and 45.2% on DomainNet.

研究动机与目标

  • 解决无监督域自适应(UDA)中源域与目标域存在显著差异时的大域差距挑战。
  • 利用视觉变换器(ViT)的强大特征表示能力,超越传统CNN主干网络,在UDA中提升可迁移性。
  • 开发一种稳健的训练机制,防止在适应过程中因大域偏移导致目标数据预测噪声过大而引发的模型崩溃。
  • 通过受控且自适应的方式,利用扰动目标样本的预测结果对模型进行精炼,从而提升从源域到目标域的知识迁移能力。

提出的方法

  • 采用视觉变换器(ViT-B/16)作为主干网络,从源域和目标域中提取强大且可迁移的特征。
  • 在训练过程中对目标域数据的潜在标记序列施加随机偏移扰动,以生成对抗性视图。
  • 使用Kullback-Leibler(KL)散度最小化原始与扰动目标样本之间的预测差异,以增强鲁棒性与一致性。
  • 在变换器块之间实施多层扰动与双向监督,以增强特征精炼效果。
  • 引入一种安全训练机制,通过监控目标数据上的预测多样性来检测模型崩溃,并在检测到时触发模型回滚与配置重置。
  • 利用动态多样性度量在训练过程中自适应调整超参数,避免人工调参,提升在具有挑战性的任务上的可靠性。

实验结果

研究问题

  • RQ1在存在大域偏移的情况下,视觉变换器是否能在无监督域自适应中超越卷积神经网络?
  • RQ2当在噪声较大的目标预测上使用高容量模型(如视觉变换器)进行自训练时,如何防止模型崩溃?
  • RQ3基于扰动的自精炼结合KL正则化是否能提升UDA中的泛化能力与鲁棒性?
  • RQ4自适应、动态的训练策略是否能在无需人工调参的情况下,提升在多样化UDA基准上的性能?
  • RQ5所提出的安全部分自精炼策略与现有基于SSL的方法(如Mixup和VAT)相比,在域自适应设置下表现如何?

主要发现

  • SSRT在Office-Home基准上达到85.43%的top-1准确率,超越了使用ResNet主干网络的先前最先进结果。
  • 在VisDA-2017上,SSRT达到88.76%的准确率,表明其在具有挑战性的大规模域偏移基准上具有强大的泛化能力。
  • 在DomainNet上,SSRT实现45.2%的平均准确率,相较于先前最先进方法(使用ResNet-101,准确率为33.3%)有显著提升。
  • 消融研究显示,安全训练机制可有效防止在困难适应任务(如Pr→Cl和Cl→Pr划分)中性能下降。
  • 即使参数量更少(22M),SSRT-S(ViT-small变体)在DomainNet上仍比使用ResNet-101(4500万参数)的MDD+SCDA方法高出5.1%。
  • 实证分析表明,SSRT在推理阶段对扰动更具鲁棒性,即使在较大扰动幅度(α=0.4)下仍能保持较高准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。