Skip to main content
QUICK REVIEW

[论文解读] Adapting Self-Supervised Vision Transformers by Probing Attention-Conditioned Masking Consistency

Viraj Prabhu, Sriram Yenamandra|arXiv (Cornell University)|Jun 16, 2022
Domain Adaptation and Few-Shot Learning被引用 7
一句话总结

本文提出PACMAC,一种用于通过自监督学习(SSL)预训练的视觉Transformer(ViT)的两阶段域自适应方法。首先在源域和目标域数据上进行域内SSL,然后通过注意力条件掩码下的预测一致性识别可靠的目标样本——在OfficeHome、DomainNet和VisDA基准上,该方法相较先前方法实现了稳定的准确率提升。

ABSTRACT

Visual domain adaptation (DA) seeks to transfer trained models to unseen, unlabeled domains across distribution shift, but approaches typically focus on adapting convolutional neural network architectures initialized with supervised ImageNet representations. In this work, we shift focus to adapting modern architectures for object recognition -- the increasingly popular Vision Transformer (ViT) -- and modern pretraining based on self-supervised learning (SSL). Inspired by the design of recent SSL approaches based on learning from partial image inputs generated via masking or cropping -- either by learning to predict the missing pixels, or learning representational invariances to such augmentations -- we propose PACMAC, a simple two-stage adaptation algorithm for self-supervised ViTs. PACMAC first performs in-domain SSL on pooled source and target data to learn task-discriminative features, and then probes the model's predictive consistency across a set of partial target inputs generated via a novel attention-conditioned masking strategy, to identify reliable candidates for self-training. Our simple approach leads to consistent performance gains over competing methods that use ViTs and self-supervised initializations on standard object recognition benchmarks. Code available at https://github.com/virajprabhu/PACMAC

研究动机与目标

  • 为解决使用自监督表示初始化的视觉Transformer(ViTs)在无监督域自适应(UDA)中的适应问题。
  • 开发一种可靠、自监督的方法,用于识别无标签情况下适合选择性自训练的高质量目标样本。
  • 通过利用SSL预训练的归纳偏置和ViT注意力机制,提升在标准图像识别基准上的迁移性能。
  • 证明注意力条件掩码输入的预测一致性可作为ViT中自训练的有效可靠性信号。
  • 表明域对抗性方法在SSL初始化的ViTs上失效,因此需要架构特定的自适应策略。

提出的方法

  • 在池化后的源域和目标域数据上执行域内自监督学习(SSL),以在自适应前学习任务判别性特征。
  • 应用注意力条件掩码,生成目标图像中互不重叠且高度关注的区域,用于数据增强。
  • 通过比较原始图像与多个注意力条件掩码版本的预测一致性,评估模型的可靠性。
  • 将一致性得分与预测置信度结合,识别适合选择性自训练的可靠目标样本。
  • 采用两阶段流程:首先进行域内预训练,然后在高置信度且一致的预测上进行选择性自训练。
  • 利用ViT的自注意力机制引导掩码生成,确保掩码聚焦于语义显著区域,而非随机补丁。

实验结果

研究问题

  • RQ1注意力条件掩码输入的预测一致性能否作为自监督ViT中识别高质量目标样本的可靠信号?
  • RQ2为何标准的域对抗性UDA方法在应用于自监督学习预训练的ViTs时会失效?
  • RQ3在池化后的源域和目标域数据上进行域内SSL预训练是否能提升ViTs的特征判别性和自适应性能?
  • RQ4注意力条件掩码与随机掩码相比,在识别适合自训练的可靠样本方面表现如何?
  • RQ5当使用自监督ViTs时,一种简单、模块化的自适应策略是否能超越复杂域自适应方法在标准基准上的表现?

主要发现

  • PACMAC在OfficeHome、DomainNet和VisDA基准上适应自监督ViTs时,相较竞争方法实现了稳定的性能提升。
  • 通过注意力条件掩码一致性提出的可靠性估计在MAE和DINO预训练设置下均实现了70–80%的精确率。
  • 域内预训练提升了OfficeHome数据集上每类的kNN准确率,尤其在MAE初始化下表现更优,表明特征判别性更好。
  • 自监督ViTs表现出较低的域对齐分数(DA score),解释了域对抗性方法(如CDAN)在这些模型上失效的原因。
  • 用于自训练的目标实例选择比例随训练轮次增加,尤其在DINO预训练设置下更为明显。
  • 可靠性估计的失败案例包括假阳性和假阴性,表明性能存在类别依赖性差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。