Skip to main content
QUICK REVIEW

[论文解读] Domain Adaptation via Bidirectional Cross-Attention Transformer

Xiyu Wang, Pengxin Guo|arXiv (Cornell University)|Jan 15, 2022
Domain Adaptation and Few-Shot Learning被引用 13
一句话总结

本文提出了一种用于域适应的双向交叉注意力Transformer(BCAT),通过共享权重的四分支Transformer架构实现双向交叉注意力,隐式混合源域和目标域表示,以学习域不变特征。BCAT通过联合自注意力与交叉注意力机制以及MMD正则化,有效减少域差异,在四个基准数据集上实现了最先进性能。

ABSTRACT

Domain Adaptation (DA) aims to leverage the knowledge learned from a source domain with ample labeled data to a target domain with unlabeled data only. Most existing studies on DA contribute to learning domain-invariant feature representations for both domains by minimizing the domain gap based on convolution-based neural networks. Recently, vision transformers significantly improved performance in multiple vision tasks. Built on vision transformers, in this paper we propose a Bidirectional Cross-Attention Transformer (BCAT) for DA with the aim to improve the performance. In the proposed BCAT, the attention mechanism can extract implicit source and target mixup feature representations to narrow the domain discrepancy. Specifically, in BCAT, we design a weight-sharing quadruple-branch transformer with a bidirectional cross-attention mechanism to learn domain-invariant feature representations. Extensive experiments demonstrate that the proposed BCAT model achieves superior performance on four benchmark datasets over existing state-of-the-art DA methods that are based on convolutions or transformers.

研究动机与目标

  • 为解决现有基于Transformer的域适应模型中单向注意力的局限性,通过在源域和目标域之间实现双向特征交互。
  • 通过在共享架构中结合自注意力与交叉注意力,提升域不变表示学习,实现更好的特征对齐。
  • 在不依赖严格伪标签约束的前提下减少域差异,从而在真实世界域适应场景中具备更广适用性。
  • 在标准基准数据集上,超越基于卷积神经网络和基于Transformer的SOTA方法,实现更优性能。

提出的方法

  • 提出四分支Transformer模块,整合每个域的自注意力与域间双向交叉注意力,生成增强的特征表示。
  • 在所有四个分支(源域自注意力、目标域自注意力、源到目标、目标到源)之间采用参数共享架构,确保参数效率与域对称性。
  • 使用最大均值差异(MMD)损失最小化源域与目标域特征表示之间的域偏移。
  • 提出两种高效的推理模型——知识蒸馏(BCAT-KD)与动态令牌融合(BCAT-DTF),在保持性能的同时显著降低内存占用与推理时间。
  • 以端到端自监督方式应用模型,避免训练过程中对类别匹配小批量数据的依赖。
  • 采用视觉Transformer主干网络(ViT和Swin)作为特征提取器,支持长距离上下文建模并提升特征判别能力。

实验结果

研究问题

  • RQ1与单向注意力相比,源域与目标域之间的双向交叉注意力是否能提升域不变表示学习?
  • RQ2所提出的共享权重四分支Transformer模块如何增强域适应中的特征对齐与可迁移性?
  • RQ3结合自注意力与双向交叉注意力是否优于仅使用自注意力或单向交叉注意力?
  • RQ4所提出的BCAT模型是否能在标准域适应基准上超越基于ResNets和视觉Transformer的现有SOTA方法?
  • RQ5所提出的推理阶段优化方法(BCAT-KD与BCAT-DTF)在不损失准确率的前提下,是否能有效降低内存占用与推理时间?

主要发现

  • BCAT在四个基准数据集上实现SOTA性能:Office-Home、VisDA-2017和DomainNet,其中在DomainNet上平均准确率达到86.5%,在Office-Home上达到85.5%。
  • 所提出的双向交叉注意力机制优于单向交叉注意力与仅使用自注意力的基线模型,验证了隐式特征混合的有效性。
  • BCAT-KD与BCAT-DTF推理模型相比完整BCAT模型,将GPU内存使用降低最多50%,推理速度提升3倍以上,同时保持相近的准确率。
  • MMD损失与伪标签策略协同提升性能,MMD在所有数据集与模型上均表现出一致增益。
  • 注意力图可视化显示,BCAT相比仅使用源域的基线模型,能更准确聚焦于相关物体区域并有效抑制背景噪声。
  • 消融研究结果表明,结合双向交叉注意力与自注意力可获得最高性能,验证了域内与域间注意力之间的协同效应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。