Skip to main content
QUICK REVIEW

[論文レビュー] Domain Adaptation via Bidirectional Cross-Attention Transformer

Xiyu Wang, Pengxin Guo|arXiv (Cornell University)|Jan 15, 2022
Domain Adaptation and Few-Shot Learning被引用数 13
ひとこと要約

本論文は、ドメイン不変特徴を暗黙的に混合させることで、ドメイン間の差を低減する、重み共有の4本のブランチを持つ双方向クロスアテンショントランスフォーマー(BCAT)を提案する。BCATは、共同自己アテンションおよびクロスアテンションメカニズムとMMD正則化を用いることで、4つのベンチマークデータセットで最先端の性能を達成する。

ABSTRACT

Domain Adaptation (DA) aims to leverage the knowledge learned from a source domain with ample labeled data to a target domain with unlabeled data only. Most existing studies on DA contribute to learning domain-invariant feature representations for both domains by minimizing the domain gap based on convolution-based neural networks. Recently, vision transformers significantly improved performance in multiple vision tasks. Built on vision transformers, in this paper we propose a Bidirectional Cross-Attention Transformer (BCAT) for DA with the aim to improve the performance. In the proposed BCAT, the attention mechanism can extract implicit source and target mixup feature representations to narrow the domain discrepancy. Specifically, in BCAT, we design a weight-sharing quadruple-branch transformer with a bidirectional cross-attention mechanism to learn domain-invariant feature representations. Extensive experiments demonstrate that the proposed BCAT model achieves superior performance on four benchmark datasets over existing state-of-the-art DA methods that are based on convolutions or transformers.

研究の動機と目的

  • 既存のトランスフォーマーに基づくドメイン適応モデルにおける単方向アテンションの制限を克服し、ソースドメインとターゲットドメイン間で双方向の特徴相互作用を可能にする。
  • 自己アテンションとクロスアテンションを統合した共有アーキテクチャにより、より良い特徴の整合性を実現するドメイン不変表現学習を向上させる。
  • 厳密な疑似ラベル付けの制約に依存せずにドメイン差を低減し、現実世界のドメイン適応シナリオへの広範な適用性を実現する。
  • 標準のベンチマークデータセットにおいて、畳み込み型およびトランスフォーマー型の最先端手法を上回る優れた性能を達成する。

提案手法

  • 各ドメインの自己アテンションとドメイン間の双方向クロスアテンションを統合した4本のトランスフォーマーブロックを提案し、拡張された特徴表現を生成する。
  • すべての4本のブランチ(ソース自己、ターゲット自己、ソース→ターゲット、ターゲット→ソース)に重み共有アーキテクチャを採用することで、パラメータ効率とドメインの対称性を確保する。
  • ソースとターゲットの特徴表現間のドメインシフトを最小化するために、Maximum Mean Discrepancy(MMD)損失を用いる。
  • メモリと推論時間を削減しながら性能を維持するため、2つの効率的な推論モデル—Knowledge Distillation(BCAT-KD)とDynamic Token Fusion(BCAT-DTF)—を導入する。
  • 訓練中にクラスマッチドミニバッチを必要としないエンドツーエンドの自己教師付き学習でモデルを適用する。
  • 長距離の文脈モデリングと特徴の識別性を向上させるために、視覚トランスフォーマーベース(ViTおよびSwin)を特徴抽出器として活用する。

実験結果

リサーチクエスチョン

  • RQ1ソースドメインとターゲットドメイン間の双方向クロスアテンションは、単方向アテンションと比較してドメイン不変表現学習をどのように改善するか?
  • RQ2重み共有を採用した四重トランスフォーマーブロックは、ドメイン適応における特徴の整合性と転送性をどのように向上させるか?
  • RQ3自己アテンションと双方向クロスアテンションを統合することで、自己アテンションのみまたは単方向クロスアテンションよりも優れた性能が得られるか?
  • RQ4提案されたBCATモデルは、ResNetおよび視覚トランスフォーマーに基づく既存の最先端手法を、標準のドメイン適応ベンチマークで上回ることができるか?
  • RQ5提案された推論時最適化(BCAT-KDおよびBCAT-DTF)は、精度を損なわず、メモリ使用量と推論時間をどれほど効果的に削減できるか?

主な発見

  • BCATは4つのベンチマークデータセット(Office-Home、VisDA-2017、DomainNet)で最先端の性能を達成し、DomainNetでは平均86.5%、Office-Homeでは85.5%の精度を記録した。
  • 提案された双方向クロスアテンション機構は、単方向クロスアテンションや自己アテンションのみのベースラインを上回り、暗黙的な特徴ミキシングの有効性を実証した。
  • BCAT-KDおよびBCAT-DTFの推論モデルは、フルBCATモデルと比較してGPUメモリ使用量を最大50%削減し、推論速度を3倍以上に向上させながら、同等の精度を維持した。
  • MMD損失と疑似ラベル付け戦略が相乗効果を発揮し、MMDはすべてのデータセットとモデルで一貫した向上効果を示した。
  • アテンションマップの可視化により、BCATはソースのみのベースラインと比較して、関連する物体領域により正確に注目し、背景ノイズを効果的に抑制することが確認された。
  • アブレーションスタディの結果、双方向クロスアテンションと自己アテンションを組み合わせることで最高の性能が得られ、ドメイン内およびドメイン間アテンションの相乗効果が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。