Skip to main content
QUICK REVIEW

[論文レビュー] Transformer-Based Source-Free Domain Adaptation

Guanglei Yang, Hao Tang|arXiv (Cornell University)|May 28, 2021
Domain Adaptation and Few-Shot Learning参考文献 70被引用数 21
ひとこと要約

本稿では、オブジェクト領域への注目を促進することでモデルの汎化能力を向上させる、ソースフリー領域適応のためのTransformerベースのフレームワーク、TransDAを提案する。畳み込みバックボーンにTransformerモジュールを統合し、疑似ラベルを用いた自己教師付き知識蒸留を適用することで、注目度の向上と、クローズドセット、パーシャルセット、オープンセットの適応ベンチマークにおいて最先端の性能を達成する。

ABSTRACT

In this paper, we study the task of source-free domain adaptation (SFDA), where the source data are not available during target adaptation. Previous works on SFDA mainly focus on aligning the cross-domain distributions. However, they ignore the generalization ability of the pretrained source model, which largely influences the initial target outputs that are vital to the target adaptation stage. To address this, we make the interesting observation that the model accuracy is highly correlated with whether or not attention is focused on the objects in an image. To this end, we propose a generic and effective framework based on Transformer, named TransDA, for learning a generalized model for SFDA. Specifically, we apply the Transformer as the attention module and inject it into a convolutional network. By doing so, the model is encouraged to turn attention towards the object regions, which can effectively improve the model's generalization ability on the target domains. Moreover, a novel self-supervised knowledge distillation approach is proposed to adapt the Transformer with target pseudo-labels, thus further encouraging the network to focus on the object regions. Experiments on three domain adaptation tasks, including closed-set, partial-set, and open-set adaption, demonstrate that TransDA can greatly improve the adaptation accuracy and produce state-of-the-art results. The source code and trained models are available at https://github.com/ygjwd12345/TransDA.

研究の動機と目的

  • 事前学習済みソースモデルの汎化能力を軽視する既存のソースフリー領域適応(SFDA)手法の限界を解決すること。
  • SFDAにおけるオブジェクト領域への注目度とモデルの正確性の相関関係を調査すること。
  • ソースデータを必要とせずに、注目メカニズムの強化によってターゲットドメインにおけるモデルの汎化能力を向上させること。
  • ターゲットの疑似ラベルを用いた自己教師付き知識蒸留戦略を考案し、注目度を精緻化すること。
  • クローズドセット、パーシャルセット、オープンセットの多様なSFDA設定において、有効性を実証すること。

提案手法

  • ResNet-50バックボーンの最終畳み込み層の直後にビジョンTransformerモジュールを挿入し、長距離依存性をモデル化し、オブジェクト領域への注目を促進する。
  • Grad-CAM可視化を用いて、オブジェクト領域への注目度が高いほどターゲットドメインでの予測正確性が向上することを実証的に検証する。
  • ターゲットの疑似ラベルを用いた自己教師付き知識蒸留を適用し、学生モデルが自身の予測から学ぶことで、さらに注目度を精緻化する。
  • 指数移動平均(EMA)を用いた教師-学生トレーニング戦略を導入して知識蒸留の安定性を向上させるが、アブレーションでは主な向上は蒸留に起因しており、教師モデルそのものによるものではないことが示された。
  • 疑似ラベルにおけるクロスエントロピー損失と知識蒸留損失を統合し、特徴の整合性を保ちつつ注目度の向上を図る。
  • クローズドセット、パーシャルセット、オープンセットの設定下で、Office-31、Office-Home、VisDAの3つのSFDAベンチマークで手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1ソースフリー領域適応におけるオブジェクト領域への注目度は、モデルの正確性にどのように影響するか?
  • RQ2CNNバックボーンにTransformerモジュールを統合することで、未学習のターゲットドメインにおける汎化能力が向上するか?
  • RQ3疑似ラベルを用いた自己教師付き知識蒸留は、さらに注目度と適応性能を向上させるか?
  • RQ4提案手法は、さまざまなドメインシフト設定における最先端のSFDAアプローチと比較して、どのように差をつけるか?
  • RQ5性能向上は、より良い注目度のおかげなのか、それとも蒸留メカニズムそのものの効果によるものなのか?

主な発見

  • TransDAは、3つのSFDAベンチマークすべてで最先端の性能を達成した。Office-Home(クローズドセット)では79.3%の正確性を達成し、前回の最先端手法の71.8%から向上した。
  • VisDAデータセットでは、オープンセット設定で正確性を81.9%から87.6%まで向上させ、強力な汎化能力を示した。
  • アブレーションスタディにより、Transformerモジュールの追加により、Office-Homeで正確性が72.1%から78.8%に向上したことが確認され、一貫した向上が得られた。
  • 自己知識蒸留によりさらに性能が向上し、Office-Homeでは78.8%から79.3%に正確性が向上した。これにより、その有効性が裏付けられた。
  • Grad-CAM可視化により、TransDAはベースラインモデルと比較して、オブジェクト領域への注目度が顕著に向上していることが示された。
  • t-SNE可視化により、クラス内での特徴がよりコンパクトになり、ソースとターゲット間のドメインギャップが縮小していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。