[論文レビュー] Exploiting Both Domain-specific and Invariant Knowledge via a Win-win Transformer for Unsupervised Domain Adaptation
本稿では、非教師ありドメイン適応のためのWin-win TransformerフレームワークであるWinTRを提案する。WinTRは、ソースドメインおよびターゲットドメインそれぞれに個別の分類器を用いてドメイン固有の知識を別々に学習するとともに、ソースガイドドラベル精錬とシングルサイド特徴アライメントを通じてクロスドメイン知識移行を実現する。実験の結果、WinTRはSOTA性能を達成し、DomainNetでは先行手法を最大で12.2%上回り、CNNよりも優れた移行性を示している。
Unsupervised Domain Adaptation (UDA) aims to transfer knowledge from a labeled source domain to an unlabeled target domain. Most existing UDA approaches enable knowledge transfer via learning domain-invariant representation and sharing one classifier across two domains. However, ignoring the domain-specific information that are related to the task, and forcing a unified classifier to fit both domains will limit the feature expressiveness in each domain. In this paper, by observing that the Transformer architecture with comparable parameters can generate more transferable representations than CNN counterparts, we propose a Win-Win TRansformer framework (WinTR) that separately explores the domain-specific knowledge for each domain and meanwhile interchanges cross-domain knowledge. Specifically, we learn two different mappings using two individual classification tokens in the Transformer, and design for each one a domain-specific classifier. The cross-domain knowledge is transferred via source guided label refinement and single-sided feature alignment with respect to source or target, which keeps the integrity of domain-specific information. Extensive experiments on three benchmark datasets show that our method outperforms the state-of-the-art UDA methods, validating the effectiveness of exploiting both domain-specific and invariant
研究の動機と目的
- 既存のUDA手法がソースドメインとターゲットドメインの両方に同一の分類器を強制するため、ドメイン固有の特徴表現力が損なわれるという制限に対処すること。
- 畳み込みニューラルネットワーク(CNN)と比較して、ビジョンTransformerが、ドメイン内知識をよりよく保持しながら効果的なクロスドメイン知識移行を可能にするかを検討すること。
- UDAにおけるドメイン不変表現学習とドメイン固有特徴学習の間にある本質的トレードオフを解消すること。
- 共有バックボーンとクロスドメイン知識 distillation を用いた疑似ラベル精錬による2つの分類ヘッドを別々に使用する手法の有効性を検証すること。
提案手法
- ビジョンTransformerバックボーン(DeiT)を採用し、ソース用とターゲット用の分類トークンを別々に設けることで、ドメイン固有の表現を別々に学習可能にする。
- ソース分類器の予測を用いてターゲットの疑似ラベル品質を向上させる、ソースガイドドラベル精錬機構を導入する。
- 一方のドメインの特徴を他方のドメインにアライメントするシングルサイド特徴アライメントを適用する(例:ターゲットをソースにアライメント)が、ストップグラデント操作によりドメイン固有の特徴を保持する。
- 訓練は2段階で実施する:まず、ImageNetで事前学習された重みを用いてソースのみのモデルを訓練し、初期のターゲット疑似ラベルを生成する。次に、モデルを再初期化し、ドメイン固有の分類器とコントラスト型損失を用いて共同最適化を実行する。
- コントラスト型損失は、ソースおよびターゲットの特徴に対して独立に計算され、逆方向のドメイン特徴の勾配を停止することでドメイン固有の整合性を維持する。
- 最新のモデル予測を用いてトレーニング中に繰り返し疑似ラベルを更新することで、一貫性とロバスト性を向上させる。
実験結果
リサーチクエスチョン
- RQ11つのTransformerバックボーンに2つの別々の分類ヘッドを用いることで、非教師ありドメイン適応においてドメイン固有およびドメイン不変の特徴を効果的に学習できるか?
- RQ2CNNと比較してビジョンTransformerを用いることで、特に大きなドメインシフト下でも移行性が向上するか?
- RQ3ソースガイドドラベル精錬とシングルサイド特徴アライメントを併用することで、ドメイン固有の特徴表現力を損なわず、知識移行を向上させられるか?
- RQ4TransformerベースのUDAフレームワークにおいて、ラベルなしターゲットデータと疑似ラベルのみを用いて、専用のターゲット分類器を訓練することが可能でかつ有効であるか?
主な発見
- WinTR-BはDomainNetベンチマークで平均46.8%の正確度を達成し、DeiT-Bバックボーンよりも12.2%高い。
- WinTR-SはCDTrans-Bを平均4.8%上回り、DomainNetにおいてすべてのResNet-50ベースのUDA手法を上回っている。
- Office-HomeではWinTRがSOTA性能を達成し、CNNベースのモデルと比較して顕著な移行性の向上を示している。
- 可視化結果から、ビジョンTransformerはCNNがしばしば背景やスタイルのアーティファクトに注目するのに対し、ターゲットドメインの関連対象に的を絞っていることがわかった。
- アブレーションスタディにより、ソースガイドドラベル精錬とシングルサイド特徴アライメントの両方が性能向上に顕著に寄与していることが確認された。
- 本手法は、特に大きなドメインシフト(例:Office-HomeのAr → Cl)下でも優れたロバスト性を示しており、CNNは主要対象に注目できていない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。