Skip to main content
QUICK REVIEW

[論文レビュー] Safe Self-Refinement for Transformer-based Domain Adaptation

Tong Sun, Cheng Lu|arXiv (Cornell University)|Apr 16, 2022
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本論文は、視覚変換器(ViT)バックボーンと、摂動を加えたターゲットデータを用いた安全な自己精錬戦略を組み合わせた、新しい教師なしドメイン適応(UDA)手法SSRTを提案する。摂動された潜在トークンからの予測にKLダイバージェンスに基づく正則化を適用し、適応的で安全な訓練メカニズムを採用することで、一般化性能が向上し、Office-Homeで85.43%、VisDA-2017で88.76%、DomainNetで45.2%の最先端性能を達成した。

ABSTRACT

Unsupervised Domain Adaptation (UDA) aims to leverage a label-rich source domain to solve tasks on a related unlabeled target domain. It is a challenging problem especially when a large domain gap lies between the source and target domains. In this paper we propose a novel solution named SSRT (Safe Self-Refinement for Transformer-based domain adaptation), which brings improvement from two aspects. First, encouraged by the success of vision transformers in various vision tasks, we arm SSRT with a transformer backbone. We find that the combination of vision transformer with simple adversarial adaptation surpasses best reported Convolutional Neural Network (CNN)-based results on the challenging DomainNet benchmark, showing its strong transferable feature representation. Second, to reduce the risk of model collapse and improve the effectiveness of knowledge transfer between domains with large gaps, we propose a Safe Self-Refinement strategy. Specifically, SSRT utilizes predictions of perturbed target domain data to refine the model. Since the model capacity of vision transformer is large and predictions in such challenging tasks can be noisy, a safe training mechanism is designed to adaptively adjust learning configuration. Extensive evaluations are conducted on several widely tested UDA benchmarks and SSRT achieves consistently the best performances, including 85.43% on Office-Home, 88.76% on VisDA-2017 and 45.2% on DomainNet.

研究の動機と目的

  • ソースドメインとターゲットドメインの間で顕著な差異が生じる教師なしドメイン適応(UDA)における、大きなドメインギャップの課題に対処すること。
  • 従来のCNNバックボーンを上回る、視覚変換器(ViT)の強力な特徴表現能力を活用して、UDAにおける転送可能性を向上させること。
  • 特に、大きなドメインシフトによりターゲットデータの予測がノイズが多くなる状況下でも、モデルの崩壊を防ぐ強力な訓練メカニズムを開発すること。
  • 摂動を加えたターゲットサンプルからの予測を制御的・適応的に用いて、モデルの精錬を実施することで、ソースドメインからターゲットドメインへの知識転送を向上させること。

提案手法

  • ソースドメインおよびターゲットドメインの両方から強力で転送可能な特徴を抽出するために、視覚変換器(ViT-B/16)をバックボーンとして採用する。
  • 訓練中にターゲットドメインデータの潜在トークン系列にランダムオフセットの摂動を加えることで、敵対的ビューを生成する。
  • 元のサンプルと摂動されたサンプルの予測差を最小化するために、カルバック・ライブラー(KL)ダイバージェンスを用いる。これにより、ロバストネスと一貫性が強化される。
  • 変換器ブロック間でマルチレイヤーの摂動と双方向の監視を実装し、特徴の精錬を強化する。
  • ターゲットデータにおける予測の多様性を監視することでモデルの崩壊を検出する安全な訓練メカニズムを導入し、構成のリセットを伴うモデルロールバックをトリガーする。
  • 動的多様性測定を用いて訓練中にハイパーパrameterを適応的に調整することで、手動チューニングを回避し、困難なタスクにおける信頼性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1大きなドメインシフト下でも、視覚変換器は、畳み込みネットワークを上回って教師なしドメイン適応で性能を発揮できるか?
  • RQ2高容量のモデル(例:視覚変換器)を用いた自己訓練において、ノイズの多いターゲット予測の下で、モデルの崩壊をどのように防止できるか?
  • RQ3KL正則化を用いた摂動ベースの自己精錬は、UDAにおける一般化性能とロバストネスを向上させるか?
  • RQ4適応的かつ動的訓練戦略は、手動でのハイパーパrameterチューニングなしに、多様なUDAベンチマークで性能を向上させられるか?
  • RQ5提案された安全な自己精錬戦略は、Mixup や VAT などの既存のSSLベース手法と比較して、ドメイン適応設定で優れているか?

主な発見

  • SSRTは、Office-Homeベンチマークで85.43%のトップ1精度を達成し、ResNetバックボーンを用いた従来のSOTAを上回った。
  • VisDA-2017では88.76%の精度に達し、大規模かつ困難なドメインギャップを有するベンチマークで強力な一般化性能を示した。
  • DomainNetでは平均45.2%の精度を達成し、従来のSOTA(ResNet-101を用いた33.3%)に対して顕著な改善を示した。
  • アブレーションスタディの結果、安全な訓練メカニズムが、Pr→Cl や Cl→Pr のような困難な適応タスクにおける性能劣化を防止していることが確認された。
  • パram数が少ない(22M)にもかかわらず、ViT-smallバージョン(SSRT-S)は、ResNet-101(45Mパラメータ)を用いたMDD+SCDAを5.1%上回った。
  • 実証的分析により、SSRTは推論時における摂動に対してよりロバストであることが確認され、摂動の大きさがα=0.4に達しても高い精度を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。