Skip to main content
QUICK REVIEW

[論文レビュー] Domain Adaptation via Maximizing Surrogate Mutual Information

Haiteng Zhao, Chang Ma|arXiv (Cornell University)|Oct 23, 2021
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、SOTA性能を達成する新しい教師なしドメイン適応フレームワーク、SIDAを提案する。SIDAは、ソースドメインとターゲットドメインの同一クラスの特徴間の代替相互情報量を最大化することで一般化性能を向上させる。ターゲットドメインを学習可能な代替分布でモデル化し、相互情報量と分布バイアスを用いてターゲットリスクの理論的上限を導出し、Office-31、Office-Home、VisDA-2017ベンチマークで最先端の性能を達成した。

ABSTRACT

Unsupervised domain adaptation (UDA) aims to predict unlabeled data from target domain with access to labeled data from the source domain. In this work, we propose a novel framework called SIDA (Surrogate Mutual Information Maximization Domain Adaptation) with strong theoretical guarantees. To be specific, SIDA implements adaptation by maximizing mutual information (MI) between features. In the framework, a surrogate joint distribution models the underlying joint distribution of the unlabeled target domain. Our theoretical analysis validates SIDA by bounding the expected risk on target domain with MI and surrogate distribution bias. Experiments show that our approach is comparable with state-of-the-art unsupervised adaptation methods on standard UDA tasks.

研究の動機と目的

  • 疑似ラベルと条件付きアライメントに依存する既存のクラスレベルのドメイン適応手法に理論的裏付けが欠けている問題に対処すること。
  • 同一クラスの特徴間の相互情報量を最大化することで、ドメイン間の特徴の判別能を向上させること。
  • ターゲットドメインにおける異なるクラスの特徴の混同を軽減し、一般化性能の低下を防ぐこと。
  • 相互情報量の最大化とターゲットドメインの期待リスク削減を結びつける理論的根拠に基づいたフレームワークを提供すること。

提案手法

  • SIDAは、類似学習に類似した目的関数を用いて、ソースドメインおよびターゲットドメインの同一クラス特徴間の相互情報量を最大化する。
  • ラベルなしのターゲットドメインをモデル化するための代替結合分布を構築し、データ選択とMI推定の柔軟性を向上させる。
  • 代替分布は、ラプラシアン損失とMI損失の勾配降下のバランスを保つことで、急激な崩壊を防ぐ拡散に類似た更新ルールで最適化される。
  • 共有された特徴抽出を持つ二重ストリームエンコーダとドメイン固有のバッチ正規化を用い、学習率スケジュールを用いたSGDで訓練する。
  • 目的関数は、相互情報量損失、補助的類似損失、およびラプラシアン正則化項を組み合わせ、訓練の安定化を図る。
  • K近傍グラフを用いてMI推定のための局所的近傍を定義し、代替分布をTステップにわたり繰り返し精錬する。

実験結果

リサーチクエスチョン

  • RQ1同一クラスの特徴間の相互情報量を最大化することは、教師なしドメイン適応におけるクロスドメイン一般化を向上させることができるか?
  • RQ2代替分布は、ターゲットドメイン適応における相互情報量推定の安定性と性能をどのように向上させるか?
  • RQ3相互情報量、代替分布バイアス、およびターゲットドメインの期待リスクとの理論的関係は何か?
  • RQ4相互情報量の最大化は、既存の条件付きアライメント手法と比較して、より優れた特徴の判別能をもたらすか?
  • RQ5理論的裏付けのあるMIベースのフレームワークは、標準ベンチマークで最先端のクラスレベルUDAモデルを上回ることができるか?

主な発見

  • SIDAは、Office-31、Office-Home、VisDA-2017ベンチマークで最先端の性能を達成し、既存のクラスレベルのドメイン適応手法を上回った。
  • Office-31のD→AおよびW→Aタスクにおいて、t-SNE可視化の結果、SIDAはResNet-50やCDANよりもはるかに判別能の高い特徴表現を生成した。
  • 可視化結果は、SIDAがターゲットドメインにおけるクラス内凝集性の向上とクラス間分離性の強化を実現していることを確認した。
  • VisDA-2017でα₁=3.0およびα₂=1.0を設定したモデルは、比較したすべての手法の中で最高のテスト精度を達成した。
  • 理論的分析により、ターゲットドメインの期待リスクに上界が存在し、それが相互情報量と代替分布バイアスに依存することを確立した。これにより、フレームワークの一般化能力が裏付けられた。
  • 代替分布に対する拡散に類似た更新ルールは、急激な崩壊を防ぎ、訓練の安定性を高めた。最適化プロセスの安定収束がその効果を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。