Skip to main content
QUICK REVIEW

[論文レビュー] Open Set Domain Adaptation: Theoretical Bound and Algorithm

Zhen Fang, Jie Lü|arXiv (Cornell University)|Jul 19, 2019
Domain Adaptation and Few-Shot Learning参考文献 50被引用数 10
ひとこと要約

本稿は、オープンセットドメイン適応(UOSDA)のための最初の理論的学習境界を提案し、未知クラスにおけるリスクを定量化するための新しい概念「オープンセット差分」を導入する。この境界に基づき、オープンセット差分を最小化する分布整合化手法DAODを構築し、ラベルなしの未知のターゲットサンプルを効果的に同定することで、ベンチマークデータセットにおいて最先端の性能を達成する。

ABSTRACT

The aim of unsupervised domain adaptation is to leverage the knowledge in a labeled (source) domain to improve a model's learning performance with an unlabeled (target) domain -- the basic strategy being to mitigate the effects of discrepancies between the two distributions. Most existing algorithms can only handle unsupervised closed set domain adaptation (UCSDA), i.e., where the source and target domains are assumed to share the same label set. In this paper, we target a more challenging but realistic setting: unsupervised open set domain adaptation (UOSDA), where the target domain has unknown classes that are not found in the source domain. This is the first study to provide a learning bound for open set domain adaptation, which we do by theoretically investigating the risk of the target classifier on unknown classes. The proposed learning bound has a special term, namely open set difference, which reflects the risk of the target classifier on unknown classes. Further, we present a novel and theoretically guided unsupervised algorithm for open set domain adaptation, called distribution alignment with ppen difference (DAOD), which is based on regularizing this open set difference bound. The experiments on several benchmark datasets show the superior performance of the proposed UOSDA method compared with the state-of-the-art methods in the literature.

研究の動機と目的

  • ソースドメインとターゲットドメインの間でラベル集合が共有されていると仮定する従来の自己教師付きドメイン適応手法の制限を解決すること。
  • ソースドメインに存在しないターゲットドメインの未知クラスを含む、現実的ではあるが挑戦的な設定である自己教師付きオープンセットドメイン適応(UOSDA)に取り組むこと。
  • 未知クラスにおけるリスクを明示的に考慮する学習境界を導出することで、UOSDAに理論的基盤を提供すること。
  • 導出された境界を活用した原理的かつ理論的根拠に基づくアルゴリズムを設計し、一般化性能を向上させるとともに、UOSDAにおける負のトランスファーを低減すること。

提案手法

  • 未知クラスにおけるリスクを反映する新しい項「オープンセット差分」としての、UOSDAの理論的学習境界を導出する。
  • オープンセット差分項を最小化するDAOD(オープン差分を用いた分布整合化)を提案する。
  • ドメイン整合化による分布乖離の最小化と、オープンセット差分の正則化を統合し、ソースとターゲットドメインを同時に整合化するとともに、未知サンプルを同定する。
  • 埋め込み分布に基づいて、${\rm OSNN}^{cv}$を用いた信頼度ベースのしきい値処理により、既知のサンプルと未知のサンプルを区別する。
  • 多様体正則化と重み減衰($\sigma$)を組み込み、過学習を防ぎ、一般化性能を向上させる。
  • ドメイン整合、オープンセット差分、正則化項をバランスさせる多成分損失関数を用いてアルゴリズムを最適化する。

実験結果

リサーチクエスチョン

  • RQ1自己教師付きオープンセットドメイン適応における理論的一般化境界は何か? そして、クローズドセットドメイン適応の境界とはどのように異なるか?
  • RQ2自己教師付き設定において、ターゲットドメインにおける未知クラスのリスクを形式的に定量化し、最小化することは可能か?
  • RQ3理論的根拠に基づいたアルゴリズムを設計することで、未知のターゲットサンプルを効果的に同定し、同時にソースとターゲットドメインの分布を整合化することは可能か?
  • RQ4オープンセット差分、分布乖離、正則化項の各々が、強固なUOSDA性能を達成するために果たす相対的寄与度は何か?

主な発見

  • DAODは、複数のベンチマークデータセットで最先端の性能を達成し、既存のSOTA手法を上回る。
  • オープンセット差分項は、未知ターゲットサンプルの同定に不可欠であり、その寄与を除去すると性能が著しく低下する。
  • アルゴリズムは急速に収束し、10イテレーション以内に安定した性能に達するため、優れた学習効率を示す。
  • ハイパーパramータ感度分析の結果、$\alpha \approx 0.3$ および $\gamma \approx 0.3$ で最適な性能が得られ、$\alpha > 0.4$ または $\gamma < 0.15$ になると性能が急激に低下する。
  • 多様体正則化($\rho$)は性能にほとんど寄与せず、5から50の範囲の値ですらわずかに性能を低下させる傾向があるが、拡張実験では依然として必要不可欠である。
  • 重み減衰($\sigma$)は過学習を防ぐために極めて重要であり、$\sigma = 0$ の場合、性能が著しく低下する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。