Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Domain Adaptive Clustering for Semi-Supervised Domain Adaptation

Jichang Li, Guanbin Li|arXiv (Cornell University)|Apr 19, 2021
Domain Adaptation and Few-Shot Learning参考文献 27被引用数 7
ひとこと要約

本論文は、敵対的適応クラスタリング損失と信頼度ベースの疑似ラベル付けを用いて、ターゲットドメインにおける特徴クラスタリングを向上させる、新しい半教師ありドメイン適応手法であるCross-Domain Adaptive Clustering (CDAC)を提案する。ドメイン間でクラスタごとの特徴を整合させ、クラス固有のクラスターコアを強化することで、DomainNet、Office-Home、Officeベンチマークにおいて最先端の性能を達成し、従来手法よりも平均精度で最大25.3%の向上を達成した。

ABSTRACT

In semi-supervised domain adaptation, a few labeled samples per class in the target domain guide features of the remaining target samples to aggregate around them. However, the trained model cannot produce a highly discriminative feature representation for the target domain because the training data is dominated by labeled samples from the source domain. This could lead to disconnection between the labeled and unlabeled target samples as well as misalignment between unlabeled target samples and the source domain. In this paper, we propose a novel approach called Cross-domain Adaptive Clustering to address this problem. To achieve both inter-domain and intra-domain adaptation, we first introduce an adversarial adaptive clustering loss to group features of unlabeled target data into clusters and perform cluster-wise feature alignment across the source and target domains. We further apply pseudo labeling to unlabeled samples in the target domain and retain pseudo-labels with high confidence. Pseudo labeling expands the number of ``labeled" samples in each class in the target domain, and thus produces a more robust and powerful cluster core for each class to facilitate adversarial learning. Extensive experiments on benchmark datasets, including DomainNet, Office-Home and Office, demonstrate that our proposed approach achieves the state-of-the-art performance in semi-supervised domain adaptation.

研究の動機と目的

  • 既存の半教師ありドメイン適応手法が、ドメイン内クラスのサブ分布とドメイン間の特徴分布の両方を同時に整合できないという限界を解決すること。
  • ラベル付きサンプルが少ないためにターゲットドメインで弱く不安定なクラスターコアが生じる問題を克服すること。
  • 特徴の識別性を向上させ、ソースドメインとターゲットドメイン間の特徴不一致を低減することで、モデルの一般化性能を向上させること。
  • 敵対的クラスタリングと疑似ラベル付けを通じて、ドメイン間およびドメイン内適応を統合的に実現できるフレームワークを開発すること。

提案手法

  • 未ラベルのターゲット特徴をクラス固有のクラスタにグループ化するための敵対的適応クラスタリング(AAC)損失を導入し、ドメイン内適応を促進する。
  • 特徴抽出器に関してはAAC損失を最小化し、分類器に関しては最大化することで、ソースドメインとターゲットドメイン間のクラスタごとの特徴を整合する。
  • 信頼度ベースの疑似ラベル付けを用いて未ラベルターゲットサンプルにラベルを割り当て、各クラスの信頼性の高い「ラベル付き」サンプル数を増やし、クラスターコアを強化する。
  • ミニマックストレーニングによりモデルを最適化する:クラスタ形成のためのAAC損失を最小化し、ドメイン間整合のためのAAC損失を最大化する。
  • クロスエントロピー損失と組み合わせてAAC損失と疑似ラベル付け損失を統合し、特徴抽出器と分類器を同時に学習する。
  • t-SNE可視化を用いて、トレーニング中にクラスタごとの整合がどのように進行するかを確認する。

実験結果

リサーチクエスチョン

  • RQ1サンプルごとや分布ごとの整合よりも、ドメイン間でクラスタごとの特徴を整合させることで、半教師ありドメイン適応の性能が向上するか?
  • RQ2信頼度ベースの疑似ラベル付けは、ターゲットドメインのクラスターコアのロバスト性と代表性を向上させるか?
  • RQ3敵対的適応クラスタリングは、ドメイン間の特徴不一致をどれほど低減し、モデルの一般化性能を向上させるか?
  • RQ4低ショット設定下で、疑似ラベル付けと敵対的クラスタリングの組み合わせが性能に与える影響はどの程度か?

主な発見

  • CDACは、DomainNet、Office-Home、Officeベンチマークで最先端の性能を達成し、ベースラインより平均精度で最大25.3%の向上を達成した。
  • 敵対的適応クラスタリング損失は、ベースライン手法よりもクラスターコア距離(CCD)をより効果的に低減しており、優れたドメイン間クラスターアライメントを示している。
  • 疑似ラベル付けは高い正答率を示し、1ショット設定では1エポックあたり最大63.8%の未ラベルサンプルが正しい疑似ラベルを割り当てられた。
  • クロスエントロピー損失、AAC損失、疑似ラベル付け損失のすべてのコンポONENTを含むモデルが最も高い分類精度に達しており、各コンポonentの相乗効果を実証した。
  • t-SNE可視化により、トレーニング経過とともにターゲット特徴が対応するクラスターコアに徐々に収束し、ソースドメインのクラスタと整合することが確認された。
  • アブレーションスタディの結果、AAC損失のみを用いる場合と疑似ラベル付け損失のみを用いる場合に、それぞれ17.6%および23.4%の性能向上が得られ、全モデルが最良の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。