Skip to main content
QUICK REVIEW

[論文レビュー] Nearest Neighborhood-Based Deep Clustering for Source Data-absent Unsupervised Domain Adaptation

Song Tang, Yan Yang|arXiv (Cornell University)|Jul 27, 2021
Domain Adaptation and Few-Shot Learning参考文献 54被引用数 7
ひとこと要約

本稿では、プライバシーまたはセキュリティ上の制約によりソースデータが利用できない状況における教師なしドメイン適応(SAUDA)のため、最近傍に基づく深層クラスタリング手法を提案する。幾何的制約を用いて最近傍の意味的整合性(SCNNH)と意味的ハイパーネアレストネIGHボラヒューリティ(SHNNH)を活用することで、クラスタリングの頑健性が向上し、最先端の性能を達成した。特に大規模なVisDA-Cにおいて、先行手法と比較して平均精度で3.0%の向上を達成した。

ABSTRACT

In the classic setting of unsupervised domain adaptation (UDA), the labeled source data are available in the training phase. However, in many real-world scenarios, owing to some reasons such as privacy protection and information security, the source data is inaccessible, and only a model trained on the source domain is available. This paper proposes a novel deep clustering method for this challenging task. Aiming at the dynamical clustering at feature-level, we introduce extra constraints hidden in the geometric structure between data to assist the process. Concretely, we propose a geometry-based constraint, named semantic consistency on the nearest neighborhood (SCNNH), and use it to encourage robust clustering. To reach this goal, we construct the nearest neighborhood for every target data and take it as the fundamental clustering unit by building our objective on the geometry. Also, we develop a more SCNNH-compliant structure with an additional semantic credibility constraint, named semantic hyper-nearest neighborhood (SHNNH). After that, we extend our method to this new geometry. Extensive experiments on three challenging UDA datasets indicate that our method achieves state-of-the-art results. The proposed method has significant improvement on all datasets (as we adopt SHNNH, the average accuracy increases by over 3.0% on the large-scaled dataset). Code is available at https://github.com/tntek/N2DCX.

研究の動機と目的

  • プライバシーやセキュリティ上の制約によりソースデータが利用できない状況における教師なしドメイン適応の課題に対処すること。
  • 個々のデータに依存する深層クラスタリングの限界を克服し、偽ラベルの誤りに強く、頑健性に優れた手法を提供すること。
  • 特徴空間内の局所的な幾何的構造を活用することで、クラスタリングの安定性を向上させること。
  • 最近傍の幾何構造に基づく新しいクラスタリング目的関数を構築し、ドメイン適応の性能を向上させること。
  • ソースデータにアクセスできない状況下で、幾何学的制約が自己教師ありドメイン適応にどのように寄与するかを実証すること。

提案手法

  • 局所的なデータネighborhoodにおける一貫性を強制する新しい幾何的制約、すなわち最近傍の意味的整合性(SCNNH)を提案する。
  • クラスタリングの基本単位を個々のデータポイントから最近傍グループ(NNH)に再定式化することで、頑健性を向上させる。
  • 意味的信頼性制約を組み込んだ、より洗練された構造、意味的ハイパーネアレストネIGHボラヒューリティ(SHNNH)を導入する。
  • 特徴空間における空間的近接性と意味的整合性を活用する幾何学的注意の目的関数を構築する。
  • ホムサンプルを検出するためのチェーンサーチ機構を用い、ネIGHボラヒューリティ構造の反復的精錬を通じてクラスタリングを改善する。
  • 偽ラベル付けと幾何学的正則化を組み合わせた自己教師あり目的関数を用いて、ターゲットモデルをエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1局所的なデータネighborhoodから導出される幾何的制約は、ソースデータが入手不可なドメイン適応におけるクラスタリングの頑健性を向上させることができるか?
  • RQ2個々のデータポイントのクラスタリングと比較して、最近傍ネighborhoodレベルでのクラスタリングは、精度と安定性においてどのように異なるか?
  • RQ3意味的信頼性とインターセクションベースの検出が、SAUDAにおけるクラスタリング性能に与える影響は何か?
  • RQ4ソースデータが入手不可な状況下で、幾何学的目的関数は、標準的なドメインアライメントや偽ラベル付け手法を上回ることができるか?
  • RQ5局所的なユークリッド構造は、深層クラスタリングにおける自己教師ありドメイン適応に、どの程度寄与するか?

主な発見

  • 提案手法は、Office-31、Office-Home、VisDA-Cの3つのベンチマークデータセットにおいて、最先端の性能を達成した。
  • 大規模なVisDA-Cデータセットにおいて、前回の最先端手法と比較して平均精度を3.0%以上向上させ、顕著な向上を示した。
  • アブレーションスタディの結果、SCNNHおよびSHNNHの両成分が不可欠であることが確認され、チェーンサーチや信頼性グループ化を除いた変種と比較して、N2DC-EXが優れた性能を示した。
  • 完全な手法(N2DC-EX)は、Office-31で90.0%、Office-Homeで73.1%、VisDA-Cで85.8%の精度を達成し、すべてのアブレーション変種を上回った。
  • インターセクションベースの信頼性検出を組み込んだSHNNH(N2DC-EX-Ce/Cd)は強力な性能を示し、特にN2DC-EX-CeはOffice-31で89.9%、VisDA-Cで84.6%の精度を達成した。
  • 本手法は、小規模(Office-31)および大規模(VisDA-C)の両方のベンチマークで一貫した向上を示し、スケールに依存しない頑健性を有している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。