Skip to main content
QUICK REVIEW

[論文レビュー] Combating Domain Shift with Self-Taught Labeling.

Jian Liang, Dapeng Hu|arXiv (Cornell University)|Jul 8, 2020
Domain Adaptation and Few-Shot Learning参考文献 39被引用数 1
ひとこと要約

本論文では、非パラメトリックな近傍集約戦略を用いて偏りのない正確な偽ラベルを生成することで、ターゲットドメインへの一般化を向上させる、新しいドメイン適応手法Self-Taught Labeling (SeTL) を提案する。特徴量とソフトラベルのメモリバンクを活用することで、ターゲットドメインのラベルに依存せずにモデル性能を向上させ、複数のベンチマークで既存のドメインアライメント手法を上回る性能を発揮する。

ABSTRACT

We present a novel method to combat domain shift when adapting classification models trained on one domain to other new domains with few or no target labels. In the existing literature, a prevailing solution paradigm is to learn domain-invariant feature representations so that a classifier learned on the source features generalizes well to the target features. However, such a classifier is inevitably biased to the source domain by overlooking the structure of the target data. Instead, we propose Self-Taught Labeling (SeTL), a new regularization approach that finds an auxiliary target-specific classifier for unlabeled data. During adaptation, this classifier is able to teach the target domain itself by providing \emph{unbiased accurate} pseudo labels. In particular, for each target data, we employ the memory bank to store the feature along with its soft label from the domain-shared classifier. Then we develop a non-parametric neighborhood aggregation strategy to generate new pseudo labels as well as confidence weights for unlabeled data. Though simply using the standard classification objective, SeTL significantly outperforms existing domain alignment techniques on a large variety of domain adaptation benchmarks. We expect that SeTL can provide a new perspective of addressing domain shift and inspire future research of domain adaptation and transfer learning.

研究の動機と目的

  • ドメイン不変特徴量学習の限界を解決する。これは、ターゲットデータの構造を無視することで、しばしばソースドメインにバイアスをもたらす。
  • ラベル付き例がほとんどないもしくは存在しない低リソースのターゲットドメインにおけるモデルの一般化を向上させること。
  • ターゲットドメインが正確な偽ラベルを通じて自己学習できる自己教師付きラベリングメカニズムを開発すること。
  • 特徴量アライメントを超えて、ターゲット固有の分類器学習を含むドメイン適応の新たな視点を提供すること。

提案手法

  • 適応段階で、各ターゲットサンプルについて、ドメイン共有分類器から得た特徴量とソフトラベルをメモリバンクに格納する。
  • 特徴空間における類似サンプルの集約を用いて、非パラメトリックな近傍集約戦略により新しい偽ラベルを生成する。
  • 近隣の特徴量の近接性と一貫性に基づいて、偽ラベルに信頼度重みを付与する。
  • 生成された偽ラベルと標準的な交差エントロピー分類損失を用いて、ターゲット固有の分類器を訓練する。
  • メモリバンクと近傍集約を用いて、繰り返し偽ラベルと分類器の予測を精緻化する。
  • 共有学習とターゲット固有学習を組み合わせることで、ソースドメインの知識とターゲットドメインの構造の間のバランスを保つ。

実験結果

リサーチクエスチョン

  • RQ1ターゲットアノテーションに依存せず、偏りのない偽ラベルを生成することで、自己学習ラベリングアプローチがドメイン適応性能を向上させられるか?
  • RQ2特徴空間における近傍集約は、ターゲットデータの偽ラベル品質をどのように向上させるか?
  • RQ3ゼロショットまたはフェイントショットのドメイン適応設定において、SeTLは従来のドメインアライメント手法をどの程度上回るか?
  • RQ4メモリバンクメカニズムは、自己ラベリングの繰り返しにおいて、信頼性の高いソフトラベルを効果的に保持・伝達できるか?

主な発見

  • SeTLは、広範なドメイン適応ベンチマークで、既存のドメインアライメント手法を顕著に上回る性能を発揮する。
  • 近傍集約を用いて正確で偏りのない偽ラベルを生成することで、SeTLは最先端の性能を達成する。
  • ソフトラベルを備えたメモリバンクの使用により、複数の学習イテレーションにわたり安定的かつ一貫性のある偽ラベリングが可能になる。
  • SeTLはターゲットドメインの構造を捉えることで、ソースのみの特徴量学習に起因するバイアスを低減し、一般化性能を向上させる。
  • 最小限または全くラベルのないターゲットデータでも強力な性能を維持するため、低リソース環境でのロバスト性を示す。
  • 非パラメトリックな近傍集約戦略は、局所的な特徴量類似性を活用することで、信頼性の高い偽ラベルを効果的に同定する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。