Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Source Domain Adaptation and Semi-Supervised Domain Adaptation with Focus on Visual Domain Adaptation Challenge 2019

Yingwei Pan, Yehao Li|arXiv (Cornell University)|Oct 8, 2019
Domain Adaptation and Few-Shot Learning参考文献 18被引用数 5
ひとこと要約

本論文は、VisDA-2019 チャレンジにおいて、マルチソースおよび半教師ありドメイン適応のためのハイブリッド手法を提示する。この手法は、CycleGAN を用いたピクセルレベルの適応と、一般化交差エントロピー損失を用いたアンサンブルモデルによる特徴レベルの適応を組み合わせるものである。本手法は最先端の性能を達成し、イテレーティブな EEA および FFA モジュールを用いて高解像度の入力を使用することで、クリップアートのテストセットで 81.61% のトップ-1 正答率、全テストセットの平均正答率で 75.96% を達成した。

ABSTRACT

This notebook paper presents an overview and comparative analysis of our systems designed for the following two tasks in Visual Domain Adaptation Challenge (VisDA-2019): multi-source domain adaptation and semi-supervised domain adaptation. Multi-Source Domain Adaptation: We investigate both pixel-level and feature-level adaptation for multi-source domain adaptation task, i.e., directly hallucinating labeled target sample via CycleGAN and learning domain-invariant feature representations through self-learning. Moreover, the mechanism of fusing features from different backbones is further studied to facilitate the learning of domain-invariant classifiers. Source code and pre-trained models are available at \url{https://github.com/Panda-Peter/visda2019-multisource}. Semi-Supervised Domain Adaptation: For this task, we adopt a standard self-learning framework to construct a classifier based on the labeled source and target data, and generate the pseudo labels for unlabeled target data. These target data with pseudo labels are then exploited to re-training the classifier in a following iteration. Furthermore, a prototype-based classification module is additionally utilized to strengthen the predictions. Source code and pre-trained models are available at \url{https://github.com/Panda-Peter/visda2019-semisupervised}.

研究の動機と目的

  • 複数のソースドメインと限られたラベル付きターゲットデータが存在する状況におけるドメインシフトの課題に対処すること。
  • ピクセルレベルと特徴レベルの適応技術を組み合わせることで、モデルの一般化性能を向上させること。
  • 疑似ラベル付けとプロトタイプベース分類を用いたイテレーティブ自己学習を活用した、半教師ありドメイン適応のための堅牢なフレームワークを開発すること。
  • 複数のディープバックボーンにおける特徴統合の有効性を検証し、ドメイン不変表現の学習を促進すること。
  • マルチソースおよび半教師ありドメイン適応の両タスクにおいて、VisDA-2019 ベンチマークで最先端の性能を達成すること。

提案手法

  • CycleGAN を用いて、無教師のピクセルレベルの適応を実行し、ソースドメインの画像(例:スケッチ、リアル)をターゲットドメインのスタイル(例:クリップアート、絵画)に変換することで、合成ラベル付きデータを生成する。
  • 多様なバックボーン(例:EfficientNet-B7、Inception-ResNet-v2)を用いて 8 つのソースオンリーモデルを訓練し、それらの予測を平均化して、ラベルなしターゲットサンプルの初期疑似ラベルを生成する。
  • エンドツーエンド適応(EEA)モジュールを実装し、疑似ラベル付きターゲットデータに対して一般化交差エントロピー損失を用いて、モデルをエンドツーエンドで微調整する。
  • 特徴統合ベース適応(FFA)モジュールを設計し、すべてのバックボーンのペア間で特徴を統合するバイリニアープールを用い、36 個の分類器(28 個の統合済み、8 個の単体)を訓練することで、ドメイン不変特徴の学習を強化する。
  • EEA と FFA モジュールを繰り返し交互に適用することで、疑似ラベルを精緻化し、モデルのロバストネスを向上させる。
  • 半教師あり適応において、予測の信頼性を高め、一般化性能を改善するために、プロトタイプベース分類モジュールを統合する。

実験結果

リサーチクエスチョン

  • RQ1CycleGAN を用いた複数のソースドメインと合成データの統合は、マルチソースドメイン適応における性能向上にどのように寄与するか?
  • RQ2自己学習におけるドメイン適応において、一般化交差エントロピー損失と標準交差エントロピー損失の違いは何か?
  • RQ3多様なディープバックボーン間での特徴統合は、ドメイン不変表現の学習をどの程度向上させるか?
  • RQ4EEA と FFA モジュールを交互に適用することで疑似ラベルをイテレーティブに精緻化することは、最終的なモデル正答率にどのように影響するか?
  • RQ5最小限のラベル付きターゲットデータを前提とした半教師ありドメイン適応において、プロトタイプベース分類はさらなる性能向上をもたらすか?

主な発見

  • 4 回のイテレーションと高解像度入力を用いたハイブリッド EEA+FFA システムは、クリップアートのテストセットで 81.61% のトップ-1 正答率、VisDA-2019 全テストセットの平均正答率で 75.96% を達成した。
  • CycleGAN を用いて合成されたソースに似た画像(例:リアル*)を生成することで、スケッチ検証セットにおけるソースオンリーモデルの正答率が 53.30% から 63.01% に向上した。
  • 一般化交差エントロピー損失を用いた EEA モジュールは、標準交差エントロピー損失を上回り、ラベルなしターゲットサンプルに対するロバストな損失最適化の利点を示した。
  • FFA モジュールにおけるバイリニアープールを用いた特徴統合により、検証セットの平均正答率が 63.01% から 67.58% に顕著に向上した。
  • 半教師あり適応において、プロトタイプベース分類を組み合わせた EEA3 を用いたイテレーティブな精緻化により、平均正答率が 71.41% に達し、ソースオンリーベースラインから 7.1% の向上を達成した。
  • 複数のソースドメイン、合成データ、および多様なバックボーンにわたるアンサンブル学習の組み合わせが、最先端の結果を達成する上で不可欠であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。