Skip to main content
QUICK REVIEW

[論文レビュー] MADAN: Multi-source Adversarial Domain Aggregation Network for Domain Adaptation

Sicheng Zhao, Bo Li|arXiv (Cornell University)|Feb 19, 2020
Domain Adaptation and Few-Shot Learning参考文献 87被引用数 4
ひとこと要約

本稿では、ピクセル単位のサイクル整合性のある画像変換と動的セマンティック整合性を用いて、複数のソースドメインをターゲットドメインにアライメントする、新しいマルチソース敵対的ドメイン適応フレームワークMADANを提案する。サブドメイン集約とクロスドメインサイクル識別器を導入することで、適応されたソースを統合し、画像分類およびセマンティックセグメンテーションタスクにおける性能を顕著に向上させ、Cityscapes、Office-31、Digits-fiveを含む複数のベンチマークで最先端の結果を達成した。

ABSTRACT

Domain adaptation aims to learn a transferable model to bridge the domain shift between one labeled source domain and another sparsely labeled or unlabeled target domain. Since the labeled data may be collected from multiple sources, multi-source domain adaptation (MDA) has attracted increasing attention. Recent MDA methods do not consider the pixel-level alignment between sources and target or the misalignment across different sources. In this paper, we propose a novel MDA framework to address these challenges. Specifically, we design an end-to-end Multi-source Adversarial Domain Aggregation Network (MADAN). First, an adapted domain is generated for each source with dynamic semantic consistency while aligning towards the target at the pixel-level cycle-consistently. Second, sub-domain aggregation discriminator and cross-domain cycle discriminator are proposed to make different adapted domains more closely aggregated. Finally, feature-level alignment is performed between the aggregated domain and the target domain while training the task network. For the segmentation adaptation, we further enforce category-level alignment and incorporate context-aware generation, which constitutes MADAN+. We conduct extensive MDA experiments on digit recognition, object classification, and simulation-to-real semantic segmentation. The results demonstrate that the proposed MADAN and MANDA+ models outperform state-of-the-art approaches by a large margin.

研究の動機と目的

  • 既存のマルチソースドメイン適応(MDA)手法がピクセル単位でのアライメントに失敗し、異なるソース間の不整合を無視するという限界を解消すること。
  • 複数のラベル付きソースドメインと1つのラベルなしターゲットドメインを想定した状況において、特にセマンティックセグメンテーションのような細分化タスクにおいてドメイン適応の性能を向上させること。
  • ターゲットラベルを必要とせず、複数の適応済みソースドメインを統一されたターゲットに一致する分布に効果的に集約できる統合フレームワークを開発すること。
  • カテゴリレベルのアライメントとコンテキストに配慮した画像生成を組み込むことで、ピクセル単位の予測タスクに対応できるようにフレームワークを拡張し、MADAN+を提案すること。
  • アテンションマップの可視化と適応前後におけるピクセル単位のアライメントを用いて、モデルの解釈性を向上させること。

提案手法

  • 各ソースドメインからターゲットドメインにピクセル単位でアライメントするように、動的セマンティック整合性損失を組み込んだサイクル整合性GANを用いて、適応済み画像を生成する。
  • 異なるソースからの適応済みドメインが共通の統一された分布に収束するよう促進するため、サブドメイン集約識別器を導入する。
  • 異なるソース-ターゲットペア間でサイクル整合性を強制することで、相互ソース間の不整合を低減するため、クロスドメインサイクル識別器を実装する。
  • タスクネットワークの学習中に、集約された適応済みドメインとターゲットドメインの特徴量レベルをアライメントすることで、一般化性能を向上させる。
  • セグメンテーションタスクのため、空間的および意味的構造を保持するため、カテゴリレベルのアライメントとコンテキストに配慮した画像生成を統合する。
  • 敵対的損失、サイクル整合性損失、およびタスク固有の分類またはセグメンテーション損失を用いて、フレームワーク全体をエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1異なる分布を持つ複数のソースドメインを、相互の不整合を最小限に抑えながら共通のターゲットドメインに効果的にアライメントする方法は何か?
  • RQ2サイクル整合性と動的セマンティック整合性を備えたピクセル単位の画像変換は、特徴量レベルのアライメントのみに比べてドメイン適応性能を向上させ得るか?
  • RQ3敵対的識別器によるドメイン集約は、マルチソースドメイン適応におけるモデル一般化性能をどの程度向上させるか?
  • RQ4提案手法は、セマンティックセグメンテーションのような構造予測タスクに効果的に拡張可能であり、既存手法と比較してどのように差をつけるか?
  • RQ5提案手法は、アテンション可視化とピクセル単位のアライメントを通じて、モデルの解釈性を向上させるか?

主な発見

  • Digits-five、Office-31、Office+Caltech-10、Office-Homeの各データセットにおいて、それぞれ2.8%、3.0%、2.2%、4.6%の精度向上を、既存の最良のMDA手法よりも達成した。
  • GTAとSYNTHIAをソースとしてCityscapesでセマンティックセグメンテーションを実行した場合、MADAN+はソースオンリーに比べ17.0%、最良の単一ソースDAに比べ3.0%、ソース結合DAに比べ5.5%、他のMDA手法に比べ13.4%のmIoU向上を達成した。
  • BDDSデータセットにおいて、MADAN+はソースオンリーに比べ17.0%、最良の単一ソースDAに比べ5.9%、ソース結合DAに比べ7.9%、他のMDA手法に比べ16.6%のmIoU向上を達成した。
  • 可視化結果から、MADANが生成した適応済み画像は、ターゲットドメインのスタイルに近づいている一方で、意味的コンテンツを保持していることが示された。これは、効果的なピクセル単位のアライメントを示している。
  • Grad-CAMアテンションマップは、適応済みモデルがより判別力があり、転送可能な領域(例:注目対象の物体)に注目し、背景や情報のない領域にあまり注目しないことを示している。
  • アブレーションスタディの結果、サブドメイン集約とクロスドメインサイクル識別器の両方が、特にドメインシフトと相互ソース間の不整合の低減において、性能向上に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。