Skip to main content
QUICK REVIEW

[論文レビュー] DRANet: Disentangling Representation and Adaptation Networks for Unsupervised Cross-Domain Adaptation

Seunghun Lee, Sunghyun Cho|arXiv (Cornell University)|Mar 24, 2021
Generative Adversarial Networks and Image Synthesis参考文献 40被引用数 4
ひとこと要約

DRANetは、非線形潜在空間におけるコンテンツとスタイル要因への分離を用いて、ラベルなしで双方向的ドメイン適応を可能にする画期的な教師なしクロスドメイン適応フレームワークを提案する。コンテンツに適応したドメイン転送モジュールとドメイン固有のスケーリングを用いることで、ラベルなしで手術的特徴分離と現実的な画像合成を実現し、数字分類およびセマンティックセグメンテーションタスクで最先端の性能を達成する。

ABSTRACT

In this paper, we present DRANet, a network architecture that disentangles image representations and transfers the visual attributes in a latent space for unsupervised cross-domain adaptation. Unlike the existing domain adaptation methods that learn associated features sharing a domain, DRANet preserves the distinctiveness of each domain's characteristics. Our model encodes individual representations of content (scene structure) and style (artistic appearance) from both source and target images. Then, it adapts the domain by incorporating the transferred style factor into the content factor along with learnable weights specified for each domain. This learning framework allows bi-/multi-directional domain adaptation with a single encoder-decoder network and aligns their domain shift. Additionally, we propose a content-adaptive domain transfer module that helps retain scene structure while transferring style. Extensive experiments show our model successfully separates content-style factors and synthesizes visually pleasing domain-transferred images. The proposed method demonstrates state-of-the-art performance on standard digit classification tasks as well as semantic segmentation tasks.

研究の動機と目的

  • 共通の特徴空間と関連するドメイン特徴に依存する従来のドメイン適応手法の制限を解消すること。
  • 非線形潜在空間におけるコンテンツとスタイル表現の分離により、ドメイン固有の特徴を保持すること。
  • 教師付きクラスラベルを必要とせず、1つのエンコーダ・デコーダネットワークを用いて双方向ドメイン適応を可能にすること。
  • コンテンツに適応したドメイン転送モジュールを用いて、Cityscapes や GTA5 などの複雑なシーンにおける画像合成品質を向上させること。
  • ラベルなしデータのみを用いて、分類およびセマンティックセグメンテーションベンチマークで最先端の性能を達成すること。

提案手法

  • 非線形分離器を用いて、潜在空間における画像表現をコンテンツ(シーン構造)とスタイル(芸術的外観)に分離する。
  • ドメイン固有の学習可能スケールパラメータを適用し、1つのドメインのスタイルを別のドメインのコンテンツに転送することで、多方向適応を可能にする。
  • コンテンツ類似度に基づいてスタイル転送を動的に調整するコンテンツに適応したドメイン転送(CADT)モジュールを導入し、アーティファクトを低減する。
  • 敵対的損失とドメインの混同を用いて、エンド・トゥ・エンドで学習し、特徴を整列させつつ分離された表現を保持する。
  • ソースからターゲット、およびターゲットからソースへのドメイン適応に同一のエンコーダ・デコーダアーキテクチャを用いることで、複数の専用ネットワークの必要性を排除する。
  • 分離器における非線形写像関数と正規化を活用し、表現の分離とドメインシフトの整合性を向上させる。

実験結果

リサーチクエスチョン

  • RQ11つのディープネットワークが、ラベルなしで双方向的教師なしドメイン適応を実現できるか?
  • RQ2線形手法と比較して、非線形なコンテンツ・スタイル分離はドメイン適応性能の向上にどの程度効果的か?
  • RQ3コンテンツに適応したドメイン転送モジュールは、初期学習段階でアーティファクトをどの程度低減し、画像の現実性を向上させるか?
  • RQ4分離された表現は、教師なしドメイン適応下で分類およびセマンティックセグメンテーションタスクの両方で最先端の性能を達成できるか?
  • RQ5ドメイン固有のスケーリング因子と非線形性が、どのように併せてより良い特徴分離とドメイン整合性を実現するか?

主な発見

  • DRANetは、MNIST-to-USPS および USPS-to-MNIST の適応タスクでそれぞれ98.2%および97.8%の精度を達成し、先行手法を上回った。
  • MNIST-Mベンチマークでは98.7%の精度を達成し、顕著なドメインシフト下でも優れた一般化性能を示した。
  • アブレーションスタディにより、分離器における非線形性と正規化が両方とも不可欠であることが確認され、完全なモデルはMNIST-to-MNIST-Mタスクで99.3%の精度を達成した。
  • コンテンツに適応したドメイン転送(CADT)モジュールは、初期学習段階でのアーティファクトを顕著に低減し、ソースとターゲットのコンテンツが著しく異なる場合でも視覚的に整合性のある画像を生成した。
  • Cityscapes および GTA5 のセマンティックセグメンテーションタスクにおいて、DRANetはベースライン手法を上回る性能を示し、複雑なシーン適応における有効性を確認した。
  • 適応にラベルなしデータのみを用いたにもかかわらず、DRANetは標準的な数字分類およびセマンティックセグメンテーションベンチマークで最先端の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。