Skip to main content
QUICK REVIEW

[論文レビュー] Feature-based Style Randomization for Domain Generalization

Yue Wang, Lei Qi|arXiv (Cornell University)|Jun 6, 2021
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、特徴表現にランダムノイズを注入することで、訓練中に多様で未観測のスタイルを持つ特徴を生成する、特徴ベースのスタイルランダマイゼーション(FSR)という、新たなドメイン一般化手法を提案する。画像レベルの増幅とは異なり、エンコーダ・デコーダネットワークを介して特徴空間で動作するため、より多様で目的指向的なデータ増幅が可能となり、PACS、VLCS、Office-Homeベンチマークで最先端の性能を達成する。

ABSTRACT

As a recent noticeable topic, domain generalization (DG) aims to first learn a generic model on multiple source domains and then directly generalize to an arbitrary unseen target domain without any additional adaption. In previous DG models, by generating virtual data to supplement observed source domains, the data augmentation based methods have shown its effectiveness. To simulate the possible unseen domains, most of them enrich the diversity of original data via image-level style transformation. However, we argue that the potential styles are hard to be exhaustively illustrated and fully augmented due to the limited referred styles, leading the diversity could not be always guaranteed. Unlike image-level augmentation, we in this paper develop a simple yet effective feature-based style randomization module to achieve feature-level augmentation, which can produce random styles via integrating random noise into the original style. Compared with existing image-level augmentation, our feature-level augmentation favors a more goal-oriented and sample-diverse way. Furthermore, to sufficiently explore the efficacy of the proposed module, we design a novel progressive training strategy to enable all parameters of the network to be fully trained. Extensive experiments on three standard benchmark datasets, i.e., PACS, VLCS and Office-Home, highlight the superiority of our method compared to the state-of-the-art methods.

研究の動機と目的

  • 画像レベルのデータ増幅の限界、特に未観測ドメインの多様性を十分に捉えられないこと(限定された参照スタイルに依存する)を是正すること。
  • 画像空間ではなく特徴空間でより多様で抽象的なスタイル変異を生成することで、モデルの一般化性能を向上させること。
  • 生成モデルや固定されたスタイル変換処理を必要とせず、学習可能で適応的な増幅メカニズムを構築すること。
  • 提案されたFSRモジュールを使用する際、すべてのネットワークパラメータを完全に最適化できる段階的訓練戦略を設計すること。
  • 一般画像分類および皮膚病変分類を含む医療画像処理タスクの両方で、特徴レベルの増幅の有効性を検証すること。

提案手法

  • 元の特徴表現に学習可能なノイズを注入することで、ランダムなスタイルを持つ新しい特徴に変換する特徴ベースのスタイルランダマイゼーション(FSR)モジュールを提案する。
  • エンコーダ・デコーダアーキテクチャを用いて、元の特徴を潜在空間にマッピングし、ノイズとスタイル統計を統合することで、多様なスタイル変換を可能にする。
  • FSRモジュールの強度を段階的に増加させる段階的訓練戦略を導入し、全ネットワークの最適化と安定した収束を可能にする。
  • 畳み込みバックボーンの後で特徴空間で動作するため、ランダムなスタイル摂動を通じてドメイン不変表現を学習可能になる。
  • スタイル表現としてインスタンス正規化の統計を用い、訓練中にノイズ調制を適用して新しいスタイルベクトルを生成する。
  • ネットワークの複数の段階にFSRモジュールを適用し、特徴多様性と一般化性能に与える影響を調査する。

実験結果

リサーチクエスチョン

  • RQ1特徴レベルのデータ増幅は、より多様で抽象的なスタイル変異を生成できるため、画像レベルの増幅を上回る性能を示せるか?
  • RQ2特徴表現に学習可能なノイズを注入することで、従来のスタイルミキシングや変換手法と比較して、未観測ドメインへのモデル一般化性能が向上するか?
  • RQ3FSRモジュールの配置と訓練スケジューリングは、モデル性能と収束にどのように影響するか?
  • RQ4ドメインシフトがコンパクトで非線形的である医療画像処理のような、非常に多様なドメインに対しても、本手法は効果的に一般化可能か?
  • RQ5FSRモジュールは、ソースドメインの性能を向上させると同時に、未観測ドメインへのゼロショット一般化性能を向上させるか?

主な発見

  • PACSデータセットでは、全ターゲットドメインで平均88.7%の精度を達成し、以前の最先端手法を1.2%上回った。
  • VLCSデータセットでは、平均83.4%の精度を達成し、すべてのドメイン一般化設定でベースラインおよび既存の最先端手法を上回った。
  • Office-Homeデータセットでは、平均73.8%の精度を達成し、多様な視覚ドメインにわたる強力な一般化性能を示した。
  • 6つの医療データセットを用いた皮膚病変分類タスクでは、平均81.31%の精度を達成し、ベースライン比2.33%、MixStyle比2.93%の向上を示した。
  • アブレーションスタディの結果、FSRはソースドメインおよびターゲットドメインの両方の性能を向上させることを確認し、ソースドメイン性能を犠牲にすることなく一般化性能を向上させることを示した。
  • 段階的訓練戦略は、モデルの収束性と性能を顕著に向上させ、全ネットワーク最適化がFSRの効果を最大限に引き出すために不可欠であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。