Skip to main content
QUICK REVIEW

[論文レビュー] StyleAdv: Meta Style Adversarial Training for Cross-Domain Few-Shot Learning

Yuqian Fu, Yu Xie|arXiv (Cornell University)|Feb 18, 2023
Domain Adaptation and Few-Shot Learning被引用数 6
ひとこと要約

本稿では、Cross-Domain Few-Shot Learning (CD-FSL) のためのモデル非依存メタ学習手法である StyleAdv を提案する。この手法は、勾配に基づく摂動によってソースのスタイル特徴を変更し、敵対的で視覚的なスタイルを生成することで、ドメインシフトに対する耐性を向上させる。プログレッシブなスタイル敵対的攻撃(Style-FGSM)を用いて、ソースのスタイル特徴の勾配に基づき「仮想的」かつ「困難な」スタイルを合成することで、多様なターゲットドメインにわたる一般化性能が向上し、ResNet および Vision Transformer ベースラインを用いた8つのデータセットにおいて、新たな最先端性能を達成した。

ABSTRACT

Cross-Domain Few-Shot Learning (CD-FSL) is a recently emerging task that tackles few-shot learning across different domains. It aims at transferring prior knowledge learned on the source dataset to novel target datasets. The CD-FSL task is especially challenged by the huge domain gap between different datasets. Critically, such a domain gap actually comes from the changes of visual styles, and wave-SAN empirically shows that spanning the style distribution of the source data helps alleviate this issue. However, wave-SAN simply swaps styles of two images. Such a vanilla operation makes the generated styles ``real'' and ``easy'', which still fall into the original set of the source styles. Thus, inspired by vanilla adversarial learning, a novel model-agnostic meta Style Adversarial training (StyleAdv) method together with a novel style adversarial attack method is proposed for CD-FSL. Particularly, our style attack method synthesizes both ``virtual'' and ``hard'' adversarial styles for model training. This is achieved by perturbing the original style with the signed style gradients. By continually attacking styles and forcing the model to recognize these challenging adversarial styles, our model is gradually robust to the visual styles, thus boosting the generalization ability for novel target datasets. Besides the typical CNN-based backbone, we also employ our StyleAdv method on large-scale pretrained vision transformer. Extensive experiments conducted on eight various target datasets show the effectiveness of our method. Whether built upon ResNet or ViT, we achieve the new state of the art for CD-FSL. Code is available at https://github.com/lovelyqian/StyleAdv-CDFSL.

研究の動機と目的

  • Cross-Domain Few-Shot Learning (CD-FSL) における大きなドメインギャップ、特にソースドメインとターゲットドメイン間の視覚的スタイルのズレに起因する課題に対処すること。
  • 波形-SAN などの既存のスタイル拡張手法が、ソース分布内でのみ「現実的」かつ「簡単な」スタイルしか生成できないという限界を克服すること。
  • 「仮想的」(ソースセットに存在しない)かつ「困難な」(識別がより難しい)敵対的スタイルを用いた学習によって、モデルの一般化性能を向上させること。
  • アーキテクチャの変更なしに、既存の FSL や CD-FSL モデルを補完的に改善できる、モデル非依存の手法を開発すること。

提案手法

  • 内側のループで、ソースのスタイル特徴に対する勾配に基づく摂動によって敵対的スタイルを生成するミニマックス訓練フレームワーク、StyleAdv を提案する。
  • オリジナルのスタイルに符号付きスタイル勾配を加えることで、ハードで仮想的なスタイルを合成する、新しいスタイル敵対的攻撃手法である Style-FGSM を導入する。
  • 特徴ブロックを跨いで敵対的信号を蓄積するプログレッシブなスタイル合成戦略を採用し、訓練の安定性を高め、大きな特徴のずれを回避する。
  • 候補プールからランダムな摂動率をサンプリングする戦略を採用し、生成された敵対的スタイルの多様性を向上させる。
  • エピソードベースの訓練において、クリーンなスタイルと敵対的に摂動されたスタイルの両方を認識できるように、メタラーニング設定でモデルを訓練する。
  • CNNベース(例:ResNet)およびビジョントランスフォーマー(ViT)ベースラインをサポートし、広範な適用可能性を示している。

実験結果

リサーチクエスチョン

  • RQ1敵対的スタイル生成は、現実のスタイル拡張を越えて、クロスドメイン少数ショット学習における一般化性能を向上させることができるか?
  • RQ2『仮想的』および『困難な』敵対的スタイルは、『現実的』および『簡単な』スタイルと比較して、モデルの耐性にどのように寄与するか?
  • RQ3画像や特徴ではなく、スタイル特徴を攻撃することで、CD-FSL におけるドメイン一般化がより良くなるか?
  • RQ4StyleAdv のようなモデル非依存手法は、ResNet や ViT といった多様なバックボーンと効果的に組み合わせられるか?
  • RQ5プログレッシブで比率ランダム化されたスタイル摂動の影響は、モデル性能および訓練の安定性にどのような影響を与えるか?

主な発見

  • StyleAdv は、1ショットおよび5ショット設定の下で、8つの多様なターゲットデータセットにおいて、新たな最先端性能を達成した。
  • 提案された Style-FGSM 攻撃手法は、「困難な」および「仮想的」なスタイルを効果的に生成し、元のソーススタイル分布を超えるモデルの性能を実現した。
  • 平均して、StyleAdv はベースラインの GNN モデルの5ウェイ1ショット精度を、全データセットで3.77%向上させた(59.83% から 63.77% に)。
  • 画像や特徴ではなくスタイル特徴を攻撃することで、より高い性能が得られた。これは、スタイルレベルの摂動がドメインギャップ軽減に効果的であることを示している。
  • この手法はモデル非依存であり、ResNet およびビジョントランスフォーマーの両方のバックボーンに一貫して性能向上をもたらした。
  • MixStyle や AdvStyle、DSU などの他のスタイル拡張ベースラインと比較して、Style-FGSM はより困難で多様なスタイルを生成する点で優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。