Skip to main content
QUICK REVIEW

[論文レビュー] SAND-mask: An Enhanced Gradient Masking Strategy for the Discovery of Invariances in Domain Generalization

Soroosh Shahtalebi, Jean-Christophe Gagnon-Audet|arXiv (Cornell University)|Jun 4, 2021
Domain Adaptation and Few-Shot Learning参考文献 37被引用数 22
ひとこと要約

本稿では、ドメイン一般化における不変性の発見を向上させるために、ドメイン間で勾配の方向と大きさの整合性を同時に強制する連続的勾配マスク戦略、SAND-maskを提案する。従来手法を上回り、Colored MNISTでは6%の精度向上を達成し、DomainBedベンチマークでも競争力ある結果を示した。マスクは勾配の一貫性に基づいて動的に適応される。

ABSTRACT

A major bottleneck in the real-world applications of machine learning models is their failure in generalizing to unseen domains whose data distribution is not i.i.d to the training domains. This failure often stems from learning non-generalizable features in the training domains that are spuriously correlated with the label of data. To address this shortcoming, there has been a growing surge of interest in learning good explanations that are hard to vary, which is studied under the notion of Out-of-Distribution (OOD) Generalization. The search for good explanations that are extit{invariant} across different domains can be seen as finding local (global) minimas in the loss landscape that hold true across all of the training domains. In this paper, we propose a masking strategy, which determines a continuous weight based on the agreement of gradients that flow in each edge of network, in order to control the amount of update received by the edge in each step of optimization. Particularly, our proposed technique referred to as "Smoothed-AND (SAND)-masking", not only validates the agreement in the direction of gradients but also promotes the agreement among their magnitudes to further ensure the discovery of invariances across training domains. SAND-mask is validated over the Domainbed benchmark for domain generalization and significantly improves the state-of-the-art accuracy on the Colored MNIST dataset while providing competitive results on other domain generalization datasets.

研究の動機と目的

  • 既存の勾配マスク手法が最適化のモーメンタム、初期化、データノイズに対して感受性を示す失敗モードを是正すること。
  • 勾配の方向だけでなく大きさの整合性も保証することで、不変性を促進する連続的かつ適応的なマスク戦略を開発すること。
  • OOD一般化におけるアニーリングスケジュールの手動ハイパーパramータチューニングの必要性を排除し、初期マスクなし状態から自然に完全なSANDマスクへ収束できる仕組みを提供すること。
  • テストセットへのアクセスなしに、分布外データにおける一般化性能を向上させること。
  • 多様なデータ分布に一般化する不変特徴を学習するための、強力でスケーラブルなソリューションを提供すること。

提案手法

  • SAND-maskは、異なるドメイン間での勾配の一致に基づき、各ネットワークエッジに対して連続的なマスクを計算する。この際、方向と大きさの両方の一貫性を用いる。
  • 従来の手法で使われる離散的ANDマスクに代わり、滑らかなAND演算を適用することで、ノイズおよび最適化アーティファクトへの感受性を低減する。
  • マスク値は、異なるドメインからの勾配間のコサイン類似度と大きさの一致に基づく関数として計算され、安定的かつ微分可能な更新を保証する。
  • この手法は訓練中に動的に進化し、最小限のマスクから開始して、観察された勾配の一貫性に応じて徐々にマスク強度を増加させる。これは暗黙のアニーリングスケジュールを模倣する。
  • 損失関数を変更せずに標準的なバックプロパゲーションに統合可能であり、既存の訓練パイプラインと互換性がある。
  • DomainBedベンチマークを用いて評価され、IRM、REx、CDANN、AND-maskなどのSOTA手法と比較された。

実験結果

リサーチクエスチョン

  • RQ1勾配の方向と大きさの両方の一貫性を強制する連続的勾配マスク戦略は、ドメイン一般化における不変性学習を改善できるか?
  • RQ2SAND-maskは、最適化のモーメンタムやデータノイズに対して感受性を示す離散的ANDマスクの失敗モードを緩和できるか?
  • RQ3SAND-maskは、アニーリングスケジュールの明示的ハイパーパramータチューニングなしに、優れた一般化性能を達成できるか?
  • RQ4Colored MNIST や Spiral などのベンチマークデータセットにおいて、SAND-maskはSOTA手法と比較してどのように性能を発揮するか?
  • RQ5SAND-maskの動的かつ自己適応的な性質は、固定または手動でスケジューリングされたマスク戦略と比較して、より良い収束性とロバストネスをもたらすか?

主な発見

  • SAND-maskは、前回のSOTAを上回り、Colored MNISTデータセットで6%の絶対的精度向上を達成し、62.3% ± 1.0の精度を記録した。
  • DomainBedベンチマーク全体では、SAND-maskはCifar-10、Cifar-100、Sketchなどの複数のデータセットでSOTA手法を上回るか、同等の性能を示した。
  • Colored MNISTでは、SAND-maskが一般化性能を顕著に向上させ、AND-maskとSAND-maskの性能差が約15%に達するなど、強力な不変性学習が実現した。
  • Spiralデータセットでは、SAND-maskはAND-mask(49.2% 対 88.0%)を下回る性能を示し、特定のタイプの分布シフトを捉える限界が見られた。
  • 連続的かつ微分可能設計のおかげで、初期化やノイズに対してロバストであり、元のAND-maskが示した失敗モードを回避した。
  • SAND-maskは、明示的なアニーリングスケジュールを必要とせず、訓練中に勾配の一貫性に基づきマスク強度を自動で適応的に調整することで、不変特徴を効果的に学習した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。