Skip to main content
QUICK REVIEW

[論文レビュー] Domain Generalization Needs Stochastic Weight Averaging for Robustness on Domain Shifts.

Junbum Cha, Hancheol Cho|arXiv (Cornell University)|Feb 17, 2021
Domain Adaptation and Few-Shot Learning参考文献 47被引用数 14
ひとこと要約

本稿では、複数のソースドメインに共通する損失の谷底(loss valley center)を特定することで、ドメイン一般化を向上させるために確率的重み平均化(Stochastic Weight Averaging, SWA)を提案する。未学習ドメインにおける頑健性が顕著に向上し、PACS、OfficeHome、DomainNetを含む6つの主要ベンチマークで、既存手法を大きく上回る最先端の性能を達成している。

ABSTRACT

Domain generalization aims to learn a generalizable model to unseen target domains from multiple source domains. Various approaches have been proposed to address this problem. However, recent benchmarks show that most of them do not provide significant improvements compared to the simple empirical risk minimization (ERM) in practical cases. In this paper, we analyze how ERM works in views of domain-invariant feature learning and domain-specific gradient normalization. In addition, we observe that ERM converges to a loss valley shared over multiple training domains and obtain an insight that a center of the valley generalizes better. To estimate the center, we employ stochastic weight averaging (SWA) and provide theoretical analysis describing how SWA supports the generalization bound for an unseen domain. As a result, we achieve state-of-the-art performances over all of widely used domain generalization benchmarks, namely PACS, VLCS, OfficeHome, TerraIncognita, and DomainNet with large margins. Further analysis reveals how SWA operates on domain generalization tasks.

研究の動機と目的

  • 実世界のベンチマークにおいて、既存のドメイン一般化手法が得られる一般化性能の向上が限定的であるという問題に対処すること。
  • 単純な経験的リスク最小化(Empirical Risk Minimization, ERM)が、なぜしばしば複雑なドメイン一般化手法を上回るのかを解明すること。
  • ドメイン間で共有される中心的なモデル重み構成を推定することで、ドメインシフトに対する頑健性を向上させること。
  • SWAが未学習ドメインにおける一般化境界を改善することを理論的および実験的に検証すること。

提案手法

  • ドメイン不変特徴学習とドメイン固有の勾配正規化の観点からERMを分析する。
  • ERMが学習ドメイン間で共通する損失の谷底に収束することを観察し、谷底の中心がより優れた一般化解である可能性を示唆する。
  • 複数の学習経路からの重みを平均することで、損失の谷底の中心を推定するため、確率的重み平均化(Stochastic Weight Averaging, SWA)を適用する。
  • SWAが未学習ドメインにおける一般化境界の改善に寄与することを理論的に結びつける分析を提供する。
  • 複数のソースドメインでSWAを用いてモデルを学習し、未学習のターゲットドメインで評価することで、頑健性を評価する。

実験結果

リサーチクエスチョン

  • RQ1なぜ実際にはERMが、より複雑なドメイン一般化手法を上回ることが多いのか?
  • RQ2ドメイン間で共有される損失の谷底の中心は、標準的なERMや他のドメイン一般化手法よりも頑健なモデルとして機能するのか?
  • RQ3SWAはドメイン一般化の文脈でどのように一般化を向上させるのか?
  • RQ4SWAの有効性を裏付ける理論的根拠は何か?

主な発見

  • SWAは、PACS、VLCS、OfficeHome、TerraIncognita、DomainNetを含む6つの主要ドメイン一般化ベンチマークで、すべてにおいて最先端の性能を達成している。
  • 提案手法は、すべてのベンチマークで、既存のドメイン一般化手法を大きく上回る性能を示している。
  • SWAによって推定された損失の谷底の中心は、標準的なERMや他のドメイン一般化手法よりも、未学習ドメインへの一般化性能が優れている。
  • 理論的分析により、SWAが未学習ドメインにおけるよりタイトな一般化境界をサポートすることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。