Skip to main content
QUICK REVIEW

[論文レビュー] Fast Distributionally Robust Learning with Variance Reduced Min-Max Optimization

Yaodong Yu, Tianyi Lin|arXiv (Cornell University)|Apr 27, 2021
Risk and Portfolio Optimization参考文献 64被引用数 6
ひとこと要約

本稿では、Wasserstein距離に基づく分布的ロバストな学習(WDRSL)に対して、高速かつスケーラブルな分散低減型確率的エクストラグラデントアルゴリズムであるSEVRおよびSPPRRを提案する。Wasserstein WDRSLを滑らかで有限和のミニマックス問題に再定式化することで、従来の手法よりも高速な収束を達成しながら、大規模な設定下でも分布シフトに対してロバスト性を維持する。

ABSTRACT

Distributionally robust supervised learning (DRSL) is emerging as a key paradigm for building reliable machine learning systems for real-world applications -- reflecting the need for classifiers and predictive models that are robust to the distribution shifts that arise from phenomena such as selection bias or nonstationarity. Existing algorithms for solving Wasserstein DRSL -- one of the most popular DRSL frameworks based around robustness to perturbations in the Wasserstein distance -- have serious limitations that limit their use in large-scale problems -- in particular they involve solving complex subproblems and they fail to make use of stochastic gradients. We revisit Wasserstein DRSL through the lens of min-max optimization and derive scalable and efficiently implementable stochastic extra-gradient algorithms which provably achieve faster convergence rates than existing approaches. We demonstrate their effectiveness on synthetic and real data when compared to existing DRSL approaches. Key to our results is the use of variance reduction and random reshuffling to accelerate stochastic min-max optimization, the analysis of which may be of independent interest.

研究の動機と目的

  • 大規模なWasserstein分布的ロバストな教師あり学習(WDRSL)問題を解くための効率的でスケーラブルなアルゴリズムの不足に対処すること。
  • 非滑らかで再定式化された手法や、決定的サブ問題解法に依存する既存手法の限界を克服し、データサイズの増大に伴うスケーラビリティの低下を回避すること。
  • 一般化線形損失を伴うWDRSLのミニマックス構造に特化した、確率的で分散低減型の最適化アルゴリズムを開発すること。
  • WDRSLに対して、既存のオフザシェルソルバーや決定的勾配法よりも高速な収束レートを達成すること。
  • 分布シフト下での合成データおよび実世界のデータセットにおいて、向上したロバスト性と計算効率を実証すること。

提案手法

  • 一般化線形損失を伴うWDRSLを、ℓ∞-ボールおよび2次錐に関する制約を伴う滑らかで凸-凹なミニマックス問題に再定式化する。
  • ミニマックス定式化における最適性の概念を導入し、それが標準的なWDRSL最適性と一貫していることを証明する。
  • 分散低減を活用して確率的ミニマックス設定での収束を加速する、分散低減型確率的エクストラグラデント(SEVR)を提案する。
  • ランダムリシャッフルを用いて非凸-凹ミニマックス問題における収束を向上させる、確率的近接点法とランダムリシャッフル(SPPRR)を開発する。
  • 既存のソルバーや決定的フレームワークと比較して、より高速な収束レートを確立するための精密な複雑度解析を適用する。
  • 有限和構造と滑らかさを活用して、確率的勾配ベースの更新の効率的実装を可能にする。

実験結果

リサーチクエスチョン

  • RQ1分散低減型確率的エクストラグラデント手法は、既存のソルバーよりも大規模なWasserstein DRSLに対してより高速な収束を達成できるか?
  • RQ2提案されたWDRSLのミニマックス再定式化は、確率的勾配と分散低減の効率的利用をどのように可能にするか?
  • RQ3バッチサイズと固定点反復回数が、SEVRおよびSPPRRの収束性とロバスト性に与える影響は何か?
  • RQ4敵対的分布シフト下で、WDRSLはERMおよびf-発散に基づくDRSLと比較してどのように性能を発揮するか?
  • RQ5SPPRRにおけるランダムリシャッフルの使用は、WDRSLのミニマックス最適化における収束性を向上させるか?

主な発見

  • SEVRおよびSPPRRは、既存のオフザシェルソルバーや決定的勾配法よりも、WDRSLに対してより高速な収束レートを達成する。
  • 提案されたアルゴリズムは、Wasserstein距離における大きな摂動下でも、標準的なERMやf-発散に基づくDRSLと比較して、顕著に優れたロバスト損失を達成する。
  • 大きな摂動半径では、WDRSLに提案手法を適用した場合、特にデータサポートが重複しない場合に、f-発散に基づくDRSLよりも著しく優れた性能を示す。
  • n_train = 1,000の合成データセットでは、WDRSLはf-発散に基づくDRSLよりもわずかに優れたロバスト性を示すが、n_train = 2,000ではf-発散アプローチがわずかに優れるため、データサイズが相対的性能に影響を与えることが示唆される。
  • 実験では、SEVRはB ∈ {32, 64, 128, 256} の異なるバッチサイズにおいてもロバストであることが確認され、SPPRRは固定点反復回数M ∈ {2, 4, 6} が増加するにつれて収束速度とロバスト性が向上することが示された。
  • ミニマックス最適化における分散低減とランダムリシャッフルの分析は、WDRSLを越えて独立した理論的インサイトを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。