Skip to main content
QUICK REVIEW

[論文レビュー] An Online Method for A Class of Distributionally Robust Optimization with Non-Convex Objectives

Qi Qi, Zhishuai Guo|arXiv (Cornell University)|Jun 17, 2020
Risk and Portfolio Optimization被引用数 9
ひとこと要約

本稿では、非凸目的関数を伴う分布ロバスト最適化(DRO)のための双対性フリーなオンライン確率的手法を提案する。最小最大化DRO問題をKLダイバージェンス正則化を用いて双対性を回避する形で確率的合成最適化に変換する。この手法は、最先端の収束複雑度を達成し、不均衡データセットを含む大規模なディープラーニングタスクにおいて、学習を2倍以上高速化する。また、高次元の双対変数を維持する必要がなく、オンライン学習が可能である。

ABSTRACT

In this paper, we propose a practical online method for solving a class of distributionally robust optimization (DRO) with non-convex objectives, which has important applications in machine learning for improving the robustness of neural networks. In the literature, most methods for solving DRO are based on stochastic primal-dual methods. However, primal-dual methods for DRO suffer from several drawbacks: (1) manipulating a high-dimensional dual variable corresponding to the size of data is time expensive; (2) they are not friendly to online learning where data is coming sequentially. To address these issues, we consider a class of DRO with an KL divergence regularization on the dual variables, transform the min-max problem into a compositional minimization problem, and propose practical duality-free online stochastic methods without requiring a large mini-batch size. We establish the state-of-the-art complexities of the proposed methods with and without a Polyak-Łojasiewicz (PL) condition of the objective. Empirical studies on large-scale deep learning tasks (i) demonstrate that our method can speed up the training by more than 2 times than baseline methods and save days of training time on a large-scale dataset with $\sim$ 265K images, and (ii) verify the supreme performance of DRO over Empirical Risk Minimization (ERM) on imbalanced datasets. Of independent interest, the proposed method can be also used for solving a family of stochastic compositional problems with state-of-the-art complexities.

研究の動機と目的

  • 非凸目的関数を伴うDROにおける確率的プライマル・デュアル手法の非効率性、特に高次元のデュアル変数とオンライン学習への対応の悪さを解決すること。
  • 全デュアルベクトルのサイズ $ n $ を維持しない、オンラインでスケーラブルなアルゴリズムを構築すること。
  • 一般条件およびポリャク=ロジャシュエヴィッチ(PL)条件の下でDROの最適収束レートを確立し、既存の確率的合成手法を上回ること。
  • 特に大規模かつ不均衡なデータセットにおけるロバストトレーニングの実用的応用を可能にすること。

提案手法

  • デュアル変数にKLダイバージェンス正則化を適用することで、最小最大化DRO問題を合成最小化問題に変換し、双対性フリーな定式化を実現する。
  • 次式で与えられる同等の目的関数を導出する:$ F_{\text{dro}}(\mathbf{w}) = \lambda \log\left(\frac{1}{n}\sum_{i=1}^{n} \exp(\ell(\mathbf{w};\mathbf{z}_i)/\lambda)\right) + r(\mathbf{w}) $。これは確率的合成問題である。
  • 分散低減技術(例:SPIDER)を用いた、最適なサンプル複雑度を達成する新しいオンライン確率的アルゴリズムRECOVERを提案する。
  • 適応的ステップサイズとミニバッチサンプリングを統合することで、勾配の分散を低減し、大きなミニバッチサイズを必要とせずに収束を改善する。
  • 合成目的関数における指数型分布族の構造を活用し、明示的なデュアル変数の維持を回避しつつ、効率的なオンライン更新を可能にする。
  • 一般条件およびPL条件の下で理論的収束保証を確立し、複雑度バウンドを最先端のものと同等または上回る水準に保つ。

実験結果

リサーチクエスチョン

  • RQ1高次元のデュアル変数 $ \mathbf{p} \in \mathbb{R}^n $ を維持しないオンラインDROアルゴリズムを設計可能か?これによりスケーラブルでメモリ効率の良い学習が可能になるか?
  • RQ2プライマル・デュアル分解に依存せずに、非凸DRO問題の最適収束複雑度を達成可能か?
  • RQ3本手法は、不均衡なデータを伴う大規模なディープラーニングタスクにおいて、実際の性能をどのように発揮するか?
  • RQ4本手法は、最適なサンプル複雑度を達成する、より広範な確率的合成問題のクラスに一般化可能か?

主な発見

  • 提案手法は、約26.5万枚の画像を含む大規模データセットにおいて、ベースライン手法と比較して学習時間を2倍以上短縮した。
  • 大規模なディープラーニングタスクにおいて、学習時間を数日間短縮することができ、強力な実用的スケーラビリティを示した。
  • 実験的結果から、本手法を用いたDROは、不均衡データセットにおいて、経験的リスク最小化(ERM)を顕著に上回ることが確認された。
  • 理論的分析により、一般条件およびポリャク=ロジャシュエヴィッチ(PL)条件の下で、非凸DROの最先端のサンプル複雑度が確立された。
  • 本手法は、$ O(1/\epsilon) $ のサンプル複雑度を達成し、確率的合成問題の最良既知のバウンドと一致する最適収束レートを実現した。
  • アルゴリズムは完全にオンラインであり、データサイズ $ n $ の事前知識を必要とせず、逐次的データ処理に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。