Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Sampling for Stochastic Risk-Averse Learning

Sebastian Curi, Kfir Y. Levy|arXiv (Cornell University)|Oct 28, 2019
Risk and Portfolio Optimization参考文献 67被引用数 12
ひとこと要約

本稿では、条件付きリスク価値(CVaR)の確率的最適化のための適応的サンプリング手法Ada-CVaRを提案する。この手法は、零和ゲームとして定式化された分布に頑健な最適化フレームワークを用い、構造的行列式ポイントプロセス(DPP)を用いたレジーット最小化により解く。本手法により、大規模データセット上でのリスク回避的モデルの効率的かつスケーラブルな訓練が可能となり、凸および非凸のタスクにおいて困難な例における最悪ケース損失を最小化する点で、ベースライン手法を上回る性能を発揮する。

ABSTRACT

In high-stakes machine learning applications, it is crucial to not only perform well on average, but also when restricted to difficult examples. To address this, we consider the problem of training models in a risk-averse manner. We propose an adaptive sampling algorithm for stochastically optimizing the Conditional Value-at-Risk (CVaR) of a loss distribution, which measures its performance on the $α$ fraction of most difficult examples. We use a distributionally robust formulation of the CVaR to phrase the problem as a zero-sum game between two players, and solve it efficiently using regret minimization. Our approach relies on sampling from structured Determinantal Point Processes (DPPs), which enables scaling it to large data sets. Finally, we empirically demonstrate its effectiveness on large-scale convex and non-convex learning tasks.

研究の動機と目的

  • 高リスクな機械学習における標準的な経験的リスク最小化の限界を解消する。特に、平均性能最適化がまれだが深刻な失敗を無視することを目的とする。
  • CVaRの最小化を可能にするスケーラブルな確率的最適化手法を開発する。CVaRは損失分布の尾部に位置する最も困難な例のパフォーマンスを捉える。
  • 特にディープラーニングのような非凸設定において、CVaR最適化におけるミニバッチ勾配推定の高分散を低減する。
  • 収束保証を維持したまま、大規模データセットからの効率的なサンプリングを可能にする構造的DPPを用いる。
  • 分布シフトおよびクラス不均衡下での凸および非凸学習タスクにおいて、提案手法の有効性を示す。

提案手法

  • 学習者と敵対者との間の零和ゲームフレームワークを用いて、CVaR最小化を分布に頑健な最適化(DRO)問題として定式化する。
  • レジーット最小化を用いてDRO定式化を解き、低分散勾配を有する確率的最適化を可能にする。
  • 訓練の進行に伴い損失分布の尾部からサンプリングを優先する、緩和されたk-行列式ポイントプロセス(k-DPP)を用いた適応的サンプリングを実装する。
  • k-DPPカーネルの対角構造を活用し、固有分解を回避することで、O(log N)の計算複雑度を実現する。
  • 標準的な確率的最適化手法(例:SGD)と組み合わせることで、トレーニング効率を維持する。
  • ゲーム理論的視点を用いて、動的にサンプリング重みを高損失例に調整し、平均リスクからCVaR最小化への段階的移行を実現する。

実験結果

リサーチクエスチョン

  • RQ1DPPに基づく適応的サンプリングは、非凸モデルにおける確率的CVaR最適化の勾配分散を効果的に低減できるか?
  • RQ2提案された分布に頑健なCVaR定式化は、大規模データセット上での安定的かつスケーラブルなトレーニングを可能にするか?
  • RQ3Ada-CVaRは、従来のCVaR最適化手法(例:切り捨て損失、ソフト-CVaR)と比較して、最悪ケース性能および頑健性において優れているか?
  • RQ4データ分布のシフトおよびクラス不均衡下でも、本手法は低分散かつ高いパフォーマンスを維持できるか?
  • RQ5構造的DPPを用いた適応的サンプリングは、大規模学習タスクにおいて十分に計算効率的か?

主な発見

  • Ada-CVaRは、例(例:α=0.1のSpliceで0.31 ± 0.2)の最悪のα-分数にわたるテスト損失が、平均およびソフト-CVaRベースラインと比較して顕著に低くなる。
  • α=0.1のドイツのデータセットでは、Ada-CVaRはCVaR損失0.55 ± 0.2を達成し、Trunc-CVaR(0.58 ± 0.0)およびSoft-CVaR(0.55 ± 0.2)を上回る。
  • 二重シフト実験では、トレーニングおよびテストセットに不均衡があるが、Ada-CVaRは強固なパフォーマンス(例:Titanicで0.57 ± 0.3)を維持する。一方、アンダーサンプリング技術は性能を低下させる。
  • Ada-CVaRは、平均およびソフト-CVaRと比較して、ランダムシードごとのパフォーマンスの標準偏差が低く、サンプリング変動に対するより高い頑健性を示す。
  • 構造的k-DPPを用いることで、固有分解を回避し、O(log N)のサンプリング複雑度を達成し、大規模データセットへのスケーラビリティを実現する。
  • 実験的結果から、Ada-CVaRは、αレベルやデータシフトの変動にかかわらず、複数のデータセット(Adult, Splice, Germanなど)において一貫して最悪ケースパフォーマンスを向上させることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。