Skip to main content
QUICK REVIEW

[论文解读] Adaptive Sampling for Stochastic Risk-Averse Learning

Sebastian Curi, Kfir Y. Levy|arXiv (Cornell University)|Oct 28, 2019
Risk and Portfolio Optimization参考文献 67被引用 12
一句话总结

该论文提出 Ada-CVaR,一种用于机器学习中条件风险价值(CVaR)随机优化的自适应采样算法,采用分布鲁棒性公式化为零和博弈,并通过结构化确定性点过程(DPPs)实现的后悔最小化求解。该方法实现了在大规模数据集上高效、可扩展的风险规避模型训练,在凸与非凸任务中均优于基线方法,显著降低了最难样本的最坏情况损失。

ABSTRACT

In high-stakes machine learning applications, it is crucial to not only perform well on average, but also when restricted to difficult examples. To address this, we consider the problem of training models in a risk-averse manner. We propose an adaptive sampling algorithm for stochastically optimizing the Conditional Value-at-Risk (CVaR) of a loss distribution, which measures its performance on the $α$ fraction of most difficult examples. We use a distributionally robust formulation of the CVaR to phrase the problem as a zero-sum game between two players, and solve it efficiently using regret minimization. Our approach relies on sampling from structured Determinantal Point Processes (DPPs), which enables scaling it to large data sets. Finally, we empirically demonstrate its effectiveness on large-scale convex and non-convex learning tasks.

研究动机与目标

  • 为解决高风险机器学习中标准经验风险最小化方法的局限性,即平均性能优化忽略了罕见但严重的失败。
  • 开发一种可扩展的随机优化方法,以最小化CVaR,从而捕捉最困难样本(损失分布尾部)的性能。
  • 降低CVaR优化中,特别是在深度学习等非凸设置下的小批量梯度估计的高方差。
  • 通过结构化DPP实现在大规模数据集上的高效采样,同时保持风险规避学习的收敛性保证。
  • 在分布变化与类别不平衡条件下,于凸与非凸学习任务中展示所提方法的有效性。

提出的方法

  • 将CVaR最小化问题形式化为一种分布鲁棒优化(DRO)问题,采用学习者与对手之间的零和博弈框架。
  • 使用后悔最小化求解DRO公式,实现低方差梯度的随机优化。
  • 通过松弛化的k-确定性点过程(k-DPP)实现自适应采样,随训练进程优先从损失分布尾部采样。
  • 利用k-DPP核的对角结构,实现O(log N)的计算复杂度采样,避免昂贵的特征分解。
  • 将自适应采样方案与标准随机优化器(如SGD)集成,以保持训练效率。
  • 采用博弈论视角,动态调整采样权重以聚焦于高损失样本,逐步实现从均值风险到CVaR最小化的转变。

实验结果

研究问题

  • RQ1基于DPP的自适应采样是否能有效降低非凸模型在随机CVaR优化中的梯度方差?
  • RQ2所提出的CVaR分布鲁棒性公式是否能实现在大规模数据集上的稳定且可扩展的训练?
  • RQ3与现有CVaR优化方法(如截断损失、软-CVaR)相比,Ada-CVaR在最坏情况性能与鲁棒性方面表现如何?
  • RQ4在数据分布变化与类别不平衡条件下,该方法是否能保持低方差与高性能?
  • RQ5用于自适应采样的结构化DPP在大规模学习任务中是否具备足够的计算效率?

主要发现

  • 与均值和软-CVaR基线相比,Ada-CVaR在最差α分位数样本上实现了显著更低的测试损失(例如,在Splice数据集上α=0.1时为0.31 ± 0.2)。
  • 在German数据集上α=0.1时,Ada-CVaR的CVaR损失为0.55 ± 0.2,优于Trunc-CVaR(0.58 ± 0.0)和Soft-CVaR(0.55 ± 0.2)。
  • 在双分布偏移实验中(训练集与测试集不平衡),Ada-CVaR保持了稳健性能(如在Titanic数据集上为0.57 ± 0.3),而过采样技术则导致性能下降。
  • 与均值和软-CVaR相比,Ada-CVaR在不同随机种子下的性能标准差更低,表明对采样变异性具有更强鲁棒性。
  • 通过结构化k-DPP实现O(log N)采样复杂度,无需特征分解,从而实现对大规模数据集的可扩展性。
  • 实证结果表明,Ada-CVaR在多种数据集(Adult、Splice、German等)上,在不同α水平与数据偏移条件下,均一致提升了最坏情况性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。