Skip to main content
QUICK REVIEW

[论文解读] Efficient Stochastic Gradient Descent for Learning with Distributionally Robust Optimization

Soumyadip Ghosh, Mark S. Squillante|arXiv (Cornell University)|May 22, 2018
Risk and Portfolio Optimization参考文献 20被引用 5
一句话总结

本文提出分布鲁棒随机梯度下降(DSSG),一种新颖的随机优化算法,通过将外层最小化问题的梯度下降与内层最大化的样本平均近似相结合,高效求解分布鲁棒优化(DRO)问题。该方法动态增加用于估计内层梯度的子集大小,在随机误差与计算成本之间实现理论上的最优平衡,从而在理论上实现最优收敛,并在经验上展现出比正则化ERM快一个数量级以上的训练速度和更优的泛化性能。

ABSTRACT

Distributionally robust optimization (DRO) problems are increasingly seen as a viable method to train machine learning models for improved model generalization. These min-max formulations, however, are more difficult to solve. We therefore provide a new stochastic gradient descent algorithm to efficiently solve this DRO formulation. Our approach applies gradient descent to the outer minimization formulation and estimates the gradient of the inner maximization based on a sample average approximation. The latter uses a subset of the data in each iteration, progressively increasing the subset size to ensure convergence. Theoretical results include establishing the optimal manner for growing the support size to balance a fundamental tradeoff between stochastic error and computational effort. Empirical results demonstrate the significant benefits of our approach over previous work, and also illustrate how learning with DRO can improve generalization.

研究动机与目标

  • 为解决机器学习中min-max DRO公式化带来的计算挑战,其复杂度高于标准的经验风险最小化。
  • 开发一种随机优化方法,通过自适应样本平均法高效处理DRO中的内层最大化问题。
  • 建立样本平均近似中支持集大小增长的理论最优策略,以平衡随机近似误差与计算成本。
  • 通过实证验证,DSSG在显著降低计算开销的前提下,实现优于正则化经验风险最小化(ERM)的泛化性能。
  • 提供一种鲁棒且无需调参的ERM替代方案,天然地将分布不确定性融入模型训练过程。

提出的方法

  • 该算法对DRO公式中的外层最小化问题应用随机梯度下降,将最坏情况下的期望损失作为目标函数。
  • 对于内层最大化问题,采用随时间增长的数据子集进行样本平均近似(SAA),在每次迭代中逐步增加支持集大小。
  • 子集大小的增长速率基于对随机近似误差与计算工作量之间权衡的理论分析而确定。
  • 该方法适用于一般$φ$-散度约束,包括$χ^2$和KL散度,其中基分布设为均匀经验分布$U_N$。
  • 通过数据子集估计最坏情况损失的梯度,且通过控制子集大小的增长速率确保算法收敛。
  • 该方法适用于凸损失函数,并利用对偶性和凸优化原理以保持理论保证。

实验结果

研究问题

  • RQ1能否设计一种随机梯度方法,在无需每一步都进行完整内层最大化的情况下,高效求解min-max DRO公式?
  • RQ2在样本平均近似中,子集大小的最优增长速率是什么,才能在DRO中平衡随机误差与计算成本?
  • RQ3所提出的方法是否在减少超参数调优需求的同时,实现优于正则化经验风险最小化(ERM)的泛化性能?
  • RQ4DSSG在不同数据集上,针对不同的$d/N$比例和数据特性,性能表现如何?
  • RQ5使用单一$ρ$值(如0.1)的DRO是否能在无需大量超参数搜索的情况下,实现跨数据集的鲁棒泛化?

主要发现

  • DSSG在14个多样化数据集上的测试误分类率与10折交叉验证的ERM相当或更优,其中最佳性能在表2中以粗体突出显示。
  • 在adult和imdb.drama数据集上,$\rho=0.1$的DRO分别实现了$\mathbf{16.6\pm 0.1}$%和$\mathbf{36.2\pm 0.1}$%的测试误差,与最佳ERM结果持平或更优。
  • 在rcv1数据集上,$\rho=0.1$的DRO实现了$\mathbf{5.4\pm 0.0}$%的测试误差,显著优于ERM的$\mathbf{5.6\pm 0.0}$%误差,并优于$\rho=1.0$和$\rho=0.01$的结果。
  • 与10折交叉验证的ERM相比,DSSG将计算成本降低了1至3个数量级,如表1中的CPU时间对比所示。
  • DSSG消除了在ERM中对$\lambda$进行超参数调优的需求,其在各数据集上表现稳定,无需枚举搜索,而ERM方法如图12所示则需大量调参。
  • 理论分析证实,最优子集大小增长速率可平衡随机误差与计算工作量,从而在最小额外开销下实现收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。