Skip to main content
QUICK REVIEW

[论文解读] Mini-batch stochastic gradient descent with dynamic sample sizes

Michael R. Metel|arXiv (Cornell University)|Aug 2, 2017
Stochastic Gradient Optimization Techniques参考文献 9被引用 5
一句话总结

本文提出了一种用于随机梯度下降(SGD)的动态小批量样本量规则,通过基于梯度估计不确定性的维度自适应调整批量大小,以高概率确保下降方向。该方法利用样本协方差推导的置信区间,最小化不必要的计算,同时提升收敛性能,在两个真实世界优化问题中优于固定批量的SGD。

ABSTRACT

We focus on solving constrained convex optimization problems using mini-batch stochastic gradient descent. Dynamic sample size rules are presented which ensure a descent direction with high probability. Empirical results from two applications show superior convergence compared to fixed sample implementations.

研究动机与目标

  • 解决大规模凸优化中小批量SGD的计算成本与梯度估计精度之间的权衡问题。
  • 开发一种样本量规则,以高概率确保下降方向,同时最小化所用样本数。
  • 通过基于梯度不确定性的动态批量大小调整,实际提升收敛速度。
  • 提供一种实用的自适应替代方案,以替代固定批量SGD,在不引入过度计算的前提下降低方差。

提出的方法

  • 该方法使用大小为 $ N^i $ 的小批量估计梯度,计算样本均值 $ \hat{g}(x^i) $ 和样本协方差矩阵 $ \hat{\Sigma}(x^i) $。
  • 对于每个维度 $ k $,利用标准正态分布累积分布函数估计真实梯度 $ g(x^i)_k $ 为正(或负)的概率:$ \Phi\left( \frac{|\hat{g}(x^i)_k|}{\sqrt{\hat{\Sigma}(x^i)_{kk}}} \right) $。
  • 推导出一种基于维度的样本量规则,以实现目标下降概率 $ 1 - \alpha $,公式为 $ N_k^{i+1} = \left\lceil N_k^i \cdot \frac{\hat{\Sigma}(x^i)_{kk} \cdot (\Phi^{-1}(1 - \alpha))^2}{\hat{g}(x^i)^2_k} \right\rceil $。
  • 还提出了一种单一样本量规则,将相同逻辑全局应用于所有维度,使用最大梯度幅值和平均协方差。
  • 该算法在SGD更新中使用这些动态批量大小:$ x^{i+1} = \pi\left( x^i - \frac{\eta^i}{N^i} \sum_{j=1}^{N^i} \nabla F(x^i, y_j^i) \right) $。
  • 该方法假设梯度估计的渐近正态性,并使用t分布近似,后简化为正态分布以提升计算可行性。

实验结果

研究问题

  • RQ1动态样本量选择能否在确保高概率下降的同时,提升小批量SGD的收敛性能?
  • RQ2为确保以置信度 $ 1 - \alpha $ 实现下降方向,每个维度所需的最少样本数是多少?
  • RQ3与固定批量SGD相比,基于维度的自适应采样在收敛速度和稳定性方面表现如何?
  • RQ4该方法能否在不牺牲实际应用中优化性能的前提下,降低计算成本?

主要发现

  • 基于维度梯度不确定性的动态样本量规则显著提升了收敛速度,相较于样本量为32、256和512的固定批量SGD。
  • 在报童问题中,维度自适应规则在基础SGD和Adam优化下均实现了比固定批量方法更快的收敛。
  • 在期权投资组合问题中,动态方法在时间维度上的期望效用表现优于固定批量实现。
  • 在两个测试应用中,维度自适应更新规则始终优于单一样本量规则。
  • 即使计算开销极小,也观察到更优的收敛性能,因为该方法仅在必要时调整批量大小以确保下降。
  • 实证结果证实,该方法在最小化冗余采样同时保持高下降概率方面表现良好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。