Skip to main content
QUICK REVIEW

[论文解读] Stochastic Optimization with Variance Reduction for Infinite Datasets with Finite-Sum Structure

Alberto Bietti, Julien Mairal|arXiv (Cornell University)|Oct 4, 2016
Neural Networks and Applications被引用 14
一句话总结

本文提出 S-MISO,一种针对具有无限数据集且因数据扰动(如数据增强)而具有有限和结构的随机优化问题的方差缩减算法。通过利用有限和结构的同时处理随机梯度,S-MISO 实现了线性收敛,且常数因子小于 SGD,其依赖仅来自扰动引起的梯度方差,而非数据采样方差。

ABSTRACT

Stochastic optimization algorithms with variance reduction have proven successful for minimizing large finite sums of functions. Unfortunately, these techniques are unable to deal with stochastic perturbations of input data, induced for example by data augmentation. In such cases, the objective is no longer a finite sum, and the main candidate for optimization is the stochastic gradient descent method (SGD). In this paper, we introduce a variance reduction approach for these settings when the objective is composite and strongly convex. The convergence rate outperforms SGD with a typically much smaller constant factor, which depends on the variance of gradient estimates only due to perturbations on a single example.

研究动机与目标

  • 填补机器学习问题中涉及因随机数据扰动而具有有限和结构的无限数据集的优化方法空白。
  • 克服标准方差缩减方法的局限性,后者需要精确计算有限和梯度,在因扰动导致梯度为随机时会失效。
  • 开发一种算法,在保留有限和方差缩减快速收敛特性的同时,兼容由数据增强或噪声引起的随机梯度。
  • 通过消除对数据点间采样方差的依赖,实现比 SGD 更快的收敛,仅保留在扰动引起的梯度方差上的依赖。
  • 弥合有限和增量方法与无限数据集随机逼近方法之间的差距,实现在混合设置下的高效优化。

提出的方法

  • 提出 S-MISO,一种 MISO 算法的随机变体,专为在随机扰动下具有有限和结构的复合强凸目标函数设计。
  • 使用一阶随机 oracle 访问形如 $ f_i(x) = \mathbb{E}_\rho[\tilde{f}_i(x, \rho)] $ 的梯度,其中 $ \rho $ 表示随机扰动。
  • 为每个数据点维护过去梯度的移动平均,以减少方差,将 SAGA 风格的方差缩减技术适配到随机设置中。
  • 应用带有步长 $ \eta_t $ 的近端更新规则,在强凸性和利普希茨光滑性假设下确保收敛。
  • 推导出到最优解期望平方距离的递推界:$ \mathbb{E}[\|x_t - x^*\|^2] \leq (1 - \mu \eta_t) \mathbb{E}[\|x_{t-1} - x^*\|^2] + \eta_t^2 \sigma_{\text{tot}}^2 $,其中 $ \sigma_{\text{tot}}^2 $ 捕获了扰动引起的梯度噪声。
  • 将方法扩展至非均匀采样和平均方案,提升病态条件问题中的收敛性能。

实验结果

研究问题

  • RQ1方差缩减技术能否被适配到因随机数据变换而具有有限和结构的优化问题?
  • RQ2是否存在一种方法,能够将方差缩减的快速收敛性与随机梯度方法在无限数据设置下的鲁棒性相结合?
  • RQ3此类方法的收敛速率如何?与 SGD 相比,其对梯度方差的依赖关系如何?
  • RQ4该算法能否在减少数据点间采样方差影响的同时保持线性收敛?
  • RQ5在数据增强或噪声注入下,该算法在实际中表现如何,特别是在病态条件问题中?

主要发现

  • S-MISO 实现了比 SGD 更小的渐近误差的线性收敛,收敛速率仅依赖于扰动引起的梯度方差 $ \sigma_p^2 $,而不依赖于数据点间的采样方差。
  • S-MISO 的迭代复杂度为 $ O\left(\frac{L}{\mu}\log\frac{1}{\bar{\epsilon}} + \frac{\sigma_{\text{tot}}^2}{\mu\epsilon}\right) $,其中 $ \sigma_{\text{tot}}^2 $ 包含扰动噪声,且常数因子显著小于 SGD。
  • 在乳腺癌数据集上的实验结果表明,S-MISO 在病态条件问题(高条件数 $ \kappa = L/\mu $)和高 Dropout 率下,优于 SGD 平均方法。
  • 平均方案对 S-MISO 和 SGD 均有改善收敛的效果,但对 S-MISO 的提升更为显著,尤其是在问题病态时。
  • S-MISO 是首个能自然地在有限和增量方法与随机逼近方法之间插值的算法,同时在混合设置中保持无偏性和高效性。
  • 该方法在非均匀采样下依然有效,收敛界通过调整步长和依赖于采样分布的方差项进行适应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。