Skip to main content
QUICK REVIEW

[论文解读] Doubly Accelerated Stochastic Variance Reduced Dual Averaging Method for Regularized Empirical Risk Minimization

Tomoya Murata, Taiji Suzuki|arXiv (Cornell University)|Mar 1, 2017
Stochastic Gradient Optimization Techniques参考文献 22被引用 14
一句话总结

本文提出了一种用于小批量设置下正则化经验风险最小化的双重加速随机方差减少对偶平均(DASVRDA)方法。通过结合双重加速与方差减少,该方法在非强凸和强凸目标下均实现了最优迭代复杂度,且仅需 $\sqrt{n}$ 的小批量大小,显著提升了现有加速方法的小批量效率。

ABSTRACT

In this paper, we develop a new accelerated stochastic gradient method for efficiently solving the convex regularized empirical risk minimization problem in mini-batch settings. The use of mini-batches is becoming a golden standard in the machine learning community, because mini-batch settings stabilize the gradient estimate and can easily make good use of parallel computing. The core of our proposed method is the incorporation of our new "double acceleration" technique and variance reduction technique. We theoretically analyze our proposed method and show that our method much improves the mini-batch efficiencies of previous accelerated stochastic methods, and essentially only needs size $\sqrt{n}$ mini-batches for achieving the optimal iteration complexities for both non-strongly and strongly convex objectives, where $n$ is the training set size. Further, we show that even in non-mini-batch settings, our method achieves the best known convergence rate for both non-strongly and strongly convex objectives.

研究动机与目标

  • 解决现有加速随机方法在小批量设置下效率低下的问题,即由于批量大小缩放性能差,导致小批量收益有限。
  • 克服方差减少随机方法中加速与小批量利用之间的权衡。
  • 开发一种方法,在实现最优迭代复杂度的同时,将小批量大小降至最低,尤其适用于大规模机器学习问题。
  • 在非小批量和小批量设置下,实现非强凸和强凸目标下目前已知的最佳收敛速率。
  • 理论分析旨在证明该方法在总计算成本和小批量大小需求方面均为最优。

提出的方法

  • 提出一种新颖的对偶平均框架,通过引入双重加速,整合动量与方差减少技术。
  • 将双重加速方案应用于随机方差减少对偶平均(SVRDA)方法,实现更快收敛,同时保持稳定性。
  • 采用加权平均策略获取最终解,其中权重由动量参数导出,以利用局部强凸性。
  • 采用带方差减少的小批量随机梯度估计器,使用控制变量子孙减少梯度噪声。
  • 提出一种新颖的辅助变量 $ z_k $ 更新规则,结合近端与动量步骤,确保在凸与强凸设置下均能收敛。
  • 理论分析基于李雅普诺夫函数与递推不等式,以界定期望次优间隙,从而获得更优的收敛速率。

实验结果

研究问题

  • RQ1能否在小批量设置下有效结合双重加速与方差减少,以实现最优迭代复杂度?
  • RQ2加速随机方法实现最优收敛速率所需的最小小批量大小是多少?
  • RQ3与现有加速方法(如 Katyusha、ASDCA 和 APCG)相比,该方法在小批量效率方面表现如何?
  • RQ4该方法在非小批量设置下是否保持最优收敛速率?其与问题条件数的缩放关系如何?
  • RQ5该方法能否在不依赖全局强凸性假设的前提下,利用局部强凸性?

主要发现

  • 所提出的 DASVRDA 方法在非强凸和强凸目标下均实现了最优迭代复杂度,且仅需 $\sqrt{n}$ 的小批量大小即可达到最优性能。
  • 在小批量设置下,该方法通过将所需小批量大小从 $O(n)$ 降低至 $O(\sqrt{n})$,显著优于以往的加速方法,大幅提升了并行化效率。
  • 对于强凸目标,该方法的总计算成本为 $O\left(d\left(n + \frac{bL}{\mu}\right)\mathrm{log}(1/\varepsilon)\right)$,与目前已知的最佳速率一致。
  • 在非小批量设置下,该方法在非强凸和强凸目标下均实现了目前已知的最佳收敛速率,优于标准的 SVRG 和 SGD。
  • 该方法对条件数具有鲁棒性:与 AccProxSVRG 不同,其无需随 $\kappa$ 增大而增加小批量大小,始终维持 $O(\sqrt{n})$ 的小批量大小,与 $\kappa$ 无关。
  • 理论分析证实,该方法在迭代复杂度与计算成本方面均为最优,收敛速率中不包含额外的对数因子。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。