Skip to main content
QUICK REVIEW

[论文解读] Accelerated Method for Stochastic Composition Optimization with Nonsmooth Regularization

Zhouyuan Huo, Bin Gu|arXiv (Cornell University)|Nov 10, 2017
Stochastic Gradient Optimization Techniques被引用 21
一句话总结

本文提出了一种方差减少的随机复合梯度方法 VRSC-PG,用于具有非光滑正则化的随机复合优化。通过整合方差减少与近端更新,该方法在强凸问题中实现了线性收敛,并将一般问题的最先进收敛速率从 $O(T^{-1/2})$ 提升至 $O((n_1+n_2)^{2/3}T^{-1})$。

ABSTRACT

Stochastic composition optimization draws much attention recently and has been successful in many emerging applications of machine learning, statistical analysis, and reinforcement learning. In this paper, we focus on the composition problem with nonsmooth regularization penalty. Previous works either have slow convergence rate or do not provide complete convergence analysis for the general problem. In this paper, we tackle these two issues by proposing a new stochastic composition optimization method for composition problem with nonsmooth regularization penalty. In our method, we apply variance reduction technique to accelerate the speed of convergence. To the best of our knowledge, our method admits the fastest convergence rate for stochastic composition optimization: for strongly convex composition problem, our algorithm is proved to admit linear convergence; for general composition problem, our algorithm significantly improves the state-of-the-art convergence rate from $O(T^{-1/2})$ to $O((n_1+n_2)^{{2}/{3}}T^{-1})$. Finally, we apply our proposed algorithm to portfolio management and policy evaluation in reinforcement learning. Experimental results verify our theoretical analysis.

研究动机与目标

  • 解决现有具有非光滑正则化的随机复合优化方法中缺乏完整收敛性分析以及收敛速度缓慢的问题。
  • 克服在内层函数评估成本较高的复合问题中无偏梯度估计带来的高计算成本。
  • 开发一种结合方差减少与近端更新的方法,以有效处理非光滑正则化惩罚项。
  • 实现比以往方法更快的收敛速率,尤其在非强凸设置下表现更优。
  • 为具有非光滑正则化的强凸与一般复合问题提供理论保证。

提出的方法

  • 提出一种新颖的方差减少随机复合近端梯度(VRSC-PG)方法,以加速随机复合问题中的收敛。
  • 引入一种采样预言机模型,用于统计对 $G_j(x)$、$\nabla G_j(x)$ 和 $\nabla F_i(y)$ 的查询次数,从而实现查询复杂度的公平比较。
  • 对方函数与内函数的随机梯度应用方差减少技术,降低噪声并加速收敛。
  • 采用近端更新步骤以处理非光滑正则化项 $h(x)$,确保即使 $h(x)$ 不可微也能实现收敛。
  • 利用多级采样策略与递归梯度估计,在最小化计算开销的同时保持低方差。
  • 通过李雅普诺夫函数与递推不等式建立理论收敛边界,以分析期望次优性差距。

实验结果

研究问题

  • RQ1方差减少方法能否在具有非光滑正则化的随机复合问题中实现线性收敛?
  • RQ2具有非光滑正则化的通用(非强凸)随机复合问题的最优收敛速率是多少?
  • RQ3与 SCGD、ASC-PG 和 com-SVR-ADMM 等现有方法相比,所提方法在查询复杂度与收敛速率方面表现如何?
  • RQ4为确保在存在非光滑正则化情况下的线性收敛,算法参数需满足哪些必要条件?
  • RQ5当内层与外层函数为非凸但光滑时,该方法是否仍能保持快速收敛?

主要发现

  • 对于强凸复合问题,VRSC-PG 以速率 $O\left(\rho^{\frac{T}{n_1+n_2+\kappa^3}}\right)$ 实现线性收敛,优于以往方法。
  • 对于一般(非强凸)问题,收敛速率为 $O\left((n_1+n_2)^{2/3}T^{-1}\right)$,显著优于先前最先进水平的 $O(T^{-1/2})$。
  • 该方法是首个为具有非光滑正则化的随机复合问题提供完整收敛性分析的方法,涵盖强凸与一般情形。
  • 理论分析证实,为实现线性收敛,相关方法(如 com-SVR-ADMM)中的参数 $A$ 与 $m$ 必须与 $\kappa^2$ 成比例,而这一条件在以往工作中未被探讨。
  • 在投资组合管理与强化学习策略评估中的实验结果验证了理论发现,并展示了优于基线方法的性能。
  • 该方法在每轮迭代中保持低查询复杂度,同时实现更快收敛,适用于内层函数评估成本较高的大规模应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。