[论文解读] Variance Reduced methods for Non-convex Composition Optimization
本文提出两种方差减少的随机算法,用于解决具有有限求和结构的非凸复合优化问题,其内层和外层函数均为有限求和形式。通过对方程内层函数估计应用方差减少技术,该方法显著降低了查询复杂度——尤其在内层分量函数数量较大时表现更优——并首次对这类非凸随机复合问题的查询复杂度进行了理论分析。
This paper explores the non-convex composition optimization in the form including inner and outer finite-sum functions with a large number of component functions. This problem arises in some important applications such as nonlinear embedding and reinforcement learning. Although existing approaches such as stochastic gradient descent (SGD) and stochastic variance reduced gradient (SVRG) descent can be applied to solve this problem, their query complexity tends to be high, especially when the number of inner component functions is large. In this paper, we apply the variance-reduced technique to derive two variance reduced algorithms that significantly improve the query complexity if the number of inner component functions is large. To the best of our knowledge, this is the first work that establishes the query complexity analysis for non-convex stochastic composition. Experiments validate the proposed algorithms and theoretical analysis.
研究动机与目标
- 解决现有随机方法(如SGD和SVRG)在应用于具有大量内层分量函数的非凸复合问题时查询复杂度过高的问题。
- 克服在使用采样子函数而非完整求和来近似内层有限求和函数 $ G(x) $ 时产生的梯度估计偏差问题。
- 设计针对两个有限求和结构复合问题的方差减少技术,以降低查询复杂度,同时保持收敛性保证。
- 建立首个针对此类双层有限求和结构下非凸随机复合优化问题的理论查询复杂度分析。
- 在非线性嵌入和强化学习等实际应用中验证所提算法,证明其在效率上优于基线方法。
提出的方法
- 提出一种新颖的方差减少算法,将SVRG技术同时应用于外层和内层有限求和结构,确保梯度估计无偏。
- 设计双层循环结构:外层循环使用外层函数的完整梯度估计,内层循环使用内层函数的方差减少梯度。
- 采用控制变量子方法,降低复合函数 $ f(x) = F(G(x)) $ 梯度估计的方差,特别针对内层函数 $ G(x) $。
- 通过将SVRG框架适配至复合设置,提出两种算法——SCVR及其变体,并对其收敛性和查询复杂度进行理论分析。
- 通过在外层函数中保持完整求和计算,同时减少内层函数估计的方差,确保梯度估计 $ ( abla G_j(x))^T \nabla F_i(G(x)) $ 保持无偏。
- 利用几何级数论证推导出期望误差衰减的递归不等式,证明在非凸性假设下的收敛性。
实验结果
研究问题
- RQ1方差减少技术能否有效应用于非凸复合问题中内层有限求和函数,以降低查询复杂度?
- RQ2针对具有两个有限求和结构的非凸随机复合优化问题,方差减少方法的理论查询复杂度是多少?
- RQ3当内层分量函数数量较大时,所提方法在收敛速度和查询效率方面与SGD和SVRG相比如何?
- RQ4所提算法能否在复合设置中保持无偏梯度估计的同时减少方差?
- RQ5在非线性嵌入和强化学习等实际应用中,所提方法是否优于现有方法(如SCGD、Acc-SCGD和ASC-PG)?
主要发现
- 所提SCVR算法的查询复杂度为 $ \mathcal{O}(n^{4/5}/\varepsilon) $,当 $ m_0 > 1 $ 时,显著低于SGD($ \mathcal{O}(n^{m_0}/\varepsilon^2) $)和完整梯度下降($ \mathcal{O}(n^{m_0}/\varepsilon) $)。
- 所提方法的查询复杂度随内层分量函数数量 $ m $ 的增长而有利地扩展,在 $ m $ 较大时优于现有方法。
- 理论分析证实,所提算法在非凸性假设下以次线性速率收敛,且在递归不等式条件下期望误差呈几何级数衰减。
- 在非线性嵌入和强化学习应用中的实验验证了所提算法相比基线方法具有更快的收敛速度和更低的查询复杂度。
- 在查询复杂度方面,所提方法优于SCGD、Acc-SCGD和ASC-PG,且在所有对比方法中具有最佳的梯度复杂度。
- 该分析首次建立了具有双层有限求和结构的非凸随机复合问题的查询复杂度上界,填补了理论理解中的关键空白。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。