[论文解读] Doubly Stochastic Primal-Dual Coordinate Method for Empirical Risk Minimization and Bilinear Saddle-Point Problem
本文提出了一种用于经验风险最小化的双重随机原始-对偶坐标(DSPDC)方法,将问题重新表述为双线性鞍点问题。通过在每次迭代中随机采样原始变量和对偶变量的块,DSPDC 在数据具有因子分解结构或近端映射计算成本较高时,相较于现有方法实现了更低的迭代复杂度,且在目标函数差距和最优解距离方面均证明了收敛性。
We proposed a doubly stochastic primal-dual coordinate (DSPDC) optimization algorithm for empirical risk minimization, which can be formulated as a bilinear saddle-point problem. In each iteration, our method randomly samples a block of coordinates of the primal and dual solutions to update. The convergence of our method is established in both the distance from the current iterate to the optimal solution and the primal-dual objective gap. We show that the proposed method has a lower overall complexity than existing coordinate methods when either the data matrix has a factorized structure or the proximal mapping on each block is computationally expensive, e.g., involves an eigenvalue decomposition. Furthermore, we give a theoretical lower bound on the iteration complexity of a general family of primal-dual (block) coordinate methods for bilinear saddle-point problems, which also includes DSPDC.
研究动机与目标
- 开发一种适用于大规模数据的高效优化方法,以实现良好的可扩展性。
- 解决块坐标方法中近端映射计算成本过高的问题,特别是当其涉及如特征值分解等昂贵运算时。
- 通过利用数据结构或昂贵的近端运算,相较于现有坐标方法,降低整体迭代复杂度。
- 在原始-对偶目标函数差距和当前迭代点与最优解的距离两个方面,建立理论收敛保证。
提出的方法
- 该方法将经验风险最小化问题表述为涉及原始变量和对偶变量的双线性鞍点问题。
- 在每次迭代中,随机选择一组原始和对偶坐标块进行更新,从而实现高效的规模化计算。
- 采用对原始和对偶变量的块坐标下降方法,更新过程受鞍点结构的引导。
- 算法通过随机采样坐标块来降低每次迭代的计算成本,同时在较弱假设下保持收敛性。
- 在每个块上引入近端映射,当计算可行时可高效更新。
- 收敛性分析基于原始-对偶目标函数差距以及当前迭代点与最优解的距离。
实验结果
研究问题
- RQ1双重随机原始-对偶坐标方法是否能在经验风险最小化问题中实现低于现有方法的迭代复杂度?
- RQ2当数据矩阵具有因子分解结构时,该方法表现如何?
- RQ3对于一类通用的原始-对偶块坐标方法,其迭代复杂度的理论下界是什么?
- RQ4当块上的近端映射计算成本较高时,该方法是否仍能保持收敛?
- RQ5随机块采样策略如何影响收敛速度和整体复杂度?
主要发现
- 当数据矩阵具有因子分解结构时,DSPDC 的整体迭代复杂度低于现有坐标方法。
- 当块上的近端映射计算成本较高(如需要特征值分解)时,该方法表现出更高的效率。
- 在原始-对偶目标函数差距和当前迭代点与最优解的距离两个方面均建立了收敛性。
- 为一类通用的原始-对偶(块)坐标方法(包括 DSPDC)推导出了迭代复杂度的理论下界。
- 在块级近端操作成本较高或数据呈现低秩结构的场景下,该方法尤其具有优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。