[论文解读] Projection Efficient Subgradient Method and Optimal Nonsmooth Frank-Wolfe Method
该论文提出了 MOPES 和 MOLES,这两种新颖的一阶方法用于非光滑凸优化,可在保持第一阶预言机(FO)调用次数为最优的 $\mathcal{O}(\varepsilon^{-2})$ 的同时,将投影预言机(PO)和线性最小化预言机(LMO)的调用次数分别降低至 $\mathcal{O}(\varepsilon^{-1})$ 和 $\mathcal{O}(\varepsilon^{-2})$,从而解决了非光滑 Frank-Wolfe 方法中长期存在的开放问题。该方法利用 Moreau-Yosida 平滑技术与加速算法,在较弱的利普希茨扩展假设下,实现了 FO 与 PO/LMO 依赖关系的解耦。
We consider the classical setting of optimizing a nonsmooth Lipschitz continuous convex function over a convex constraint set, when having access to a (stochastic) first-order oracle (FO) for the function and a projection oracle (PO) for the constraint set. It is well known that to achieve $ε$-suboptimality in high-dimensions, $Θ(ε^{-2})$ FO calls are necessary. This is achieved by the projected subgradient method (PGD). However, PGD also entails $O(ε^{-2})$ PO calls, which may be computationally costlier than FO calls (e.g. nuclear norm constraints). Improving this PO calls complexity of PGD is largely unexplored, despite the fundamental nature of this problem and extensive literature. We present first such improvement. This only requires a mild assumption that the objective function, when extended to a slightly larger neighborhood of the constraint set, still remains Lipschitz and accessible via FO. In particular, we introduce MOPES method, which carefully combines Moreau-Yosida smoothing and accelerated first-order schemes. This is guaranteed to find a feasible $ε$-suboptimal solution using only $O(ε^{-1})$ PO calls and optimal $O(ε^{-2})$ FO calls. Further, instead of a PO if we only have a linear minimization oracle (LMO, a la Frank-Wolfe) to access the constraint set, an extension of our method, MOLES, finds a feasible $ε$-suboptimal solution using $O(ε^{-2})$ LMO calls and FO calls---both match known lower bounds, resolving a question left open since White (1993). Our experiments confirm that these methods achieve significant speedups over the state-of-the-art, for a problem with costly PO and LMO calls.
研究动机与目标
- 为解决投影预言机(PO)调用在投影次梯度法(PGD)中的高计算成本问题,其复杂度为 $\mathcal{O}(\varepsilon^{-2})$,在投影计算昂贵的问题中主导了运行时间。
- 弥合标准一阶和投影预言机访问下,非光滑凸优化中最优 FO 复杂度与次优 PO 复杂度之间的差距。
- 开发一种方法,在对目标函数在约束集外的区域满足较弱的利普希茨扩展假设的前提下,保持最优的 $\mathcal{O}(\varepsilon^{-2})$ FO 调用次数,同时将 PO 调用次数减少至 $\mathcal{O}(\varepsilon^{-1})$。
- 将该方法扩展至 Frank-Wolfe 风格的方法,使用线性最小化预言机(LMO),实现最优的 $\mathcal{O}(\varepsilon^{-2})$ LMO 和 FO 调用次数,与已知的下界一致。
提出的方法
- 提出 MOPES(Moreau 投影高效子梯度法),通过在目标函数的 Moreau 包络上应用加速一阶方法来实现平滑化,从而实现更高效的最小化,同时显著减少 PO 调用次数。
- 采用 Moreau-Yosida 正则化将非光滑问题转化为光滑问题,从而允许使用加速算法,降低对投影预言机调用的依赖。
- 通过利用 Moreau 包络的光滑性,并结合仔细的迭代更新策略,实现算法对 FO 和 PO 调用依赖关系的解耦。
- 将框架扩展至 MOLES(Moreau 优化 LMO 高效子梯度法),用线性最小化预言机(LMO)替代 PO 访问,使其适用于 Frank-Wolfe 风格的设置。
- 采用一个较弱的假设:目标函数在约束集的稍大邻域内仍保持利普希茨连续,从而允许在集合 $\mathcal{X}$ 外进行 FO 查询。
- 采用两阶段策略:首先通过次梯度近似 Moreau 包络,然后应用 Nesterov 风格的加速算法,以最少的 PO 或 LMO 调用高效最小化该包络。
实验结果
研究问题
- RQ1我们能否设计一种非光滑凸优化的一阶方法,实现最优的 $\mathcal{O}(\varepsilon^{-2})$ FO 调用次数,同时将 PO 调用次数显著降低至低于 $\mathcal{O}(\varepsilon^{-2})$?
- RQ2在目标函数的利普希茨连续性在约束集外得到较弱扩展的前提下,是否可能实现 $\mathcal{O}(\varepsilon^{-1})$ 的 PO 调用次数以获得 $\varepsilon$-次优解?
- RQ3能否使 Frank-Wolfe 框架优化至与非光滑设置中已知的 $\mathcal{O}(\varepsilon^{-2})$ 下界一致的 LMO 和 FO 调用次数,从而解决自 2013 年以来的开放问题?
- RQ4使用 Moreau-Yosida 平滑化是否能实现相对于标准投影子梯度法或 Frank-Wolfe 方法的、可证明更优的 FO 与 PO/LMO 调用之间的权衡?
主要发现
- MOPES 在满足较弱利普希茨扩展假设的前提下,实现了 $\mathcal{O}(\varepsilon^{-1})$ 的投影预言机调用次数和 $\mathcal{O}(\varepsilon^{-2})$ 的第一阶预言机调用次数,以获得 $\varepsilon$-次优解,优于 PGD 的 $\mathcal{O}(\varepsilon^{-2})$ PO 调用次数。
- MOLES 实现了 $\mathcal{O}(\varepsilon^{-2})$ 的线性最小化预言机(LMO)和 FO 调用次数,与已知下界一致,解决了非光滑 Frank-Wolfe 方法中的一个开放问题。
- 在投影和 LMO 计算昂贵的问题中,该方法在实际运行时间上优于当前最先进的方法,尤其在具有 $\ell_1$ 或核范数约束的高维问题中表现突出。
- 理论分析证实,MOPES 和 MOLES 在保持最优 FO 复杂度的同时,将 PO 和 LMO 复杂度降低了 $\varepsilon^{-1}$ 的因子,实现了投影次数的无维度复杂度。
- 实验结果表明,与 PGD 和 Frank-Wolfe 变体相比,该方法在 $\ell_1$-范数 SVM 和具有核范数约束的矩阵 SVM 等问题中实现了显著的速度提升,其中投影/LMO 计算尤为昂贵。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。