[论文解读] From low probability to high confidence in stochastic convex optimization
本文提出 proxBoost,一种通用方法,可将任意低置信度的随机优化算法转化为适用于强凸问题的高置信度收敛保证算法。通过结合鲁棒距离估计与近端点法,该方法仅需对置信度水平实现对数级开销,且对条件数仅呈现多对数依赖,显著优于标准方法的样本复杂度。
Standard results in stochastic convex optimization bound the number of samples that an algorithm needs to generate a point with small function value in expectation. More nuanced high probability guarantees are rare, and typically either rely on "light-tail" noise assumptions or exhibit worse sample complexity. In this work, we show that a wide class of stochastic optimization algorithms for strongly convex problems can be augmented with high confidence bounds at an overhead cost that is only logarithmic in the confidence level and polylogarithmic in the condition number. The procedure we propose, called proxBoost, is elementary and builds on two well-known ingredients: robust distance estimation and the proximal point method. We discuss consequences for both streaming (online) algorithms and offline algorithms based on empirical risk minimization.
研究动机与目标
- 开发一种通用且低成本的方法,将低置信度随机优化算法转换为高置信度算法,且无需施加严格的噪声假设。
- 在强凸设置下,将样本复杂度对置信度 $p$ 的依赖从 $\mathcal{O}(1/p)$ 降低至 $\mathcal{O}(\log(1/p))$。
- 保持对条件数 $\kappa$ 的有利依赖,实现多对数缩放,而非多项式或指数增长。
- 将高置信度保证扩展至在线(流式)与离线(经验风险最小化)优化框架。
提出的方法
- 该方法使用黑箱最小化预言机 $\mathcal{M}(f,\epsilon)$,以至少 $2/3$ 的概率返回子最优性 $\leq \epsilon$ 的点。
- 通过 $\text{RobustGap}$ 过程进行鲁棒间隙估计,利用多个预言机输出中的聚类,识别接近最小值点的解。
- 迭代应用近端点法,逐步增加正则化参数 $\lambda_i = \mu 2^i$,以逐步精炼解。
- 该算法名为 BoostAlgC,结合鲁棒估计与近端随机梯度步长,确保高概率收敛。
- 总成本为 $\mathcal{O}(\log(\log \kappa / p) \cdot \log \kappa \cdot \mathcal{C}_{\mathcal{M}}(f, \epsilon / \log \kappa))$,对 $1/p$ 实现对数依赖,对 $\kappa$ 实现多对数依赖。
- 通过使用随机梯度方法的近端扩展,该方法适用于光滑与非光滑复合问题。
实验结果
研究问题
- RQ1是否可将一大类随机优化算法增强为在无严格噪声假设下提供高置信度收敛?
- RQ2在强凸设置下,将低置信度预言机转换为高置信度预言机所需的最小开销是多少?
- RQ3如何结合鲁棒距离估计与近端方法,以最小样本复杂度实现高概率保证?
- RQ4所得到的算法能否在实现对 $1/p$ 的对数依赖的同时,对条件数 $\kappa$ 保持有利依赖?
主要发现
- 所提出的 proxBoost 方法实现高置信度收敛,总成本为 $\mathcal{O}(\log(\log \kappa / p) \cdot \log \kappa \cdot \mathcal{C}_{\mathcal{M}}(f, \epsilon / \log \kappa))$,确保对 $1/p$ 的对数依赖与对 $\kappa$ 的多对数依赖。
- 对于目标精度 $\epsilon$ 与失败概率 $p$,该算法需调用基础预言机 $\lceil 18\ln(\frac{4+2\lceil\log_2 \kappa\rceil}{p}) \rceil \cdot \lceil 2 + \log_2 \kappa \rceil$ 次。
- 总随机梯度评估次数为 $\mathcal{O}(\log(1/p) \cdot \log \kappa \cdot \frac{\sigma^2}{L\epsilon})$,与光滑情况下的标准方法样本复杂度一致。
- 初始化误差被限制在 $\frac{9\kappa + 1 + 2\lceil \log_2 \kappa \rceil}{2 + 2\lceil \log_2 \kappa \rceil} \epsilon$ 以内,确保收敛至目标精度。
- 通过近端扩展,该方法可推广至复合问题,且样本复杂度与光滑情况相同。
- 该方法对重尾噪声具有鲁棒性,无需轻尾假设,因此具有广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。