[论文解读] Faster Coordinate Descent via Adaptive Importance Sampling
本文提出了一种用于凸优化中坐标下降的自适应重要性采样规则,利用对偶残差和原-对偶间隙估计动态调整选择概率。该工作首次对一般凸设置下的自适应采样提供了收敛速率分析,实验证明在Lasso和合页损失SVM问题上,其收敛速度优于均匀采样和固定非均匀采样。
Coordinate descent methods employ random partial updates of decision variables in order to solve huge-scale convex optimization problems. In this work, we introduce new adaptive rules for the random selection of their updates. By adaptive, we mean that our selection rules are based on the dual residual or the primal-dual gap estimates and can change at each iteration. We theoretically characterize the performance of our selection rules and demonstrate improvements over the state-of-the-art, and extend our theory and algorithms to general convex objectives. Numerical evidence with hinge-loss support vector machines and Lasso confirm that the practice follows the theory.
研究动机与目标
- 通过在迭代过程中自适应调整采样概率,提升大规模凸优化中坐标下降方法的收敛速率。
- 基于对偶残差和原-对偶间隙估计,设计随时间演化的采样规则。
- 首次为具有非强凸正则项的一般凸问题中的自适应采样提供收敛速率分析。
- 将理论结果扩展至包括Lasso、SVM和逻辑回归在内的广泛问题类别。
- 通过真实数据集(如rcv1)的实证验证,证明该方法在性能上具有显著提升。
提出的方法
- 采用原-对偶框架,将对偶间隙和对偶残差定义为自适应采样的指标。
- 引入自适应概率分布,优先选择对偶残差较大或对间隙贡献较高的坐标。
- 采用动态采样策略,每轮迭代根据当前对偶残差大小更新选择概率。
- 将方法应用于标准SDCA模板:min_α f(Aα) + Σg_i(α_i),涵盖光滑f和一般凸g_i。
- 在任意采样分布下,为强凸和一般凸情形均推导出收敛保证。
- 实现四种变体:ada-uniform、ada-gap、supportSet-uniform和adaptive,其概率计算方式各不相同。
实验结果
研究问题
- RQ1基于对偶残差或对偶间隙的自适应采样能否在一般凸问题的坐标下降中提升收敛性能?
- RQ2采用迭代相关采样规则的坐标下降,其理论收敛速率如何?
- RQ3在实践中,自适应采样规则与固定非均匀采样及均匀采样相比表现如何?
- RQ4所提方法能否推广至SVM和Lasso之外的广泛机器学习问题?
- RQ5计算自适应概率的计算开销如何?其性能增益是否值得付出该开销?
主要发现
- 所提出的自适应采样规则在理论上和实践中均优于均匀采样和固定非均匀采样。
- 该方法首次为具有非强凸正则项的一般凸问题中的自适应坐标下降提供了收敛速率分析。
- 在rcv1数据集上的数值结果表明,Lasso和SVM问题的对偶间隙和次优性均显著降低。
- ada-gap和ada-uniform变体在收敛速度上优于标准SDCA和固定采样基线。
- 自适应采样策略能有效聚焦于对对偶间隙贡献最大的坐标,从而加速收敛。
- 理论分析可将现有固定非均匀采样和均匀采样结果作为特例恢复。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。