Skip to main content
QUICK REVIEW

[论文解读] Coordinate Descent with Arbitrary Sampling II: Expected Separable Overapproximation

Zheng Qu, Peter Richtárik|arXiv (Cornell University)|Dec 27, 2014
Stochastic Gradient Optimization Techniques参考文献 25被引用 16
一句话总结

本文提出了一种通用框架,用于推导随机坐标下降方法中任意采样方式的期望可分上界(Expected Separable Overapproximation, ESO)不等式。通过分析采样概率矩阵与数据相关矩阵的Hadamard积的特征值,作者为一大类函数建立了ESO界,从而实现了更紧致的收敛复杂度分析,并为串行与并行设置下的最优采样设计提供了支持。

ABSTRACT

The design and complexity analysis of randomized coordinate descent methods, and in particular of variants which update a random subset (sampling) of coordinates in each iteration, depends on the notion of expected separable overapproximation (ESO). This refers to an inequality involving the objective function and the sampling, capturing in a compact way certain smoothness properties of the function in a random subspace spanned by the sampled coordinates. ESO inequalities were previously established for special classes of samplings only, almost invariably for uniform samplings. In this paper we develop a systematic technique for deriving these inequalities for a large class of functions and for arbitrary samplings. We demonstrate that one can recover existing ESO results using our general approach, which is based on the study of eigenvalues associated with samplings and the data describing the function.

研究动机与目标

  • 建立一种系统化方法,用于推导任意采样方式(不限于均匀或独立同分布)的期望可分上界(ESO)不等式。
  • 通过基于采样矩阵与数据矩阵特征值分析的统一框架,整合并推广文献中已有的ESO结果。
  • 通过推导针对问题结构定制的最优采样概率,实现随机坐标下降方法更紧致的收敛复杂度界。
  • 支持在一般采样方案下,设计具有可证明收敛保证的加速与并行坐标下降方法。
  • 通过在dorothea与w8a等真实数据集上的复杂度对比,展示改进的ESO参数对实际性能的显著影响。

提出的方法

  • 该方法基于分析采样概率矩阵 $ P $ 与数据相关正定矩阵 $ A^\top A $ 的Hadamard积的最大特征值与归一化最大特征值,其中 $ A $ 编码了函数的结构。
  • 对于二次函数 $ f(x) = \|Ax\|^2 $,ESO不等式退化为一个特征值问题:$ \mathbb{E}[\|\sum_{i\in\hat{S}} A_i h_i\|^2] \leq h^\top \operatorname{Diag}(p \circ v) h $,其中 $ v $ 由 $ P \circ A^\top A $ 的谱性质导出。
  • 作者通过 $ P \circ A^\top A $ 的谱范数推导出通用的ESO界,从而得到 $ v_i $ 的显式表达式,例如在均匀采样下 $ v_i = \max_i \|A_i\|^2 \cdot \frac{\tau}{n} $,并在非均匀采样下得到更精细的表达式。
  • 关键技巧在于将ESO参数 $ v $ 表示为 $ P \circ A^\top A $ 的最大特征值的函数,从而可将复杂度界表示为 $ \|d\|_q $ 范数的形式。
  • 该框架可推导出最小化复杂度界条件数的最优采样概率 $ p_i $,在串行方法中,结果为 $ p_i \propto (w_i (x_i^0 - x_i^*)^2)^{1/3} $。
  • 该方法通过将坐标替换为块并相应调整范数与矩阵结构,被扩展至块坐标下降。

实验结果

研究问题

  • RQ1是否可以为均匀或独立同分布之外的任意采样方式系统化地推导ESO不等式?
  • RQ2采样概率矩阵与数据矩阵的谱性质在决定ESO参数 $ v $ 时起什么作用?
  • RQ3如何推导最优采样概率以最小化随机坐标下降的迭代复杂度?
  • RQ4能否通过这一通用的基于特征值的框架重新推导出已知的均匀采样ESO结果?
  • RQ5计算精细化 $ v $ 所带来的计算开销与迭代复杂度降低之间的权衡如何?

主要发现

  • 本文通过分析Hadamard积 $ P \circ A^\top A $ 的最大特征值,建立了一种通用方法,用于推导任意采样方式的ESO不等式,其中 $ P $ 为采样概率矩阵。
  • 对于 $ \tau = 256 $ 的dorothea数据集,使用公式60计算 $ v $ 可将迭代复杂度降低至 $ O(256.91 + \frac{256.91}{\lambda} \log(\frac{1}{\epsilon})) $,而使用公式58则为 $ O(8715.8 + \frac{16.68}{\lambda} \log(\frac{1}{\epsilon})) $,显示出显著改进。
  • 最优串行采样概率 $ p_i \propto (w_i (x_i^0 - x_i^*)^2)^{1/3} $ 导致复杂度界 $ C_{\text{opt}} = \sqrt{2} \|d\|_2^3 / \sqrt{\epsilon} $,当 $ \|d\|_6 = \|d\|_2 $ 时,相比均匀采样可提升最多 $ n $ 倍。
  • 对于w8a数据集,使用公式60计算 $ v $ 的时间仅为一次数据遍历的1.8倍,同时与公式57相比,条件数降低了约380倍。
  • 该框架通过一种不同的、基于特征值的推导方式,重新获得了已知的均匀采样ESO结果,证明了其通用性与统一性。
  • 该方法通过采用数据感知的非均匀采样策略,使加速坐标下降方法的收敛速率可被严格证明优于传统方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。