Skip to main content
QUICK REVIEW

[论文解读] Coordinate Descent Face-Off: Primal or Dual?

Dominik Csiba, Peter Richtárik|arXiv (Cornell University)|May 29, 2016
Stochastic Gradient Optimization Techniques参考文献 6被引用 8
一句话总结

本文对L2正则化经验风险最小化问题中的原始与对偶随机坐标下降(RCD)进行了严格的理论与实证比较,表明数据结构(尤其是稀疏性和特征分布)可颠覆传统直觉:即使n ≫ d,原始RCD也可能优于对偶RCD,反之亦然。令人惊讶的是,一种单一采样策略可同时最小化迭代次数与整体计算复杂度。

ABSTRACT

Randomized coordinate descent (RCD) methods are state-of-the-art algorithms for training linear predictors via minimizing regularized empirical risk. When the number of examples ($n$) is much larger than the number of features ($d$), a common strategy is to apply RCD to the dual problem. On the other hand, when the number of features is much larger than the number of examples, it makes sense to apply RCD directly to the primal problem. In this paper we provide the first joint study of these two approaches when applied to L2-regularized ERM. First, we show through a rigorous analysis that for dense data, the above intuition is precisely correct. However, we find that for sparse and structured data, primal RCD can significantly outperform dual RCD even if $d \ll n$, and vice versa, dual RCD can be much faster than primal RCD even if $n \ll d$. Moreover, we show that, surprisingly, a single sampling strategy minimizes both the (bound on the) number of iterations and the overall expected complexity of RCD. Note that the latter complexity measure also takes into account the average cost of the iterations, which depends on the structure and sparsity of the data, and on the sampling strategy employed. We confirm our theoretical predictions using extensive experiments with both synthetic and real data sets.

研究动机与目标

  • 解决长期存在的问题:在不同数据环境下,原始RCD与对偶RCD在L2正则化经验风险最小化中的优劣比较。
  • 挑战传统观念,即当n ≫ d时原始RCD更优,当d ≫ n时对偶RCD更优,尤其在稀疏或结构化数据中。
  • 识别一种统一的采样策略,使RCD的迭代次数与整体期望计算复杂度均最小化。
  • 建立一个理论框架,将数据结构(稀疏性、特征分布)与原始与对偶RCD的相对性能联系起来。
  • 通过在合成数据和真实数据集(包括新闻与白血病数据)上的广泛实验,验证理论预测。

提出的方法

  • 对L2正则化经验风险最小化问题的原始与对偶形式的RCD收敛速率进行理论分析,基于损失函数的光滑性与凸性假设。
  • 推导依赖于数据矩阵结构的收敛界,特别是X与X^T的谱性质,从而得出决定性能差距的单一量。
  • 提出一种统一的采样策略,同时优化迭代次数与整体期望复杂度,考虑稀疏性与每次迭代的计算成本。
  • 使用具有受控稀疏性(nnz ∈ {1%, 10%, 100%})的合成数据和真实数据集(news, leukemia)进行实证评估,以检验理论预测。
  • 基于X中非零元素的遍历次数进行运行时间比较,并跟踪迭代过程中的误差,以评估收敛速度。
  • 基于理论边界的最坏情况矩阵构造,用于测试鲁棒性并验证推导出的性能指标。

实验结果

研究问题

  • RQ1传统观念是否成立:即当n ≫ d时原始RCD更优,当d ≫ n时对偶RCD更优,该结论是否适用于所有数据类型,包括稀疏和结构化数据?
  • RQ2尽管每次迭代成本不同,是否一种单一采样策略可同时最小化RCD的迭代次数与整体期望计算复杂度?
  • RQ3数据稀疏性与特征分布(如非均匀非零分布模式)如何影响原始与对偶RCD的相对性能?
  • RQ4理论收敛界在具有非均匀稀疏性的现实数据集上的预测与实际性能有多大的一致性?
  • RQ5能否通过从数据矩阵及其转置中导出的单一结构量,量化原始与对偶RCD之间的理论性能差距?

主要发现

  • 对于密集数据,传统直觉成立:当n ≫ d时,原始RCD优于对偶RCD;当d ≫ n时,对偶RCD优于原始RCD。
  • 对于稀疏和结构化数据,即使n ≫ d,原始RCD也可能显著优于对偶RCD;即使d ≫ n,对偶RCD也可能远快于原始RCD。
  • 原始与对偶RCD的性能由一个与数据矩阵及其转置相关的单一结构量决定,该量捕捉了稀疏性与特征分布之间的相互作用。
  • 尽管每次迭代成本不同,一种单一采样策略仍能同时最小化迭代次数的上界与RCD的整体期望复杂度。
  • 在新闻数据集(d ≫ n,密度0.03%)上的实证结果证实,由于特征稀疏性分布不均,对偶RCD更快,与理论预测一致。
  • 在白血病数据集(d ≌ n,100%密度)上,原始RCD更快,运行时间比T_P / T_D ≈ 0.5,证实了在密集设置下原始方法的理论优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。