Skip to main content
QUICK REVIEW

[论文解读] Proximal Quasi-Newton for Computationally Intensive L1-regularized M-estimators

Kai Zhong, En-Hsu Yen|arXiv (Cornell University)|Jun 27, 2014
Machine Learning and Algorithms参考文献 26被引用 15
一句话总结

本文提出一种带有激进活动集选择的近端拟牛顿算法,用于计算密集型 $μat$-正则化 M-估计器,特别适用于条件随机场(CRFs)。通过利用常数零空间强凸性(CNSC),该方法在不假设强凸性的情况下实现了可证明的超线性收敛,且在序列标注和层次分类任务中优于最先进方法。

ABSTRACT

We consider the class of optimization problems arising from computationally intensive L1-regularized M-estimators, where the function or gradient values are very expensive to compute. A particular instance of interest is the L1-regularized MLE for learning Conditional Random Fields (CRFs), which are a popular class of statistical models for varied structured prediction problems such as sequence labeling, alignment, and classification with label taxonomy. L1-regularized MLEs for CRFs are particularly expensive to optimize since computing the gradient values requires an expensive inference step. In this work, we propose the use of a carefully constructed proximal quasi-Newton algorithm for such computationally intensive M-estimation problems, where we employ an aggressive active set selection technique. In a key contribution of the paper, we show that the proximal quasi-Newton method is provably super-linearly convergent, even in the absence of strong convexity, by leveraging a restricted variant of strong convexity. In our experiments, the proposed algorithm converges considerably faster than current state-of-the-art on the problems of sequence labeling and hierarchical classification.

研究动机与目标

  • 为解决在梯度计算代价高昂的场景下优化计算密集型 $μat$-正则化 M-估计器的挑战,特别是在 CRFs 中的应用。
  • 开发一种近端拟牛顿方法,通过激进的活动集选择策略,保持迭代过程的稀疏性并降低梯度计算成本。
  • 在不假设强凸性的情况下,为 Prox-QN 建立可证明的超线性收敛性,这在高维或冗余特征设置下常不成立。
  • 通过实证结果证明,与最先进方法相比,该方法在序列标注和层次分类任务中具有更快的收敛速度和更高的稀疏性。

提出的方法

  • 该方法采用近端拟牛顿框架,利用 L-BFGS 更新构建目标函数的二次逼近,实现二阶优化,同时减少 Hessian 矩阵的计算量。
  • 采用激进的活动集选择(收缩策略),在各轮迭代中逐步减少工作集,仅对活动变量计算部分梯度,将时间复杂度从 $O(d)$ 降低至 $O(nnz)$。
  • 将 L-BFGS 更新适配至收缩过程,即使在变量集减少的情况下仍能保持精度,确保收敛稳定性。
  • 通过基于特征索引的数据与迭代存储结构,同时利用数据稀疏性与迭代稀疏性,最小化内存与计算开销。
  • 通过仅更新非零变量,保持中间迭代过程的稀疏性,与最优解的稀疏性保持一致。
  • 在受限强凸性条件下进行收敛性分析——即常数零空间强凸性(CNSC),该条件在典型的 M-估计器中成立,包括 $μat$-正则化 CRF 最大似然估计。

实验结果

研究问题

  • RQ1近端拟牛顿方法是否能在不假设强凸性的情况下,实现对 $μat$-正则化 M-估计器的超线性收敛?
  • RQ2在计算密集型场景下,如何激进地应用活动集选择以降低梯度计算成本?
  • RQ3在工作集被大幅收缩的情况下,L-BFGS 更新是否仍能保持精度?
  • RQ4所提出的方法是否在基于 CRF 的序列标注与层次分类任务中,优于最先进方法,在收敛速度与稀疏性方面表现更优?
  • RQ5常数零空间强凸性(CNSC)是否是非强凸设置下实现超线性收敛的充分条件?

主要发现

  • 所提出的 Prox-QN 方法在序列标注与层次分类任务中,收敛速度显著快于最先进方法,如目标函数差异曲线与非零参数曲线所示。
  • 在 CNSC 条件下,该算法实现了可证明的超线性收敛,即使在不假设强凸性的情况下,这是其关键理论贡献。
  • 在 OCR 序列标注任务中,该方法比 SGD 和 BCD 更快地达到稀疏解,且非零参数更少、目标函数值更低。
  • 在包含 1.21 亿参数的层次分类任务中,该方法实现了高稀疏性与快速收敛,在目标函数下降与稀疏性方面均优于 SGD 和 BCD。
  • 激进的活动集策略将每轮梯度计算成本降低至 $O(nnz)$,即使在高维参数空间中也能实现高效计算。
  • 该方法在保持高测试准确率(如 OCR 中 $\lambda=100$,层次分类中 $\lambda=1$)的同时,实现了最优的解稀疏性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。