Skip to main content
QUICK REVIEW

[论文解读] Practical Inexact Proximal Quasi-Newton Method with Global Complexity Analysis

Katya Scheinberg, Xiaocheng Tang|arXiv (Cornell University)|Nov 26, 2013
Sparse and Compressive Sensing Techniques参考文献 26被引用 17
一句话总结

该论文提出了一种实用的不精确近端拟牛顿方法,结合随机坐标下降法求解大规模稀疏优化问题,首次在弱子问题精度要求下建立了全局收敛速率分析。该方法在期望下实现次线性收敛,并在真实数据集上表现出与当前最先进方法(如LIBLINEAR)相当甚至更优的性能。

ABSTRACT

Recently several methods were proposed for sparse optimization which make careful use of second-order information [10, 28, 16, 3] to improve local convergence rates. These methods construct a composite quadratic approximation using Hessian information, optimize this approximation using a first-order method, such as coordinate descent and employ a line search to ensure sufficient descent. Here we propose a general framework, which includes slightly modified versions of existing algorithms and also a new algorithm, which uses limited memory BFGS Hessian approximations, and provide a novel global convergence rate analysis, which covers methods that solve subproblems via coordinate descent.

研究动机与目标

  • 解决在大规模稀疏优化中,当二阶信息利用效率低下时,使用不精确子问题解仍能实现全局收敛的挑战。
  • 构建一种结合有限内存BFGS海森矩阵近似与通过坐标下降法实现的不精确子问题求解的框架,以实现可扩展且高效的优化。
  • 为使用不精确子问题解的方法提供全局收敛速率分析,相比先前工作,放宽了对子问题精度的假设。
  • 在真实世界的稀疏学习问题(如稀疏逻辑回归和Lasso)中,验证所提方法的实际有效性,其性能在某些情况下优于专用求解器。
  • 用类似信赖域的充分下降条件与近端参数更新机制替代传统线搜索,确保在不依赖海森矩阵精度强假设的前提下实现全局收敛。

提出的方法

  • 将优化问题表述为最小化复合凸函数 $ F(x) = f(x) + g(x) $,其中 $ f $ 具有Lipschitz连续梯度,$ g $ 为结构化凸函数,例如 $ \lambda\|x\|_1 $。
  • 使用有限内存BFGS海森矩阵近似,对光滑部分 $ f(x) $ 构造以当前迭代点为中心的二次模型,避免完整海森矩阵的计算。
  • 通过随机坐标下降法近似求解得到的子问题 $ \min_x \{ g(x) + \frac{1}{2}\|x - z\|_H^2 \} $,当 $ H $ 为对角矩阵与低秩矩阵之和时,该方法效率较高。
  • 引入一种基于类似信赖域的充分下降条件的近端参数更新机制,以替代线搜索,确保在不需精确子问题解的前提下实现全局收敛。
  • 采用随机坐标下降而非循环下降,以改善收敛性质,并在更弱的假设下支持理论分析。
  • 通过限制达到收敛所需的内层迭代总次数,建立在期望下的全局收敛性,收敛速率为次线性,即使子问题解不精确也成立。

实验结果

研究问题

  • RQ1通过随机坐标下降法获得的不精确子问题解,是否仍能在近端拟牛顿方法框架下保证全局收敛性与次线性收敛速率?
  • RQ2在何种最弱的子问题精度条件下,仍能确保全局收敛性与可证明的收敛速率?
  • RQ3在实际应用中,该框架与现有最先进求解器(如LIBLINEAR)相比,在大规模稀疏学习问题上的表现如何?
  • RQ4能否通过近端参数更新机制结合类似信赖域的充分下降条件,替代线搜索,同时保持全局收敛性与效率?
  • RQ5结合有限内存BFGS海森矩阵近似与不精确坐标下降法,是否能在真实世界的稀疏优化任务中实现具有竞争力的性能?

主要发现

  • 所提方法即使在子问题解不精确的情况下,仍能在期望下实现全局次线性收敛速率,且对误差容限的要求弱于先前的不精确近端梯度方法。
  • 收敛所需的内层迭代总次数被有界,且小于先前工作,显著提升了大规模问题的效率。
  • 在a9a、slices、gisette和epsilon数据集上,所提的LHAC与LHAC-L方法在收敛速度与内存效率方面优于LIBLINEAR,尤其在slices数据集上,LHAC最快可达其一个数量级。
  • 在最大规模数据集(epsilon,100,000个样本)上,LHAC与LHAC-L在达到与LIBLINEAR相同精度的同时,耗时仅为后者的三分之一,展现出良好的可扩展性。
  • 所提方法的内存占用低于LIBLINEAR的一半,尤其在大规模问题(如epsilon)中更为显著,得益于高效的海森矩阵近似与不精确子问题求解。
  • 该框架具有通用性,可统一包含多种现有高效稀疏优化算法(如稀疏逻辑回归与稀疏协方差选择算法),并提供统一的收敛性分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。