Skip to main content
QUICK REVIEW

[论文解读] Solving Regularized Exp, Cosh and Sinh Regression Problems

Zhihang Li, Zhao Song|arXiv (Cornell University)|Mar 28, 2023
Stochastic Gradient Optimization Techniques被引用 6
一句话总结

本文提出了一种新颖的输入稀疏时间算法,用于使用近似牛顿法求解正则化指数、双曲余弦和双曲正弦回归问题。该算法实现对数迭代复杂度和每次迭代接近输入稀疏性的运行时间,确保以高概率收敛至 $\epsilon$-准确解。

ABSTRACT

In modern machine learning, attention computation is a fundamental task for training large language models such as Transformer, GPT-4 and ChatGPT. In this work, we study exponential regression problem which is inspired by the softmax/exp unit in the attention mechanism in large language models. The standard exponential regression is non-convex. We study the regularization version of exponential regression problem which is a convex problem. We use approximate newton method to solve in input sparsity time. Formally, in this problem, one is given matrix $A \in \mathbb{R}^{n imes d}$, $b \in \mathbb{R}^n$, $w \in \mathbb{R}^n$ and any of functions $\exp, \cosh$ and $\sinh$ denoted as $f$. The goal is to find the optimal $x$ that minimize $ 0.5 \| f(Ax) - b \|_2^2 + 0.5 \| \mathrm{diag}(w) A x \|_2^2$. The straightforward method is to use the naive Newton's method. Let $\mathrm{nnz}(A)$ denote the number of non-zeros entries in matrix $A$. Let $ω$ denote the exponent of matrix multiplication. Currently, $ω\approx 2.373$. Let $ε$ denote the accuracy error. In this paper, we make use of the input sparsity and purpose an algorithm that use $\log ( \|x_0 - x^*\|_2 / ε)$ iterations and $\widetilde{O}(\mathrm{nnz}(A) + d^ω )$ per iteration time to solve the problem.

研究动机与目标

  • 为解决在大语言模型注意力机制背景下,单变量指数、cosh 和 sinh 回归问题在理论与算法研究方面的不足。
  • 将非凸指数回归问题转化为凸、正则化形式,以实现高效优化。
  • 设计一种算法,实现在每次迭代中以输入稀疏性时间收敛,同时保持对数迭代次数。
  • 将该框架扩展至处理具有类似收敛保证的双曲函数 cosh 和 sinh。
  • 在初始化和正则化条件较弱的假设下,确保以高概率收敛至 $\epsilon$-准确解。

提出的方法

  • 将回归问题表述为最小化 $\frac{1}{2}\|f(Ax) - b\|_2^2 + \frac{1}{2}\|\operatorname{diag}(w)Ax\|_2^2$,其中 $f \in \{\exp, \cosh, \sinh\}$,以确保凸性。
  • 应用带有黑塞矩阵近似的近似牛顿法,以降低每次迭代的代价,同时保持收敛性。
  • 采用黑塞矩阵近似误差界 $\epsilon_H \in (0,1)$ 来控制黑塞矩阵更新的精度。
  • 利用一步收缩引理证明误差 $\|x_k - x^*\|_2$ 每次迭代以 0.4 的因子几何递减。
  • 通过在每次迭代中以 $\widetilde{O}(\mathrm{nnz}(A))$ 时间计算梯度和黑塞矩阵近似,利用输入稀疏性。
  • 将随机化黑塞矩阵近似与多项对数失败概率 $\delta$ 相结合,确保高概率收敛。

实验结果

研究问题

  • RQ1是否可以在输入稀疏性时间内,以可证明的收敛性高效求解正则化指数回归问题?
  • RQ2对于 $f \in \{\exp, \cosh, \sinh\}$,$f(Ax)$ 的黑塞矩阵结构如何实现凸性并支持快速优化?
  • RQ3正则化权重 $w_i$ 需满足何种条件,才能确保黑塞矩阵正定且利普希茨连续?
  • RQ4近似牛顿法是否能在接近输入稀疏性的每次迭代代价下实现对数迭代次数?
  • RQ5在此非标准回归设置下,黑塞矩阵近似误差与收敛速度之间存在何种权衡?

主要发现

  • 该算法在 $\log(\|x_0 - x^*\|_2 / \epsilon)$ 次迭代内收敛,以高概率达到 $\epsilon$-精度。
  • 每次迭代耗时 $\widetilde{O}(\mathrm{nnz}(A) + d^\omega)$,其中 $\omega \approx 2.373$ 为矩阵乘法指数。
  • 在数据和正则化条件较弱的假设下,证明了黑塞矩阵为正定且利普希茨连续。
  • 对于所有三种函数($\exp, \cosh, \sinh$),该方法保证误差以每次迭代 0.4 的速率几何递减。
  • 失败概率受 $\delta$ 限制,通过迭代次数上的并集界保持高概率保证。
  • 该方法对初始化具有鲁棒性,仅需满足 $M\|x_0 - x^*\|_2 \leq 0.1l$,其中 $M$ 为利普希茨常数,$l$ 为黑塞矩阵特征值的下界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。