Skip to main content
QUICK REVIEW

[论文解读] Analysis of a randomized approximation scheme for matrix multiplication

Daniel Hsu, Sham M. Kakade|arXiv (Cornell University)|Nov 23, 2012
Mathematical Approximation and Integration参考文献 2被引用 4
一句话总结

本文提出了一种用于矩阵乘法的随机近似算法,通过使用哈达玛矩阵和拉德马赫矩阵构造的随机正交变换,随后进行均匀列采样,高效估计矩阵积 $AB^T$。主要贡献是给出了谱范数误差界,表明当 $n = \Omega\left(\frac{(k + \log m)\log k}{\varepsilon^2}\right)$ 时,以高概率满足 $\|\widehat{AB^T} - AB^T\| \leq \varepsilon\|A\|\|B\|$,其中 $k$ 是与矩阵一致性相关的秩度量。

ABSTRACT

This note gives a simple analysis of a randomized approximation scheme for matrix multiplication proposed by Sarlos (2006) based on a random rotation followed by uniform column sampling. The result follows from a matrix version of Bernstein's inequality and a tail inequality for quadratic forms in subgaussian random vectors.

研究动机与目标

  • 开发一种高效的随机算法,用于在直接计算因高维性而不可行时,近似大规模矩阵积 $AB^T$。
  • 分析一种先应用随机正交变换(通过哈达玛矩阵和拉德马赫矩阵实现)后进行均匀列采样的方案的谱范数误差。
  • 为该近似提供严格的高概率误差界,改进先前基于弗罗贝尼乌斯范数的分析,并纠正早期工作中因使用非均匀采样而存在的缺陷。
  • 确定在保持所需误差容限 $\varepsilon$ 的前提下,最小化采样列数 $n$ 所需的条件。

提出的方法

  • 该方法使用随机正交矩阵 $\Theta = \frac{1}{\sqrt{m}}DH$ 对输入矩阵 $A$ 和 $B$ 进行旋转,其中 $D$ 是独立同分布的拉德马赫变量构成的对角矩阵,$H$ 是哈达玛矩阵。
  • 利用快速变换,在 $O((d_A + d_B)m\log m)$ 时间内计算旋转后的矩阵 $\tilde{A} = A\Theta$ 和 $\tilde{B} = B\Theta$。
  • 从 $\tilde{A}$ 和 $\tilde{B}$ 中独立同分布地采样均匀的列对 $(\tilde{a}_{i_j}, \tilde{b}_{i_j})$,并计算外积和 $\widehat{AB^T} = \frac{m}{n}\sum_{j=1}^n \tilde{a}_{i_j}\tilde{b}_{i_j}^T$ 作为无偏估计。
  • 通过将矩阵伯恩斯坦不等式应用于由旋转列构造的对称随机矩阵 $X$ 来分析误差,其尾部界由次高斯二次型导出。
  • 关键量 $\mu = m \cdot \max_i(\|q_i\|^2, \|r_i\|^2)$,其中 $q_i, r_i$ 是归一化的旋转列,利用次高斯向量的集中不等式进行有界。
  • 通过联合界将 $\mu$ 的高概率界与矩阵伯恩斯坦不等式结合,推导出最终的谱范数误差界。

实验结果

研究问题

  • RQ1使用随机旋转后进行均匀列采样的随机矩阵乘法方案的谱范数误差是多少?
  • RQ2为确保近似误差在 $\varepsilon\|A\|\|B\|$ 以内且以高概率成立,需要多少采样数 $n$?
  • RQ3能否为此方案提供更紧致且正确的分析,以纠正早期研究中因未使用旋转而采用非均匀采样所导致的错误?
  • RQ4以 $k = \max(\operatorname{tr}(AA^T)/\|A\|^2, \operatorname{tr}(BB^T)/\|B\|^2)$ 衡量的矩阵一致性如何影响所需的样本复杂度?

主要发现

  • 该方法在概率至少 $1 - \delta$ 下实现了谱范数误差界 $\|\widehat{AB^T} - AB^T\| \leq \|A\|\|B\|\left(\sqrt{\frac{4(\mu+1)\ln(6k/\delta)}{n}} + \frac{2(\mu+1)\ln(6k/\delta)}{3n}\right)$。
  • 样本复杂度为 $n = \Omega\left(\frac{(k + \log m)\log k}{\varepsilon^2}\right)$,以确保以高概率满足 $\|\widehat{AB^T} - AB^T\| \leq \varepsilon\|A\|\|B\|$,其中 $k$ 是 $AA^T$ 和 $BB^T$ 的归一化迹的最大值。
  • 该分析纠正了 [HKZ12a] 中的错误界,通过正确有界随机矩阵 $X$ 的 $\mathbb{E}[X^2]$ 来实现。
  • 对 $\mu$ 的界表明,其满足 $\Pr[\mu > k + 2\sqrt{k\ln(3m/\delta)} + 2\ln(3m/\delta)] \leq 2\delta/3$,在 $\Theta$ 上以高概率成立。
  • 该方法利用了 $\sqrt{m}\Theta e_i$ 的次高斯性质,使得可通过次高斯向量中的二次型获得集中界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。