Skip to main content
QUICK REVIEW

[论文解读] Tensorized Random Projections

Beheshteh T. Rakhshan, Guillaume Rabusseau|arXiv (Cornell University)|Mar 11, 2020
Tensor decomposition and applications参考文献 37被引用 4
一句话总结

本文提出使用张量-列车(TT)和CANDECOMP/PARAFAC(CP)分解的张量化随机投影映射,以高效降低高阶张量的维度,同时保持欧几里得距离。在Johnson-Lindenstrauss框架下,由于TT格式在秩结构效率方面更优,基于TT的映射在嵌入质量与所需投影大小方面显著优于基于CP的投影,尤其在高阶张量中表现更佳。

ABSTRACT

We introduce a novel random projection technique for efficiently reducing the dimension of very high-dimensional tensors. Building upon classical results on Gaussian random projections and Johnson-Lindenstrauss transforms~(JLT), we propose two tensorized random projection maps relying on the tensor train~(TT) and CP decomposition format, respectively. The two maps offer very low memory requirements and can be applied efficiently when the inputs are low rank tensors given in the CP or TT format. Our theoretical analysis shows that the dense Gaussian matrix in JLT can be replaced by a low-rank tensor implicitly represented in compressed form with random factors, while still approximately preserving the Euclidean distance of the projected inputs. In addition, our results reveal that the TT format is substantially superior to CP in terms of the size of the random projection needed to achieve the same distortion ratio. Experiments on synthetic data validate our theoretical analysis and demonstrate the superiority of the TT decomposition.

研究动机与目标

  • 解决标准随机投影在高阶张量上计算与内存效率低下的问题。
  • 利用张量分解格式(TT与CP)压缩随机投影矩阵,同时保持距离保持性。
  • 从理论与实证角度比较TT与CP基张量化投影在失真度与复杂度方面的性能。
  • 为以低秩TT或CP格式给出的张量提供高效的降维方法。

提出的方法

  • 提出两种张量化随机投影映射:$ f_{\mathrm{TT}(R)} $ 与 $ f_{\mathrm{CP}(R)} $,其中投影矩阵的行分别以TT与CP格式表示。
  • 将随机投影矩阵 $ \mathbf{A} \in \mathbb{R}^{k \times d^N} $ 表示为使用秩参数 $ R $ 的低秩张量,采用TT或CP分解,从而大幅降低存储与计算开销。
  • 对以TT或CP格式给出的输入张量应用投影,实现 $ \mathcal{O}(kNd\max(R,\tilde{R})^3) $ 的计算时间,其中 $ \tilde{R} $ 为输入张量的秩。
  • 通过在TT与CP分解中使用随机因子,隐式表示投影矩阵,避免显式存储完整的稠密矩阵。
  • 理论分析表明,两种映射在投影维数 $ k $ 满足特定边界时,均满足Johnson-Lindenstrauss性质。
  • 通过在不同阶数与大小的合成张量上评估失真率与嵌入时间,实证评估性能。

实验结果

研究问题

  • RQ1能否利用张量分解格式(TT与CP)高效表示高阶张量的随机投影矩阵,同时不损失距离保持性?
  • RQ2对于TT与CP基张量化投影,所需投影维数 $ k $ 如何随张量阶数 $ N $ 与秩 $ R $ 变化?
  • RQ3在高阶设置下,TT格式是否比CP格式更有效于张量化随机投影?
  • RQ4在张量化随机投影中,计算效率、内存使用与嵌入质量之间的权衡如何?
  • RQ5张量化投影能否在性能上媲美高斯随机投影,同时在高阶数据上实现显著更高的可扩展性?

主要发现

  • 基于TT的张量化随机投影 $ f_{\mathrm{TT}(R)} $ 所需的投影维数 $ k $ 显著小于 $ f_{\mathrm{CP}(R)} $,以达到相同的失真率,原因在于其对张量阶数 $ N $ 的指数依赖性更优。
  • 对于 $ f_{\mathrm{TT}(R)} $,所需 $ k \gtrsim \varepsilon^{-2}(1+2/R)^N \log^{2N} m $,而对于 $ f_{\mathrm{CP}(R)} $,其随 $ k \gtrsim \varepsilon^{-2}3^{N-1}(1+2/R)\log^{2N} m $ 增长,表明TT具有显著优势。
  • 实验中,即使在高阶张量(如 $ N=25 $)下,$ f_{\mathrm{TT}(R)} $ 也能实现与高斯随机投影相当的失真率,而 $ f_{\mathrm{CP}(R)} $ 即使在高 $ R $ 与 $ k $ 下也难以获得良好性能。
  • TT基方法在所有情况下均显著快于极稀疏随机投影,并且在张量阶数增加时表现出良好的可扩展性,尤其当输入为TT格式时。
  • 当输入为CP格式时,$ f_{\mathrm{CP}(R)} $ 比 $ f_{\mathrm{TT}(R)} $ 更快,但其较差的失真性能限制了其实际应用价值。
  • 理论与实证结果均证实,CP格式在高阶设置下不适合作为张量化随机投影的实现方式,因其在 $ N $ 上存在指数级增长。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。