Skip to main content
QUICK REVIEW

[论文解读] Near Input Sparsity Time Kernel Embeddings via Adaptive Sampling

David P. Woodruff, Amir Zandieh|arXiv (Cornell University)|Jul 8, 2020
Domain Adaptation and Few-Shot Learning参考文献 20被引用 4
一句话总结

本文提出了一种自适应采样算法,在近似输入稀疏性时间内实现多项式核与高斯核的核嵌入,利用重要性采样对特征空间进行子采样,并提供可证明的谱逼近保证。该方法相较以往的无偏随机化映射(oblivious sketching)将运行时间减少了 $ q^{5/2}/\epsilon^2 $ 倍,实现了对输入稀疏性的线性依赖关系,目标维数为 $ O(s_\lambda / \epsilon^2 \log n) $,在大规模回归任务中表现出强劲的实验性能。

ABSTRACT

To accelerate kernel methods, we propose a near input sparsity time algorithm for sampling the high-dimensional feature space implicitly defined by a kernel transformation. Our main contribution is an importance sampling method for subsampling the feature space of a degree $q$ tensoring of data points in almost input sparsity time, improving the recent oblivious sketching method of (Ahle et al., 2020) by a factor of $q^{5/2}/ε^2$. This leads to a subspace embedding for the polynomial kernel, as well as the Gaussian kernel, with a target dimension that is only linearly dependent on the statistical dimension of the kernel and in time which is only linearly dependent on the sparsity of the input dataset. We show how our subspace embedding bounds imply new statistical guarantees for kernel ridge regression. Furthermore, we empirically show that in large-scale regression tasks, our algorithm outperforms state-of-the-art kernel approximation methods.

研究动机与目标

  • 为解决核方法的可扩展性瓶颈,其因核矩阵计算导致空间与时间复杂度均为 $ O(n^2) $。
  • 设计一种针对多项式与高斯核的子空间嵌入方法,使运行时间接近输入稀疏性 $ \text{nnz}(X) $ 的线性关系。
  • 实现目标维数 $ s = O(s_\lambda / \epsilon^2 \log n) $,其中 $ s_\lambda $ 为统计维数,且在高概率下实现谱逼近。
  • 相较于以往的无偏随机化映射方法,将多项式核的运行时间减少 $ q^{5/2}/\epsilon^2 $ 倍。
  • 为所提出的嵌入框架提供新的核岭回归统计保证。

提出的方法

  • 提出一种自适应重要性采样方法,用于对输入数据点的 $ q $ 次张量积特征空间进行子采样。
  • 基于提升后特征矩阵的行范数进行递归采样,优先选择信息量更高的特征,从而降低方差并提升逼近质量。
  • 将该方法应用于点积核的泰勒展开,例如当展开呈指数衰减时的逆多项式核。
  • 推导出 $ Z^\top Z $ 作为核矩阵 $ K $ 的 $ (\epsilon, \lambda) $-谱逼近的谱逼近界,确保 $ \| (K + \lambda I)^{-1/2} (Z^\top Z + \lambda I) (K + \lambda I)^{-1/2} - I \| \leq \epsilon $。
  • 采用递归过程(算法1)在多轮中自适应地优化采样概率,以在最小额外开销下提升精度。
  • 通过将核函数截断为阶数 $ O(\log n) $ 的泰勒级数,将该方法扩展至高斯核,并对所得多项式项应用相同的采样策略。

实验结果

研究问题

  • RQ1我们能否在接近输入稀疏性的时间内实现多项式与高斯核的子空间嵌入,且目标维数与统计维数 $ s_\lambda $ 呈线性关系?
  • RQ2我们能否相较以往的无偏随机化映射方法,将核嵌入算法的运行时间减少 $ q^{5/2}/\epsilon^2 $ 倍?
  • RQ3在大规模回归任务中,自适应重要性采样是否能提供优于均匀采样或无偏随机化采样的逼近质量与更低的目标维数?
  • RQ4该方法能否推广至其他点积核,其泰勒展开呈指数衰减?
  • RQ5使用所提出的嵌入方法时,核岭回归的统计与算法保证是什么?

主要发现

  • 所提出的自适应采样算法运行时间为 $ O(\text{poly}(\epsilon^{-1}, q, \log n) \cdot s_\lambda^2 n + q^{5/2} \log^4 n \cdot \text{nnz}(X)) $,实现近似输入稀疏性。
  • 对于多项式核,该方法相较以往的无偏随机化映射在运行时间上提升了 $ q^{5/2}/\epsilon^2 $ 倍,同时保持相同的目标维数 $ O(s_\lambda / \epsilon^2 \log n) $。
  • 通过将核函数的泰勒展开截断至 $ O(\log n) $ 阶,实现高斯核嵌入,从而可应用多项式方法。
  • 实验结果表明,完整自适应算法(Adaptive)在所有数据集上均取得最低的测试均方根误差(RMSE),且目标维数 $ s $ 显著小于其他方法。
  • 行范数变体(单轮采样)的运行速度与傅里叶特征相当,快于 Nystrom 与无偏随机化映射,同时达到更优或相当的 RMSE。
  • 该方法通过确保 $ Z^\top Z $ 是 $ K $ 的 $ (\epsilon, \lambda) $-谱逼近,为核岭回归提供了新的统计保证,从而可推导出对回归解的误差界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。