Skip to main content
QUICK REVIEW

[论文解读] Data-dependent kernels in nearly-linear time

Guy Lever, Tom Diethe|arXiv (Cornell University)|Oct 20, 2011
Gaussian Processes and Bayesian Inference参考文献 22被引用 8
一句话总结

本文提出了一种近乎线性时间的近似方法,用于构建数据相关的核函数,通过使用少量数据点子样本近似内在正则化项,实现了可扩展的半监督和无监督学习。该方法用插值的低秩近似替代完整的数据正则化,性能与LapSVM相当,但计算时间从立方级降低至近乎线性,即使在包含64,000个样本的数据集上也适用。

ABSTRACT

We propose a method to efficiently construct data-dependent kernels which can make use of large quantities of (unlabeled) data. Our construction makes an approximation in the standard construction of semi-supervised kernels in Sindhwani et al. 2005. In typical cases these kernels can be computed in nearly-linear time (in the amount of data), improving on the cubic time of the standard construction, enabling large scale semi-supervised learning in a variety of contexts. The methods are validated on semi-supervised and unsupervised problems on data sets containing upto 64,000 sample points.

研究动机与目标

  • 解决标准半监督核函数构建中的立方时间瓶颈问题,从而提升大规模数据集的可扩展性。
  • 通过将构建正则化矩阵所用点数与评估函数所用点数解耦,实现利用大量无标签数据于核方法中。
  • 开发一种计算高效的内在正则化近似方法,使性能接近完整核方法。
  • 在不同规模的数据集上,对分类和聚类任务进行验证,数据规模最高达64,000个样本。

提出的方法

  • 该方法通过仅在少量子样本点上测量函数,而非全部n个点,来近似标准数据相关核函数。
  • 通过使用正则化矩阵Q的伪逆,对子样本点上的函数值进行插值,构建近似内在正则化项。
  • 由此得到的正则化项regQ(h*),对光滑函数近似于完整正则化项regQ(h),从而降低计算成本。
  • 核函数在再生核希尔伯特空间(RKHS)中构建,其中范数包含此简化正则化项作为组成部分。
  • 使用高效的线性系统求解器(如带有组合预条件器的预处理共轭梯度法)在近乎线性时间内计算核矩阵。
  • 该方法适用于任意核方法,并通过SVM和K-means聚类进行了验证。

实验结果

研究问题

  • RQ1能否在近乎线性时间内构建数据相关的核函数,同时保持完整核方法的性能?
  • RQ2仅在少量子样本点上测量函数,而非所有数据点,是否能对内在正则化项实现良好近似?
  • RQ3该方法能否扩展到大规模数据集(如64,000个数据点),在标准半监督核构建变得不可行时仍保持有效?
  • RQ4该高效核方法的性能与标准RBF核及‘预算’版LapSVM(丢弃大部分无标签数据)相比如何?

主要发现

  • 该方法在近乎线性时间内计算半监督核函数,将正则化矩阵Q中非零条目数的复杂度从立方级降低为线性级。
  • 在包含64,000个样本的MNIST数据集上,核函数计算时间少于3分钟,证明了其实际可扩展性。
  • 在大规模数据集上,该高效核方法优于RBF核和‘预算’版LapSVM,显示出利用更多无标签数据的显著优势。
  • 在小规模数据集(如1,250个样本)上,该方法性能与完整LapSVM相当。
  • 在聚类实验中,仅使用500个基点的该方法,性能接近于在1,000个样本数据上使用完整LapSVM核的方法。
  • 预处理共轭梯度求解器实现了近似线性缩放,而MATLAB的‘backslash’运算符在大规模数据集上表现出超线性增长。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。