[论文解读] Data-dependent kernels in nearly-linear time
本文提出了一种近乎线性时间的近似方法,用于构建数据相关的核函数,通过使用少量数据点子样本近似内在正则化项,实现了可扩展的半监督和无监督学习。该方法用插值的低秩近似替代完整的数据正则化,性能与LapSVM相当,但计算时间从立方级降低至近乎线性,即使在包含64,000个样本的数据集上也适用。
We propose a method to efficiently construct data-dependent kernels which can make use of large quantities of (unlabeled) data. Our construction makes an approximation in the standard construction of semi-supervised kernels in Sindhwani et al. 2005. In typical cases these kernels can be computed in nearly-linear time (in the amount of data), improving on the cubic time of the standard construction, enabling large scale semi-supervised learning in a variety of contexts. The methods are validated on semi-supervised and unsupervised problems on data sets containing upto 64,000 sample points.
研究动机与目标
- 解决标准半监督核函数构建中的立方时间瓶颈问题,从而提升大规模数据集的可扩展性。
- 通过将构建正则化矩阵所用点数与评估函数所用点数解耦,实现利用大量无标签数据于核方法中。
- 开发一种计算高效的内在正则化近似方法,使性能接近完整核方法。
- 在不同规模的数据集上,对分类和聚类任务进行验证,数据规模最高达64,000个样本。
提出的方法
- 该方法通过仅在少量子样本点上测量函数,而非全部n个点,来近似标准数据相关核函数。
- 通过使用正则化矩阵Q的伪逆,对子样本点上的函数值进行插值,构建近似内在正则化项。
- 由此得到的正则化项regQ(h*),对光滑函数近似于完整正则化项regQ(h),从而降低计算成本。
- 核函数在再生核希尔伯特空间(RKHS)中构建,其中范数包含此简化正则化项作为组成部分。
- 使用高效的线性系统求解器(如带有组合预条件器的预处理共轭梯度法)在近乎线性时间内计算核矩阵。
- 该方法适用于任意核方法,并通过SVM和K-means聚类进行了验证。
实验结果
研究问题
- RQ1能否在近乎线性时间内构建数据相关的核函数,同时保持完整核方法的性能?
- RQ2仅在少量子样本点上测量函数,而非所有数据点,是否能对内在正则化项实现良好近似?
- RQ3该方法能否扩展到大规模数据集(如64,000个数据点),在标准半监督核构建变得不可行时仍保持有效?
- RQ4该高效核方法的性能与标准RBF核及‘预算’版LapSVM(丢弃大部分无标签数据)相比如何?
主要发现
- 该方法在近乎线性时间内计算半监督核函数,将正则化矩阵Q中非零条目数的复杂度从立方级降低为线性级。
- 在包含64,000个样本的MNIST数据集上,核函数计算时间少于3分钟,证明了其实际可扩展性。
- 在大规模数据集上,该高效核方法优于RBF核和‘预算’版LapSVM,显示出利用更多无标签数据的显著优势。
- 在小规模数据集(如1,250个样本)上,该方法性能与完整LapSVM相当。
- 在聚类实验中,仅使用500个基点的该方法,性能接近于在1,000个样本数据上使用完整LapSVM核的方法。
- 预处理共轭梯度求解器实现了近似线性缩放,而MATLAB的‘backslash’运算符在大规模数据集上表现出超线性增长。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。