Skip to main content
QUICK REVIEW

[论文解读] Stochastic Low-Rank Kernel Learning for Regression

Pierre Machart, Thomas Peel|arXiv (Cornell University)|Jan 11, 2012
Face and Expression Recognition参考文献 12被引用 8
一句话总结

该论文提出了一种用于回归的随机低秩核学习方法,通过构建数据驱动的秩-1 Nyström近似核矩阵的锥组合来实现。通过一种新型的随机凸优化过程优化组合权重,该过程具有收敛性保证,使方法在实现高效、低内存占用回归的同时,能够自适应地调整核函数以匹配特定学习任务,在基准数据集上实现了具有竞争力的性能。

ABSTRACT

We present a novel approach to learn a kernel-based regression function. It is based on the useof conical combinations of data-based parameterized kernels and on a new stochastic convex optimization procedure of which we establish convergence guarantees. The overall learning procedure has the nice properties that a) the learned conical combination is automatically designed to perform the regression task at hand and b) the updates implicated by the optimization procedure are quite inexpensive. In order to shed light on the appositeness of our learning strategy, we present empirical results from experiments conducted on various benchmark datasets.

研究动机与目标

  • 通过基于数据的秩-1近似组合学习任务特定核函数,解决核方法中的核选择挑战。
  • 实现在全Gram矩阵存储不可行的大规模数据集上的高效回归。
  • 开发一种计算高效且具有收敛性保证的随机优化过程,用于学习核组合权重。
  • 在标准回归与分类基准数据集上展示该方法的有效性与可扩展性。

提出的方法

  • 该方法使用从训练数据点导出的秩-1 Nyström近似,定义为 $\tilde{K}_m = \mathbf{c}_m \mathbf{c}_m^T$,其中 $\mathbf{c}_m$ 是全Gram矩阵中归一化的核列。
  • 通过非负权重 $\mu_m$ 构造参数化核矩阵 $\tilde{K}(\boldsymbol{\mu}) = \sum_{m \in \mathcal{S}} \mu_m \tilde{K}_m$,形成低秩核的锥组合。
  • 通过修改的内积 $\langle \phi(\mathbf{x}), \phi(\mathbf{x}') \rangle_A = \phi(\mathbf{x})^T A \phi(\mathbf{x}')$ 隐式定义核函数,其中 $A = \sum_{m \in \mathcal{S}} \mu_m \frac{\phi(\mathbf{x}_m)\phi(\mathbf{x}_m)^T}{k(\mathbf{x}_m, \mathbf{x}_m)}$。
  • 基于Nesterov方法开发了一种随机优化过程,通过使用二阶信息进行坐标更新,确保收敛性保证。
  • 该算法通过按需流式计算所需核列,避免存储完整的Gram矩阵,并利用高效的矩阵求逆公式进行更新。

实验结果

研究问题

  • RQ1基于数据驱动的秩-1 Nyström近似锥组合能否有效学习用于回归的任务特定核函数?
  • RQ2能否设计一种每轮计算成本低且具有收敛性保证的随机优化过程,用于学习核组合权重?
  • RQ3与完整核方法相比,该方法在显著降低内存使用的同时,是否仍能保持良好的泛化性能?
  • RQ4该方法在大规模数据集上的可扩展性如何?所选基点数 $M$ 对性能有何影响?

主要发现

  • 在USPS数据集上,所提出的SLKL方法在 $M=64$ 时达到 76.3 ± 9.9 的误差,优于相同设置下的基线方法,并且尽管该方法专为回归设计,其性能仍与Nyst(101.3 ± 22.9 误差)具有竞争力。
  • 当 $M=256$ 时,SLKL将测试误差降低至 47.6 ± 3.1;当 $M=1024$ 时,进一步降低至 41.5 ± 3.9,表明随着基点数量增加,性能持续提升。
  • 在大规模MNIST数据集上,SLKL在 $M=1000$ 时实现了约2%的分类错误率,表明尽管该方法专为回归设计,其在大规模问题上仍具备可行性。
  • 该方法有效避免了完整Gram矩阵的存储,实现了高效的优化,但零权重更新带来的计算开销仍是其局限性。
  • 注意到 $\boldsymbol{\mu}$ 上的1-范数约束与岭正则化之间存在联系,提示未来可能建立泛化界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。