Skip to main content
QUICK REVIEW

[论文解读] New Generalization Bounds for Learning Kernels

Corinna Cortes, Mehryar Mohri|ArXiv.org|Dec 17, 2009
Sparse and Compressive Sensing Techniques参考文献 15被引用 9
一句话总结

本文通过Rademacher复杂度分析,提出了学习核函数的新型泛化界,实现了对基核数量 $ p $ 的对数依赖($ \log p $)于凸组合,以及对 $ L_2 $-正则化线性组合的 $ p^{1/4} $ 依赖。这些界显著优于先前工作,更加紧致且在 $ p \gg m $ 时仍具信息量,使得在不担心过拟合的情况下可使用大规模核族。

ABSTRACT

This paper presents several novel generalization bounds for the problem of learning kernels based on the analysis of the Rademacher complexity of the corresponding hypothesis sets. Our bound for learning kernels with a convex combination of p base kernels has only a log(p) dependency on the number of kernels, p, which is considerably more favorable than the previous best bound given for the same problem. We also give a novel bound for learning with a linear combination of p base kernels with an L_2 regularization whose dependency on p is only in p^{1/4}.

研究动机与目标

  • 解决在使用大量基核时,学习核函数缺乏紧致泛化界的不足。
  • 改进现有随 $ p $ 增长过快的界(如 $ \sqrt{p} $ 或 $ p $),这些界会抑制使用大量核函数。
  • 为基核的凸组合与 $ L_2 $-正则化线性组合提供更紧致、更具信息量的界。
  • 为在实践中使用大量核函数(尤其是在高维或复杂学习任务中)提供理论依据。
  • 推导出在核数量 $ p $ 超过样本量 $ m $ 时仍具信息量的界。

提出的方法

  • 分析由 $ p $ 个基核的非负权重(和为1)构成的凸组合所形成的假设集的Rademacher复杂度。
  • 推导出对 $ p $ 具有 $ \widetilde{O}\left(\sqrt{\frac{1}{m} \cdot \frac{\log p \cdot R^2}{\rho^2}}\right) $ 依赖的泛化界,该依赖为对数形式,显著优于先前基于 $ \sqrt{p} $ 的界。
  • 将相同的Rademacher复杂度框架应用于 $ L_2 $-正则化线性组合的核函数,推导出对 $ p $ 具有 $ p^{1/4} $ 依赖的界。
  • 利用 $ \ell_r $-范数和凸性论证来界定复杂度项,特别利用 $ r = 4 $ 实现 $ p^{1/4} $ 的缩放。
  • 建立的界无需基核正交性假设,与早期基于稳定性的方法不同。
  • 使用集中不等式推导基于间隔的泛化界,引入以 $ \delta $ 概率成立的置信度项。

实验结果

研究问题

  • RQ1我们能否为学习核函数推导出对基核数量 $ p $ 有利依赖的泛化界,特别是在 $ p \gg m $ 时?
  • RQ2基核凸组合的Rademacher复杂度如何依赖于 $ p $?能否实现对数依赖而非多项式依赖?
  • RQ3$ L_2 $-正则化线性组合核函数的最优 $ p $ 依赖是什么?能否优于 $ \sqrt{p} $?
  • RQ4新界能否在不施加基核正交性等限制性假设下推导?
  • RQ5与基于伪维数或稳定性的现有界相比,新界在紧致性和实用性上表现如何?

主要发现

  • 所提出的 $ p $ 个基核凸组合的界对 $ p $ 仅具有 $ \log p $ 依赖,相比先前具有 $ \sqrt{p} $ 或 $ p $ 缩放的界有显著改进。
  • 对于 $ L_2 $-正则化线性组合,界以 $ p^{1/4} $ 缩放,远比早期基于稳定性的 $ \sqrt{p} $ 依赖更温和。
  • 当 $ p \gg m $ 时,界仍具信息量,而此前的界在该情形下变得空洞或无信息。
  • 对数依赖的界更简洁,不包含除核心 $ \log p $ 外的额外对数项,而Srebro与Ben-David的伪维数界则包含。
  • $ p^{1/4} $ 的界无需基核正交性假设,使其比先前的 $ L_2 $-基界更具普适性。
  • 推导出的基于间隔的泛化界包含置信度项,且以高概率 $ 1 - \delta $ 成立,确保了在学习算法中的实际适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。