Skip to main content
QUICK REVIEW

[论文解读] Generic Coreset for Scalable Learning of Monotonic Kernels: Logistic Regression, Sigmoid and more

Elad Tolochinsky, Jubran, Ibrahim|arXiv (Cornell University)|Feb 21, 2018
Machine Learning and Algorithms参考文献 22被引用 9
一句话总结

本文提出了一种针对单调核函数(如逻辑回归和S型函数)的通用核心集构建方法,实现了在大规模或流式数据上的可扩展、可证明准确的学习。论文证明,在自然正则化假设下,小规模核心集存在;提出了一个O(nd + n log n)的算法来计算这些核心集,并通过实验表明,实际应用中核心集的规模远小于理论边界。

ABSTRACT

Coreset (or core-set) is a small weighted \emph{subset} $Q$ of an input set $P$ with respect to a given \emph{monotonic} function $f:\mathbb{R} o\mathbb{R}$ that \emph{provably} approximates its fitting loss $\sum_{p\in P}f(p\cdot x)$ to \emph{any} given $x\in\mathbb{R}^d$. Using $Q$ we can obtain approximation of $x^*$ that minimizes this loss, by running \emph{existing} optimization algorithms on $Q$. In this work we provide: (i) A lower bound which proves that there are sets with no coresets smaller than $n=|P|$ for general monotonic loss functions. (ii) A proof that, under a natural assumption that holds e.g. for logistic regression and the sigmoid activation functions, a small coreset exists for \emph{any} input $P$. (iii) A generic coreset construction algorithm that computes such a small coreset $Q$ in $O(nd+n\log n)$ time, and (iv) Experimental results which demonstrate that our coresets are effective and are much smaller in practice than predicted in theory.

研究动机与目标

  • 解决在传统优化方法不可行的大规模、流式或分布式数据集上扩展机器学习的挑战。
  • 为单调损失函数背景下的核心集提供理论保证,这类损失函数在逻辑回归和神经网络激活中极为常见。
  • 通过引入一种自然的正则化假设,克服了对一般单调函数无法构造小规模核心集的不可能性。
  • 开发一种通用且高效的核函数核心集构建算法,适用于广泛范围的单调核函数。
  • 通过实证结果表明,所构建的核心集在实际中远小于理论上的上界。

提出的方法

  • 在损失函数中引入正则化项,以确保小规模核心集的存在,该方法在实践中常用于防止过拟合。
  • 证明在该正则化下,所得查询空间的VC维被限制在O(d²)以内,从而可通过ε-网理论实现核心集构建。
  • 利用单调函数的反函数及介值定理,确保核心集对所有x ∈ ℝ^d的完整损失均保持(1±ε)因子内的近似。
  • 通过基于正则化损失导出的敏感度分数进行排序与采样,设计出时间复杂度为O(nd + n log n)的核心集构建算法。
  • 利用中值定理及指数函数的性质,对每个数据点对整体损失的敏感度进行有界,从而实现高效采样。
  • 将核心集应用于小规模子集上的正则化损失优化,其解可严格近似于全量数据集上的最优解。

实验结果

研究问题

  • RQ1在无额外假设的前提下,能否为一般单调损失函数构造小规模核心集?
  • RQ2在何种条件下,对于逻辑回归和S型等单调核函数,小规模核心集存在?
  • RQ3在保持近似保证的前提下,构建此类核心集的时间复杂度是多少?
  • RQ4理论上的核心集规模与实际机器学习工作负载中的实际规模相比如何?
  • RQ5该核心集方法能否在流式、并行和分布式计算环境中应用,同时保持理论保证?

主要发现

  • 本文建立了下界证明,表明对于一般单调损失函数,不存在比|P|更小的核心集,说明在无额外假设下小规模核心集不可能存在。
  • 在自然正则化假设下,本文证明了对于任意输入集P和任意单调核函数(包括逻辑回归和S型函数),小规模核心集均存在。
  • 所提出的核函数核心集构建算法时间复杂度为O(nd + n log n),适用于大规模数据集。
  • 实验结果表明,实际核心集规模远小于理论上的上界,显示出极强的实际效率。
  • 核心集方法在所有x ∈ ℝ^d上均保持(1±ε)的近似保证,使得在核心集上训练模型可实现对全量数据的高精度拟合。
  • 该方法支持流式、并行和分布式计算模型,适用于现代物联网与大数据工作负载。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。