[论文解读] Coresets for Classification -- Simplified and Strengthened
本论文提出了一种用于线性分类的新共核构造方法,通过使用 ℓ₁ Lewis 权重进行子采样,仅需 $\tilde{O}(d \cdot \mu_y(X)^2 / \epsilon^2)$ 个样本即可实现 $(1\pm\epsilon)$ 的相对误差。该方法显著优于先前的理论边界,适用于逻辑回归和合页损失且不依赖标签,同时支持高效的主动学习与多任务训练。
We give relative error coresets for training linear classifiers with a broad class of loss functions, including the logistic loss and hinge loss. Our construction achieves $(1\pm ε)$ relative error with $ ilde O(d \cdot μ_y(X)^2/ε^2)$ points, where $μ_y(X)$ is a natural complexity measure of the data matrix $X \in \mathbb{R}^{n imes d}$ and label vector $y \in \{-1,1\}^n$, introduced in by Munteanu et al. 2018. Our result is based on subsampling data points with probabilities proportional to their $\ell_1$ $Lewis$ $weights$. It significantly improves on existing theoretical bounds and performs well in practice, outperforming uniform subsampling along with other importance sampling methods. Our sampling distribution does not depend on the labels, so can be used for active learning. It also does not depend on the specific loss function, so a single coreset can be used in multiple training scenarios.
研究动机与目标
- 解决常见分类损失(如逻辑回归和合页损失)中缺乏高效相对误差共核的问题。
- 在理论样本复杂度边界上超越先前工作,进一步改进线性分类中共核的理论样本复杂度。
- 设计一种不依赖标签和损失函数的采样分布,以支持主动学习与多任务学习。
- 提供一种实用且高效的共核构造方法,兼具强理论保证与出色的实证性能。
提出的方法
- 使用 $\ell_1$ Lewis 权重作为数据点的采样分布,该分布已知可保持任意 $\beta$ 下的 $\|X\beta\|_1$。
- 通过与 $\ell_1$ Lewis 权重成比例的概率,选取 $\tilde{O}(d \cdot \mu_y(X)^2 / \epsilon^2)$ 个点来构建共核。
- 对选中的点进行重新加权,以确保在完整数据集上损失函数的相对误差保证。
- 利用 $\ell_1$ Lewis 权重可在 $\tilde{O}(\operatorname{nnz}(X) + d^\omega)$ 时间内计算的特性,实现可扩展性。
- 确保采样分布不依赖于标签或具体损失函数,从而可在不同训练场景中重复使用。
- 理论分析表明,该共核可对一大类“合页类”损失(包括逻辑回归和合页损失)保持 $1\pm\epsilon$ 的相对误差。
实验结果
研究问题
- RQ1我们能否构建一种样本复杂度优于先前工作的线性分类相对误差共核?
- RQ2使用 $\ell_1$ Lewis 权重作为采样分布,是否能在理论与实证性能上优于均匀采样或 $\ell_2$ 权重采样?
- RQ3能否使共核构造独立于标签与损失函数,以支持主动学习与多任务训练?
- RQ4共核大小如何随分类复杂度度量 $\mu_y(X)$ 变化?该依赖关系能否进一步优化?
- RQ5在多样化的数据集与损失函数上,$\ell_1$ Lewis 权重采样的实证性能如何?
主要发现
- 所提出的共核在 $\tilde{O}(d \cdot \mu_y(X)^2 / \epsilon^2)$ 个样本下实现 $(1\pm\epsilon)$ 的相对误差,优于先前最先进方法的 $\tilde{O}(d^3 \cdot \mu_y(X)^3 / \epsilon^4)$ 边界(来自 [MSSW18])。
- 实证结果表明,在 KDD Cup ’99 数据集上,$\ell_1$ Lewis 权重采样优于均匀采样与 $\ell_2$ 权重采样,尤其在较大共核尺寸下优势更明显。
- 在 $\mu_y(X)$ 较高的数据集(如 KDD Cup ’99,$\mu_y(X) = 35.18$)上,Lewis 权重与其他方法的性能差距最为显著。
- 在 $\mu_y(X)$ 较低的数据集(如 Covertype,$1.86$;Webb Spam,$4.39$)上,Lewis 权重采样表现与 $\ell_2$ 权重采样相当或略差。
- 理论分析证实,$\ell_1$ Lewis 权重是合页类损失的自然选择,因其对正参数呈线性增长,对负参数则趋于饱和。
- 采样分布独立于标签与损失函数,使得单个共核可被重复用于多种训练目标与主动学习流程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。