[论文解读] On Coresets for Logistic Regression
该论文提出了一种用于逻辑回归的新型敏感度采样方案,首次在有界 $\mu$-复杂度条件下实现了 $(1\pm\varepsilon)$-核心集的可证明亚线性大小。研究表明,一般情况下不存在强亚线性核心集,但对于 $\mu$-复杂度较低(量化正确与错误估计几率之比)的数据,基于 $\ell_2^2$ 置信度得分和均匀混合的敏感度采样可实现亚线性核心集大小,并具备强大的近似保证。
Coresets are one of the central methods to facilitate the analysis of large data sets. We continue a recent line of research applying the theory of coresets to logistic regression. First, we show a negative result, namely, that no strongly sublinear sized coresets exist for logistic regression. To deal with intractable worst-case instances we introduce a complexity measure $μ(X)$, which quantifies the hardness of compressing a data set for logistic regression. $μ(X)$ has an intuitive statistical interpretation that may be of independent interest. For data sets with bounded $μ(X)$-complexity, we show that a novel sensitivity sampling scheme produces the first provably sublinear $(1\pm\varepsilon)$-coreset. We illustrate the performance of our method by comparing to uniform sampling as well as to state of the art methods in the area. The experiments are conducted on real world benchmark data for logistic regression.
研究动机与目标
- 通过构建数据核心集,解决在大规模数据集上扩展逻辑回归的根本挑战。
- 识别逻辑回归核心集大小的理论极限,表明在一般情况下不存在强亚线性核心集。
- 引入一个新的复杂度度量 $\mu(X)$,用于量化逻辑回归数据集的可压缩性。
- 设计一种基于敏感度的采样方案,实现 $\mu$-复杂数据集的亚线性核心集大小。
- 在真实世界基准数据上,通过实验验证该方法相对于均匀采样和基于 $k$-均值的采样方法的性能。
提出的方法
- 引入一个新的复杂度度量 $\mu(X)$,定义为正确估计几率的对数与错误估计几率的对数之比,用于量化逻辑回归数据的可压缩性。
- 提出一种结合 $\ell_2^2$ 置信度得分(平方根)和均匀采样的混合采样分布,以同时处理高影响和低影响的数据点。
- 证明总敏感度可由 $\mu(X)$ 有界,从而实现 $\mu$-复杂数据的 $(1\pm\varepsilon)$-核心集构造,其大小为 $O(\mu \cdot d \cdot \varepsilon^{-2} \cdot \log \mu)$。
- 推导出一种空间高效算法,运行时间在输入稀疏性时间 $\tilde{O}(\mathtt{nnz}(Z))$ 内,支持流式处理和分布式模型(如 MapReduce)。
- 采用递归核心集构造方法,将核心集大小减少至 $n^\eta$(对任意 $\eta > 0$),在流式处理中仅需 $2\log(1/\eta)$ 轮遍历。
- 采用敏感度框架并提供正式的核心集保证:对于任意解 $\beta$,核心集目标函数在 $1\pm\varepsilon$ 范围内近似全量数据目标函数。
实验结果
研究问题
- RQ1在一般条件下,能否为逻辑回归构造亚线性大小的核心集?
- RQ2何种复杂度度量可表征逻辑回归数据可被有效压缩的条件?
- RQ3如何将敏感度采样适配至逻辑回归的非二次、非凸损失结构?
- RQ4基于 $\ell_2^2$ 置信度得分与均匀采样的混合采样策略在实践中是否优于标准基线方法?
- RQ5在超越最坏情况的复杂度模型下,所提方法能否实现可证明的亚线性核心集大小?
主要发现
- 在最坏情况下,逻辑回归不存在强亚线性核心集,确立了根本性的负面结果。
- 对于 $\mu$-复杂数据集且 $\mu$ 有界的情况,所提敏感度采样方案可生成大小为 $O(\mu \cdot d \cdot \varepsilon^{-2} \cdot \log \mu)$ 的 $(1\pm\varepsilon)$-核心集,该结果在 $n$ 上可证明为亚线性。
- 在真实世界数据集(Webb Spam、Covertype、KDD Cup '99)上的实验表明,所提方法在对数似然误差和运行时间方面均优于均匀采样和基于 $k$-均值的采样方法。
- 在所有测试数据集和核心集大小下,该方法的相对对数似然误差标准差低于 0.05,中位数相对运行时间低于全量数据优化的 0.2 倍。
- 均匀采样在可分或近可分数据上表现灾难性失败,SGD 实验显示在一半运行中 $\beta_1$ 值超过 100,导致近似比极差。
- 递归核心集构造将核心集大小减少至 $n^\eta$(对任意 $\eta > 0$),仅需 $2\log(1/\eta)$ 轮遍历,实现内存高效处理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。