Skip to main content
QUICK REVIEW

[论文解读] The Sample Complexity of Learning Linear Predictors with the Squared Loss

Ohad Shamir|arXiv (Cornell University)|Jun 19, 2014
Machine Learning and Algorithms参考文献 9被引用 5
一句话总结

本文在全然异构、分布无关的设定下,为带平方损失的线性预测器学习建立了紧致的样本复杂度下界。结果表明,期望过失风险至少与 $\min\{Y^2, \frac{B^2 + dY^2}{m}, \frac{BY}{\sqrt{m}}\}$ 成比例,强调了范数约束 $B$ 与目标值约束 $Y$ 对泛化性能的影响是独立的,这与先前研究中的常见假设相悖。

ABSTRACT

In this short note, we provide a sample complexity lower bound for learning linear predictors with respect to the squared loss. Our focus is on an agnostic setting, where no assumptions are made on the data distribution. This contrasts with standard results in the literature, which either make distributional assumptions, refer to specific parameter settings, or use other performance measures.

研究动机与目标

  • 通过提供一个自包含的、分布无关的分析,填补文献中关于带平方损失的线性回归样本复杂度研究的空白。
  • 证明基于分布假设(例如,模型正确设定、有界预测器)的现有结果无法捕捉在全然异构设定下的真实样本复杂度。
  • 表明基于参数估计误差 ($\mathbb{E}[\|\mathbf{w}-\mathbf{w}^*\|^2]$) 或在预测器无界条件下的预测误差的过失风险界,并不能在假设类为范数有界的条件下推出过失风险界。
  • 阐明目标值上界 $Y$ 与预测器范数上界 $B$ 在决定泛化性能时的独立作用,特别是在 $B \geq 2Y$ 的情况下。
  • 建立一个对所有数据分布都一致成立的紧致下界,无需假设有界函数或特定的矩条件。

提出的方法

  • 构造一个输入-输出对 $(\mathbf{x}, y)$ 的困难分布族,满足 $\|\mathbf{x}\| \leq 1$,$|y| \leq Y$,且 $\|\mathbf{w}\| \leq B$。
  • 在 $d'$ 个标准基向量 $\mathbf{e}_i$ 上使用混合分布,其中每个 $\mathbf{e}_i$ 以概率 $1/d'$ 被选中,$y$ 是一个依赖于参数 $\sigma_i$ 的伯努利随机变量。
  • 应用条件分布法与 Kullback-Leibler 散度,比较在两种不同参数设置($\sigma_i > 0$ 与 $\sigma_i < 0$)下训练集的似然性。
  • 利用 KL 散度的联合凸性,并通过 $\chi^2$ 散度对散度进行上界估计,从而推导出条件分布之间散度的上界。
  • 通过将过失风险与预测值的平方差关联,并利用假设与数据之间的互信息,推导出过失风险的下界。
  • 对自由参数 $d'$(活跃维度的数量)进行优化,从而在两个区域 $d > \sqrt{6m}B/Y$ 和 $d \leq \sqrt{6m}B/Y$ 中获得最紧致的下界。

实验结果

研究问题

  • RQ1在完全异构、分布无关的设定下,学习带平方损失的线性预测器的最优样本复杂度是什么?
  • RQ2当不作任何分布假设时,目标值上界 ($Y$) 与预测器范数上界 ($B$) 如何共同影响泛化误差?
  • RQ3为何基于参数估计误差或无界预测器的标准过失风险界无法捕捉范数有界假设类中的真实复杂度?
  • RQ4能否建立一个紧致的下界,以分离 $Y$、$B$、$d$ 和 $m$ 在泛化误差中的独立贡献?
  • RQ5在线性回归中,带平方损失时,维度 $d$、样本量 $m$ 与范数约束 $B$ 和 $Y$ 之间的基本权衡是什么?

主要发现

  • 本文建立了对任意返回范数有界线性预测器的学习算法,其期望过失风险的普遍下界为 $c \cdot \min\left\{Y^2, \frac{B^2 + dY^2}{m}, \frac{BY}{\sqrt{m}}\right\}$。
  • 该下界表明,当 $m$ 较小时,过失风险与 $\frac{B^2 + dY^2}{m}$ 成比例,说明预测器范数与数据维度均对样本复杂度有贡献。
  • 当 $B \geq 2Y$ 时,下界中包含一项 $\frac{BY}{\sqrt{m}}$,表明范数上界与目标值上界的乘积独立于维度影响泛化性能。
  • 该下界是紧致的,即其与已知上界仅相差常数因子,且在无额外假设下无法进一步改进。
  • 分析表明,先前依赖于 $\mathbb{E}[\|\mathbf{w}-\mathbf{w}^*\|^2]$ 或无界 $B$ 的结果,在范数有界情形下不能推出过失风险界,原因在于存在高达 $\frac{1}{1/2 - w}$ 的潜在乘法间隙。
  • 该结果对所有数据分布均一致成立,包括真实预测器不在假设类中的情形,且当 $B$ 相对于 $Y$ 较大时仍保持非平凡性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。