Skip to main content
QUICK REVIEW

[论文解读] Early-stopped neural networks are consistent

Ziwei Ji, Justin D. Li|arXiv (Cornell University)|Jun 10, 2021
Stochastic Gradient Optimization Techniques参考文献 39被引用 9
一句话总结

该论文证明,对于一般二分类问题,即使贝叶斯风险非零,浅层 ReLU 网络在梯度下降配合早停时,仍能实现最优的总体风险、校准性和误分类误差。该研究证明了在逻辑斯蒂损失、校准性和测试误差方面的一致性,且复杂度自然地与真实条件模型的内在复杂度相匹配。

ABSTRACT

This work studies the behavior of shallow ReLU networks trained with the logistic loss via gradient descent on binary classification data where the underlying data distribution is general, and the (optimal) Bayes risk is not necessarily zero. In this setting, it is shown that gradient descent with early stopping achieves population risk arbitrarily close to optimal in terms of not just logistic and misclassification losses, but also in terms of calibration, meaning the sigmoid mapping of its outputs approximates the true underlying conditional distribution arbitrarily finely. Moreover, the necessary iteration, sample, and architectural complexities of this analysis all scale naturally with a certain complexity measure of the true conditional model. Lastly, while it is not shown that early stopping is necessary, it is shown that any univariate classifier satisfying a local interpolation property is inconsistent.

研究动机与目标

  • 建立梯度下降配合早停在浅层 ReLU 网络中对一般二分类任务的理论一致性。
  • 在贝叶斯风险非零的任意数据分布下,分析收敛至最优总体风险(包括校准性和误分类误差)的性质。
  • 证明所需样本量、网络宽度和迭代次数的复杂度可自然地与真实条件模型的复杂度度量相匹配。
  • 通过证明任何满足局部插值性质的一元分类器在噪声分布下均不一致,提供早停必要性的证据。

提出的方法

  • 分析仅通过常数步长梯度下降在逻辑斯蒂损失上训练输入层权重的浅层 ReLU 网络。
  • 使用带有随机符号和高斯权重的随机特征模型来表示网络输出:$ f(x) = \frac{\rho}{\sqrt{m}} \sum_{j=1}^{m} a_j \sigma_{\text{r}}(w_j^\top x) $。
  • 利用逻辑斯蒂损失的乘法误差性质(引理 A.1)以增强收敛保证。
  • 应用 McDiarmid 不等式以控制数据中连续接近样本对的数量,从而限制小质量区间的数量。
  • 采用双系统区间划分(I 和 J)以控制数据采样过程中占据的区间数的期望值,从而控制接近样本对的数量。
  • 通过证明经验风险和范数约束可导致总体风险收敛至贝叶斯风险,从而建立一致性。

实验结果

研究问题

  • RQ1梯度下降配合早停是否能在任意数据分布下实现一般二分类问题中总体风险的最优值?
  • RQ2浅层 ReLU 网络的早停训练是否能使其 Sigmoid 输出与真实条件概率 $ \mathbb{P}[Y=1|X=x] $ 保持一致校准?
  • RQ3样本量、网络宽度和训练迭代次数如何随真实条件模型的复杂度而变化?
  • RQ4早停是否对一致性是必要的?还是无正则化训练也能实现最优测试误差?
  • RQ5一元分类器的局部插值性质是否会导致在噪声数据下的不一致?

主要发现

  • 即使真实条件模型任意且存在噪声,梯度下降配合早停仍可使总体风险任意接近贝叶斯风险,适用于任意可测函数。
  • 网络的 Sigmoid 输出可任意良好地校准至真实条件概率 $ \mathbb{P}[Y=1|X=x] $,从而确保置信度估计的准确性。
  • 误分类误差收敛至最优值,表明分类器在标准分类意义下具有一致性。
  • 所需样本量、网络宽度和训练迭代次数的复杂度可自然地与真实条件模型的复杂度度量相匹配,反映出数据的简单性。
  • 任何满足局部插值性质的一元分类器在噪声分布下均不一致,表明在该类设置中早停对一致性至关重要。
  • 该分析提出了逻辑斯蒂损失的新乘法误差性质,并提出一种控制整个输入球面上大宽度效应的技术,可能在更广泛场景中具有应用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。