Skip to main content
QUICK REVIEW

[论文解读] Superpolynomial Lower Bounds for Learning One-Layer Neural Networks using Gradient Descent

Surbhi Goel, Aravind Gollakota|arXiv (Cornell University)|Jun 22, 2020
Stochastic Gradient Optimization Techniques参考文献 27被引用 14
一句话总结

本文在高斯分布下首次建立了使用梯度下降训练单层神经网络的超多项式下界。通过构造一族在球对称分布下完全正交的神经网络,作者证明了即使对于 ReLU 和 Sigmoid 激活函数,梯度下降和统计查询算法也需超多项式时间才能实现低测试误差,从而排除了在此设定下以多项式时间高效学习的可能性。

ABSTRACT

We prove the first superpolynomial lower bounds for learning one-layer neural networks with respect to the Gaussian distribution using gradient descent. We show that any classifier trained using gradient descent with respect to square-loss will fail to achieve small test error in polynomial time given access to samples labeled by a one-layer neural network. For classification, we give a stronger result, namely that any statistical query (SQ) algorithm (including gradient descent) will fail to achieve small test error in polynomial time. Prior work held only for gradient descent run with small batch sizes, required sharp activations, and applied to specific classes of queries. Our lower bounds hold for broad classes of activations including ReLU and sigmoid. The core of our result relies on a novel construction of a simple family of neural networks that are exactly orthogonal with respect to all spherically symmetric distributions.

研究动机与目标

  • 在高斯分布下,建立梯度下降学习单层神经网络所需时间的无条件下界。
  • 证明即使在过参数化网络中使用梯度下降训练,也无法在多项式时间内高效泛化。
  • 将这些结果扩展到统计查询(SQ)模型,表明任何使用内积查询的 SQ 算法同样需要超多项式时间。
  • 构造一族在球对称分布下完全正交的神经网络,以支持下界构造。
  • 排除通过标准深度学习实践(如在平方损失或逻辑损失上使用梯度下降训练多项式大小的网络)实现高效泛化的可能性。

提出的方法

  • 构造一族具有 ReLU 或 Sigmoid 激活函数的单层神经网络,使其在任意球对称分布(包括标准高斯分布)下两两完全正交。
  • 利用这种正交性构建一个概念类,其中任何分类器必须至少进行 $ n^{ ilde{ heta}( ext{poly}( ext{log}~m))} $ 次查询才能实现低误差。
  • 利用统计查询(SQ)模型证明,任何依赖内积查询的算法(如梯度下降)都需要超多项式时间。
  • 证明总体损失的梯度可使用容忍度为 $ au $ 的统计查询近似,从而将 SQ 下界与梯度下降性能联系起来。
  • 应用基于 SDA(统计查询维数)和内积查询复杂度的一般 SQ 下界框架,推导出最终的下界。
  • 在过参数化网络上进行实验,使用梯度下降在回归和分类任务上进行训练,结果显示尽管训练误差很低,但测试误差仍很高。

实验结果

研究问题

  • RQ1在标准高斯分布下,梯度下降能否高效学习具有 ReLU 或 Sigmoid 激活函数的单层神经网络?
  • RQ2即使网络过参数化或处于 NTK 范畴,梯度下降的超多项式下界是否仍然成立?
  • RQ3统计查询算法(包括基于梯度下降的算法)能否在多项式时间内学习此类网络?
  • RQ4是否存在由于数据和函数类几何结构带来的根本性限制,与优化启发式方法无关?
  • RQ5标准深度学习实践(如在平方损失或逻辑损失上使用梯度下降训练多项式大小的网络)在此设定下是否无法实现高效泛化?

主要发现

  • 本文证明,任何使用内积查询的统计查询算法在标准高斯分布下学习单层 ReLU 或 Sigmoid 网络,均需 $ n^{ ilde{ heta}( ext{poly}( ext{log}~m))} $ 次查询。
  • 对于分类任务,要以 $ rac{1}{2} - ilde{ heta}(m^{-b}) $ 的优势学习具有 $ m $ 个隐藏单元的单层网络,需 $ n^{ ilde{ heta}( ext{log}~m)} $ 次查询,从而排除了多项式时间学习的可能性。
  • 这些下界是无条件的,不依赖于分类器的架构,仅取决于算法本身(梯度下降或 SQ)。
  • 构造在球对称分布下完全正交的函数族是证明下界的核心。
  • 实验结果与理论一致:过参数化网络实现接近零的训练误差,但测试误差仍很高,与超多项式下界一致。
  • 结果同时适用于回归(平方损失)和分类(Softmax 输出的符号),表明常见训练实践在此设定下无法实现高效泛化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。