Skip to main content
QUICK REVIEW

[论文解读] Proof of the Theory-to-Practice Gap in Deep Learning via Sampling Complexity bounds for Neural Network Approximation Spaces

Philipp Grohs, Felix Voigtlaender|arXiv (Cornell University)|Apr 6, 2021
Stochastic Gradient Optimization Techniques被引用 5
一句话总结

本文通过建立神经网络逼近空间的采样复杂度下界,证明了深度学习中存在理论与实践之间的差距。它表明,尽管神经网络在理论上能够以高阶率逼近函数,但实际算法(如随机梯度下降)由于固有的算法限制,无法实现这些速率,从而证实了长期存在的经验性差异。

ABSTRACT

We study the computational complexity of (deterministic or randomized) algorithms based on point samples for approximating or integrating functions that can be well approximated by neural networks. Such algorithms (most prominently stochastic gradient descent and its variants) are used extensively in the field of deep learning. One of the most important problems in this field concerns the question of whether it is possible to realize theoretically provable neural network approximation rates by such algorithms. We answer this question in the negative by proving hardness results for the problems of approximation and integration on a novel class of neural network approximation spaces. In particular, our results confirm a conjectured and empirically observed theory-to-practice gap in deep learning. We complement our hardness results by showing that approximation rates of a comparable order of convergence are (at least theoretically) achievable.

研究动机与目标

  • 探究基于点采样的实际算法是否能够实现理论上可证明的神经网络逼近速率。
  • 正式建立深度学习中理论与实践差距的存在,即标准优化算法无法实现理论上的逼近速率。
  • 引入一类新型神经网络逼近空间,以编码对网络深度、权重大小和逼近误差衰减的约束。
  • 为这些空间上的逼近和积分任务推导采样复杂度下界,揭示根本性的算法限制。
  • 调和神经网络在理论上强大的表达能力与优化算法在实现理论速率方面的实际低效性之间的差距。

提出的方法

  • 作者定义了神经网络逼近空间 $ A^{eta,p}_{oldsymbol{ u},oldsymbol{c}}([0,1]^d) $,用于根据逼近误差随网络规模增大而衰减的速度来表征函数,同时纳入对深度 $ oldsymbol{ u} $、权重大小 $ oldsymbol{c} $ 和 $ L^p $-范数误差的约束。
  • 他们分析了使用点采样来逼近或积分这些空间中函数的确定性和随机化算法的采样复杂度。
  • 利用变分法和极小极大技术,推导出实现给定逼近精度所需的样本数下界,表明所需样本量的增长快于标准随机优化可实现的程度。
  • 该分析涉及构造特定测试函数,并使用对偶性论证,将任何算法的误差以样本量和函数的光滑性及网络复杂度的形式进行界定。
  • 关键不等式和对参数 $ heta, heta_0, heta^* $ 的优化被用于推导最佳可能收敛速率的紧致下界,从而得出主要的困难性结果。
  • 证明依赖于在逼近空间单位球中构造一族函数,并表明任何算法若无不可行的样本数量,都无法实现理论上的逼近速率。

实验结果

研究问题

  • RQ1理论上最优的深度神经网络逼近速率能否被基于点采样的实际算法实现?
  • RQ2在神经网络逼近空间中,逼近或积分函数所需的最基本采样复杂度是什么?
  • RQ3为何常见的深度学习优化算法无法实现函数空间分析所预测的理论逼近速率?
  • RQ4对网络深度和权重大小的约束在多大程度上限制了在实践中实现理论逼近速率的可行性?
  • RQ5是否存在神经网络理论逼近能力与优化算法实际性能之间可证明的差距?

主要发现

  • 本文证明了深度学习中存在可证明的理论与实践差距:尽管神经网络在理论上能够以高阶率逼近某些函数,但任何使用点采样的确定性或随机化算法都无法实现这些速率。
  • 为神经网络逼近空间上的逼近和积分任务推导出采样复杂度下界,表明所需样本数的增长快于标准随机优化可实现的程度。
  • 对于 $ A^{eta,p}_{oldsymbol{ u},oldsymbol{c}}([0,1]^d) $ 单位球中的函数,最佳可实现收敛速率的下界为 $ n^{-eta} $,但该速率无法被任何使用 $ n $ 个样本的算法实现。
  • 通过新颖分析平滑性 $ eta $、网络深度 $ oldsymbol{ u} $ 和权重约束 $ oldsymbol{c} $ 之间的相互作用,确立了困难性结果,表明这些约束从根本上限制了算法性能。
  • 本文表明,虽然理论上可实现同阶的逼近速率,但这些速率无法通过标准深度学习算法访问,从而证实了对理论与实践差距的经验观察。
  • 通过在参数 $ heta, heta_0, heta^* $ 相关函数的下确界与最大值的紧致界进行形式化,导出在给定约束下最小可实现收敛速率的显式表达式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。