Skip to main content
QUICK REVIEW

[论文解读] Depth Separation for Neural Networks

Amit Daniely|arXiv (Cornell University)|Feb 27, 2017
Neural Networks and Applications被引用 17
一句话总结

该论文通过证明:若函数 $ g $ 无法被低次多项式良好逼近,则在球面 $ \mathbb{S}^{d-1} \times \mathbb{S}^{d-1} $ 上,某些径向函数 $ f(x, x') = g(\langle x, x' \rangle) $ 无法被多项式大小、指数权重有界的二层神经网络逼近,从而建立了两层与三层神经网络之间的深度分离。关键结果表明,当 $ g(x) = \sin(\pi d^3 x) $ 时,二层网络需要 $ 2^{\Omega(d \log d)} $ 个神经元,而三层网络可用多项式宽度实现对这类函数的逼近,从而在均匀分布下展现出显著的表达能力差异。

ABSTRACT

Let $f:\mathbb{S}^{d-1} imes \mathbb{S}^{d-1} o\mathbb{S}$ be a function of the form $f(\mathbf{x},\mathbf{x}') = g(\langle\mathbf{x},\mathbf{x}' angle)$ for $g:[-1,1] o \mathbb{R}$. We give a simple proof that shows that poly-size depth two neural networks with (exponentially) bounded weights cannot approximate $f$ whenever $g$ cannot be approximated by a low degree polynomial. Moreover, for many $g$'s, such as $g(x)=\sin(πd^3x)$, the number of neurons must be $2^{Ω\left(d\log(d) ight)}$. Furthermore, the result holds w.r.t.\ the uniform distribution on $\mathbb{S}^{d-1} imes \mathbb{S}^{d-1}$. As many functions of the above form can be well approximated by poly-size depth three networks with poly-bounded weights, this establishes a separation between depth two and depth three networks w.r.t.\ the uniform distribution on $\mathbb{S}^{d-1} imes \mathbb{S}^{d-1}$.

研究动机与目标

  • 在 $ \mathbb{S}^{d-1} \times \mathbb{S}^{d-1} $ 上的均匀分布下,建立二层与三层神经网络之间表达能力的可证明分离。
  • 识别出一类广泛的函数 $ f(x, x') = g(\langle x, x' \rangle) $,这些函数无法被权重有界的小型二层网络表示。
  • 为二层网络所需神经元数量提供强下界,证明其对 $ d \log d $ 呈指数依赖,超越了以往仅对 $ d $ 呈指数依赖的界限。
  • 证明三层网络可高效逼近此类函数,从而确立三层架构在表达能力上的优势。

提出的方法

  • 使用球面上的调和分析,特别是对次数为 $ n $ 的球谐函数的投影,来分析逼近误差。
  • 将 $ A_{n,d}(f) $ 定义为在测度 $ \mu_d $ 下,$ f $ 到次数低于 $ (n-1) $ 的多项式空间的 $ L^2 $-距离,用于捕捉最佳多项式逼近误差。
  • 推导出任意二层网络与目标函数 $ F(x, x') = f(\langle x, x' \rangle) $ 之间 $ L^2 $-距离的下界,该下界依赖于 $ A_{n,d}(f) $ 以及网络的宽度和权重界。
  • 应用关于 ReLU 对利普希茨函数逼近的已知结果(引理6),构造出具有受控宽度和权重界的三层网络,以逼近 $ f $。
  • 利用 $ \mu_d $ 是从 $ \mathbb{S}^{d-1} $ 上的均匀测度通过映射 $ x \mapsto x_1 $ 的拉回这一事实,从而可应用正交多项式理论。
  • 使用勒让德多项式及其性质,分析高维下 $ f $ 的行为及其逼近误差。

实验结果

研究问题

  • RQ1权重有界、多项式大小的二层 ReLU 网络能否在球面上逼近径向函数 $ f(x, x') = g(\langle x, x' \rangle) $?
  • RQ2当 $ g $ 无法被低次多项式良好逼近时,此类二层网络所需的最少神经元数量是多少?
  • RQ3具有多项式宽度和有界权重的三层网络能否高效逼近同一类函数?
  • RQ4在 $ \mathbb{S}^{d-1} \times \mathbb{S}^{d-1} $ 上的均匀分布下,能否支持二层与三层网络之间可证明的深度分离?

主要发现

  • 对于 $ g(x) = \sin(\pi d^3 x) $,任意权重有界于 $ 2^d $ 的二层 ReLU 网络,其逼近误差至少为 $ \frac{1}{50e^2\pi^2} $,因此至少需要 $ 2^{\Omega(d \log d)} $ 个神经元。
  • 该下界强于以往工作,后者仅证明对 $ d $ 的指数依赖,而本文证明了对 $ d \log d $ 的指数依赖。
  • 该结果在 $ \mathbb{S}^{d-1} \times \mathbb{S}^{d-1} $ 上的均匀分布下成立,该域是自然且对称的。
  • 证明过程简短,仅基于基本调和分析,避免了以往工作中使用的复杂工具(如缓增分布)。
  • 相比之下,三层 ReLU 网络可使用宽度 $ \frac{16\pi d^5}{\epsilon} $ 和权重有界于 $ 2\pi d^3 $ 的方式,高效逼近 $ F(x, x') = f(\langle x, x' \rangle) $,展现出高效的表达能力。
  • 本文建立了可证明的深度分离:对于某些函数,二层网络需要超多项式规模,而三层网络可用多项式规模实现相同目标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。