[论文解读] Deep vs. shallow networks : An approximation theory perspective
本文通过引入衡量稀疏性的结构优势指标——相对维数(relative dimension),为深度神经网络在近似组合函数时优于浅层网络提供了理论基础。证明了使用ReLU或高斯激活函数的深度网络能够以指数级更少的参数量近似某些高维函数,通过分层组合性绕过维度灾难。
The paper briefy reviews several recent results on hierarchical architectures for learning from examples, that may formally explain the conditions under which Deep Convolutional Neural Networks perform much better in function approximation problems than shallow, one-hidden layer architectures. The paper announces new results for a non-smooth activation function - the ReLU function - used in present-day neural networks, as well as for the Gaussian networks. We propose a new definition of relative dimension to encapsulate different notions of sparsity of a function class that can possibly be exploited by deep networks but not by shallow ones to drastically reduce the complexity required for approximation and learning.
研究动机与目标
- 解释为何深度卷积神经网络(DCNNs)在函数近似任务中相较于浅层网络表现出更优的近似性能。
- 形式化深度网络通过利用函数中的组合结构来绕过维度灾难的条件。
- 提出并证明一种新度量——相对维数,以量化深度网络可利用但浅层网络无法利用的不同形式的稀疏性。
- 将逼近理论结果扩展至ReLU和高斯激活函数,这两类函数在现代深度学习中具有核心地位。
- 通过将随机梯度下降(SGD)的高效训练与组合函数的高效逼近相联系,为SGD在训练深度网络中的经验成功提供理论依据。
提出的方法
- 基于有向无环图(DAGs)提出一种新的理论框架,用于建模分层的深度网络架构,特别是类似于ResNet或卷积结构的网络。
- 引入以有界入度(如二叉树)为特征的DAG结构化组合函数概念,通过分层组合实现出色的近似性能。
- 定义相对维数 $ D( ext{V}, ext{W}) = \limsup_{n\to\infty} \frac{\log d_n(\text{W})}{\log d_n(\text{V})} $,其中 $ d_n $ 表示非线性 $ n $-宽度,用于量化深度网络相较于浅层网络的近似优势。
- 应用伯恩斯坦型不等式,推导出基于 $ \mathcal{B}_{\gamma,q} $(ReLU)和 $ \mathcal{G}\mathcal{B}_{\gamma} $(高斯网络)定义的函数类的近似误差界,表明深度网络具有更快的收敛速率。
- 使用多项式与样条基函数的实例,证明深度网络可仅用远少于浅层网络的参数表示高阶或多尺度函数。
- 证明对于函数 $ Q(x_1,x_2,x_3,x_4) = (Q_1(Q_2(x_1,x_2), Q_3(x_3,x_4)))^{1024} $,深度网络仅需 $ \mathcal{O}(n^{18}) $ 个参数,而浅层网络在无组合结构时需约 $ 1.17 \times 10^{13} $ 个参数。
实验结果
研究问题
- RQ1为何尽管参数量相近,深度神经网络在近似某些函数时显著优于浅层网络?
- RQ2函数的何种结构特性使深度网络能够绕过近似中的维度灾难?
- RQ3如何对函数类中不同形式的稀疏性进行形式化度量,以解释深度网络的优越性?
- RQ4能否通过统一框架对ReLU和高斯网络的逼近能力进行理论界定,并与浅层网络进行比较?
- RQ5组合结构(如分层函数组合)在实现深度网络高效近似中起到何种作用?
主要发现
- 使用ReLU或高斯激活函数的深度网络在近似组合函数时,可显著减少所需参数量,尤其当目标函数表现出分层或多尺度结构时。
- 对于在4个变量中总次数为4096的嵌套多项式函数,浅层网络约需 $ 1.17 \times 10^{13} $ 个参数,而深度网络由于组合结构仅需 $ \mathcal{O}(n^{18}) $ 个参数即可表示。
- 相对维数 $ D(\mathcal{G}\mathcal{B}_{\gamma}, \mathcal{B}_{\gamma,q}) \leq d/q $ 量化了深度网络的近似优势,其中 $ d $ 为最大入度,$ q $ 为函数类的维度。
- 高斯网络类 $ \mathcal{G}\mathcal{B}_{\gamma} $ 的非线性 $ n $-宽度以 $ \mathcal{O}(n^{-\gamma/(2d)}) $ 速率衰减,而ReLU类 $ \mathcal{B}_{\gamma,q} $ 的衰减速率为 $ \mathcal{O}(n^{-\gamma/(2q)}) $,表明当 $ d \ll q $ 时,深度网络实现更快的收敛速率。
- 论文证明了高斯网络的逆定理,表明近似误差界是紧致的,并推测ReLU网络也具有类似结果。
- 该理论框架表明,参数数量并非衡量网络复杂性的最佳指标;相对维数更能捕捉架构深度与组合结构带来的真正效率增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。