[论文解读] Approximation capabilities of neural networks on unbounded domains
本文证明,具有单调激活函数(如 ReLU、ELU 或 sigmoid)的浅层神经网络可以对 $L^p$ 函数在 $\mathbb{R} \times [0,1]^n$ 上进行普遍逼近,但对于 $m \geq 2$ 的 $\mathbb{R}^m \times [0,1]^n$ 域,无法表示任何非零 $L^p$ 函数。相比之下,仅含三层(两层隐层)的深层 ReLU 网络被证明在 $L^p(\mathbb{R}^n)$ 中是普遍逼近器,凸显了深度在无界域上表示函数时的根本优势。
In this paper, we prove that a shallow neural network with a monotone sigmoid, ReLU, ELU, Softplus, or LeakyReLU activation function can arbitrarily well approximate any L^p(p>=2) integrable functions defined on R*[0,1]^n. We also prove that a shallow neural network with a sigmoid, ReLU, ELU, Softplus, or LeakyReLU activation function expresses no nonzero integrable function defined on the Euclidean plane. Together with a recent result that the deep ReLU network can arbitrarily well approximate any integrable function on Euclidean spaces, we provide a new perspective on the advantage of multiple hidden layers in the context of ReLU networks. Lastly, we prove that the ReLU network with depth 3 is a universal approximator in L^p(R^n).
研究动机与目标
- 研究浅层神经网络在无界域(特别是 $\mathbb{R} \times [0,1]^n$ 和 $\mathbb{R}^m \times [0,1]^n$)上的逼近能力。
- 确定具有常见激活函数(如 ReLU、ELU 或 sigmoid)的浅层网络是否能在无界域上表示非零可积函数。
- 阐明深度 ReLU 网络在逼近 $\mathbb{R}^n$ 上的 $L^p$ 函数时,深度所带来的表征优势。
- 为无界、非紧致域背景下的普遍逼近性质建立新的理论基础。
提出的方法
- 利用一致连续性和傅里叶分析的性质,证明具有单调、非多项式激活函数的浅层网络可逼近任意 $L^p(\mathbb{R} \times [0,1]^n)$ 函数($p \geq 2$)。
- 通过证明在这些域上生成的函数空间是平凡的,表明此类网络无法在 $\mathbb{R}^m \times [0,1]^n$($m \geq 2$)上表示任何非零 $L^p$ 函数。
- 使用富比尼定理,将 $\mathbb{R} \times \mathbb{R}^+$ 上的不可表达性结果推广至更高维无界域。
- 利用 ReLU 激活函数构造一个紧支集且非零的函数 $F$,深度为 3,并证明其平移与缩放构成 $L^p(\mathbb{R}^n)$ 中的稠密集。
- 利用 $F$ 的缩放和平移副本集合 $S_F$ 在 $L^p(\mathbb{R}^n)$ 中的稠密性,结合 ReLU 网络在加法与仿射变换下的闭包性质。
- 应用文献 [20] 中的定理 5.1,当 $F$ 可积、有界、几乎处处连续且非零时,$S_F$ 在 $L^p(\mathbb{R}^n)$ 中稠密。
实验结果
研究问题
- RQ1具有 ReLU 或 sigmoid 激活函数的浅层神经网络能否对 $\mathbb{R} \times [0,1]^n$ 上的任意 $L^p$ 函数($p \geq 2$)进行逼近?
- RQ2具有标准激活函数的浅层网络是否能在 $\mathbb{R}^m \times [0,1]^n$($m \geq 2$)上表示任何非零 $L^p$ 函数?
- RQ3ReLU 网络在 $L^p(\mathbb{R}^n)$ 中成为普遍逼近器所需的最小深度是多少?
- RQ4浅层网络在有界域与无界域上的表征能力有何不同?
- RQ5在无界域上逼近函数时,深度 ReLU 网络具有优势的理论基础是什么?
主要发现
- 具有单调 sigmoid、ReLU、ELU、Softplus 或 LeakyReLU 激活函数的浅层神经网络可对任意 $L^p(\mathbb{R} \times [0,1]^n)$ 函数($p \geq 2$)进行任意精确的逼近。
- 具有相同激活函数的浅层网络无法在 $\mathbb{R}^m \times [0,1]^n$($m \geq 2$)上表示任何非零 $L^p$ 函数,包括 $\mathbb{R} \times \mathbb{R}^+$。
- 深度为 3(两层隐层)的 ReLU 网络是 $L^p(\mathbb{R}^n)$($p \in [1, \infty)$)中的普遍逼近器,优于以往的深度界限。
- 通过深度为 3 的 ReLU 激活函数构造的函数 $F$ 是连续的、非负的、紧支集且非零的,其平移与缩放构成 $L^p(\mathbb{R}^n)$ 中的稠密集。
- 浅层网络在 $\mathbb{R}^m \times [0,1]^n$($m \geq 2$)上不可表达的原因在于其无法在 $\mathbb{R} \times \mathbb{R}^+$ 上表示非零函数,这受限于一致连续性和衰减约束。
- 该结果揭示了 ReLU 网络中深度的根本优势:浅层网络在高维无界域上失效,而仅含三层的深层网络即可在 $L^p(\mathbb{R}^n)$ 中实现普遍逼近。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。