[论文解读] Arbitrary-Depth Universal Approximation Theorems for Operator Neural Networks
该论文建立了深度、窄宽度算子神经网络(算子NN)的首个通用逼近定理,证明了具有非多项式或非仿射多项式激活函数的宽度为5的算子NN可普遍逼近任意连续非线性算子。该方法通过输入截断和深度相关的解码网络,将多个输入编码为单一数值,从而实现在任意深度下保持恒定宽度的逼近。
The standard Universal Approximation Theorem for operator neural networks (NNs) holds for arbitrary width and bounded depth. Here, we prove that operator NNs of bounded width and arbitrary depth are universal approximators for continuous nonlinear operators. In our main result, we prove that for non-polynomial activation functions that are continuously differentiable at a point with a nonzero derivative, one can construct an operator NN of width five, whose inputs are real numbers with finite decimal representations, that is arbitrarily close to any given continuous nonlinear operator. We derive an analogous result for non-affine polynomial activation functions. We also show that depth has theoretical advantages by constructing operator ReLU NNs of depth $2k^3+8$ and constant width that cannot be well-approximated by any operator ReLU NN of depth $k$, unless its width is exponential in $k$.
研究动机与目标
- 建立具有有界宽度和任意深度的算子神经网络的通用逼近定理,填补现有理论中的空白。
- 证明深度、窄宽度算子NN可在浅层、宽网络需要指数级宽度的情况下实现通用逼近。
- 通过构建无法被浅层网络以指数级宽度增长方式良好逼近的算子NN,展示深度带来的理论优势。
- 将通用逼近理论扩展至非仿射多项式激活函数,这些函数通常被排除在标准通用逼近定理(UAT)之外。
- 通过输入编码与截断,提供一种使用最小宽度网络逼近连续非线性算子的稳健框架。
提出的方法
- 基于目标精度ε,将实数输入截断为有限小数表示,以实现编码为单一标量值。
- 使用依赖于深度的解码网络从编码标量中提取各个截断后的输入,其近似通过任意深度的ReLU网络实现。
- 构建一个宽度为5的算子NN,其中一个神经元负责传播编码后的输入,其余神经元负责解码和计算。
- 将标准前馈网络的通用逼近定理应用于编码后的函数空间,确保在紧集上的一致逼近。
- 利用在某点连续可微且导数非零的激活函数的稠密性性质,确保逼近能力。
- 通过使用二阶导数条件,将结果扩展至非仿射多项式激活函数,实现在最小宽度下有效解码。
实验结果
研究问题
- RQ1具有有界宽度和任意深度的算子神经网络能否普遍逼近连续非线性算子?
- RQ2对于一大类激活函数,实现通用逼近所需的最小宽度是多少?
- RQ3与浅层、宽网络相比,深度在逼近某些算子时提供了何种理论优势?
- RQ4尽管在浅层架构中存在局限性,非仿射多项式激活函数能否用于算子网络的通用逼近?
- RQ5输入编码与截断在多大程度上可降低算子神经网络设计中的宽度需求?
主要发现
- 具有非多项式激活函数、在某点连续可微且导数非零的宽度为5的算子神经网络,可对任意连续非线性算子在任意期望误差ε内实现一致逼近。
- 对于非仿射多项式激活函数,宽度为6的算子NN足以实现通用逼近;在满足二阶导数条件时,宽度为5的构造亦可行。
- 深度为$2k^3 + 8$、宽度恒定的算子ReLU网络,若不具指数级宽度,则无法被任何深度为$k$的算子ReLU网络良好逼近,这表明了理论上的深度优势。
- 输入编码与截断策略通过将多个输入简化为单一标量,实现了恒定宽度逼近,解码通过深层子网络完成。
- 实现逼近所需的采样点数$m$与激活函数无关,仅取决于目标精度和算子的连续性。
- 该框架通过将宽度与深度的权衡转移至深度,扩展了先前的通用逼近定理,证明仅通过深度即可在最小宽度下实现通用逼近。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。