[论文解读] Constructive neural network learning
本文提出了一种新型可扩展学习系统——构造性前馈神经网络(CFN),该系统通过基于Voronoi划分和Landweber型迭代方法,直接从数据中构建神经网络参数,克服了经典饱和问题,并为光滑回归函数实现了最优学习率,在理论和模拟实验中均优于传统FNN以及RLS和ELM等先进方法。
In this paper, we aim at developing scalable neural network-type learning systems. Motivated by the idea of "constructive neural networks" in approximation theory, we focus on "constructing" rather than "training" feed-forward neural networks (FNNs) for learning, and propose a novel FNNs learning system called the constructive feed-forward neural network (CFN). Theoretically, we prove that the proposed method not only overcomes the classical saturation problem for FNN approximation, but also reaches the optimal learning rate when the regression function is smooth, while the state-of-the-art learning rates established for traditional FNNs are only near optimal (up to a logarithmic factor). A series of numerical simulations are provided to show the efficiency and feasibility of CFN via comparing with the well-known regularized least squares (RLS) with Gaussian kernel and extreme learning machine (ELM).
研究动机与目标
- 开发一种适用于大规模数据的可扩展、高效的前馈神经网络(FNN)学习系统。
- 解决基于梯度和基于随机化方法训练FNN的局限性,包括局部极小值、高计算成本以及泛化性能下降的问题。
- 克服FNN逼近中的经典饱和问题,该问题在回归函数光滑时限制了学习速率。
- 将逼近理论中的构造性技术与统计局部平均及迭代优化相结合,以提升泛化能力和收敛性。
- 为光滑函数建立理论上最优的学习速率,实现无对数因子的最佳可能收敛速率。
提出的方法
- 通过具有良好几何分布的中心直接从数据中构建FNN参数,避免迭代训练。
- 基于所选中心应用Voronoi划分,将输入数据分组并定义用于平均的局部区域。
- 采用逼近理论中的构造性逼近方法,构建初始FNN以实现高逼近精度。
- 引入Landweber型迭代优化过程,以克服FNN逼近中的饱和现象。
- 在每个Voronoi单元内通过类似核的加权方式实施局部平均,以降低方差并提高抗噪声能力。
- 通过结合多变量中值定理、函数可微性以及经验风险的随机分析,推导理论收敛界。
实验结果
研究问题
- RQ1能否设计一种构造性FNN学习系统,在避免传统训练计算负担的同时保持高泛化性能?
- RQ2所提出的CFN方法是否克服了FNN逼近中的经典饱和问题,特别是在光滑回归函数情况下?
- RQ3CFN的学习速率是否能实现无对数因子的最优速率,而不同于现有FNN?
- RQ4Voronoi划分与Landweber迭代的结合如何在噪声数据环境中提升泛化能力?
- RQ5CFN方法在大规模数据上是否具备可扩展性和有效性,如与RLS和ELM的数值比较所证实?
主要发现
- CFN为光滑度为 $ s $ 的光滑回归函数实现了最优学习速率 $ m^{-2s/(2s+d)} $,这是无对数因子的最优可能速率。
- 该方法克服了FNN逼近中的经典饱和问题,此前当 $ s > 1 $ 时该问题限制了学习速率。
- 理论分析证明,期望泛化误差满足 $ \mathbb{E}[\|\widetilde{N_{n,w}^{r}} - f_{\rho}\|_{\rho}^{2}] \leq C'''' m^{-2s/(2s+d)} $,证实了最优收敛性。
- 数值模拟表明,CFN在学习精度和效率方面均优于带高斯核的正则化最小二乘法(RLS)和极限学习机(ELM)。
- Voronoi划分与局部平均的结合显著降低了方差,增强了对噪声的鲁棒性,尤其在仅使用部分样本进行构造时效果更明显。
- Landweber型迭代优化步骤成功消除了饱和效应,使性能超越先前构造性FNN的理论极限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。