[论文解读] Network size and weights size for memorization with two-layers neural networks
本文提出了一种针对两层ReLU网络的新型复值重组方法,在ℝ^d中实现n个数据点的近似记忆化,仅需O(n/(dε))个神经元和近乎最优的总权重Õ(√n),显著优于Baum网络和神经正切核(NTK)网络中次优的权重缩放。该方法利用调和分析与复值嵌入,在数据分布较分散的温和假设下实现高效、低复杂度的记忆化。
In 1988, Eric B. Baum showed that two-layers neural networks with threshold activation function can perfectly memorize the binary labels of $n$ points in general position in $\mathbb{R}^d$ using only $\ulcorner n/d \urcorner$ neurons. We observe that with ReLU networks, using four times as many neurons one can fit arbitrary real labels. Moreover, for approximate memorization up to error $ε$, the neural tangent kernel can also memorize with only $O\left(\frac{n}{d} \cdot \log(1/ε) ight)$ neurons (assuming that the data is well dispersed too). We show however that these constructions give rise to networks where the magnitude of the neurons' weights are far from optimal. In contrast we propose a new training procedure for ReLU networks, based on complex (as opposed to real) recombination of the neurons, for which we show approximate memorization with both $O\left(\frac{n}{d} \cdot \frac{\log(1/ε)}ε ight)$ neurons, as well as nearly-optimal size of the weights.
研究动机与目标
- 解决现有两层ReLU网络在记忆化任务中权重缩放次优的问题,特别是在高维设置下。
- 提出一种构造方法,实现任意实数标签的近似记忆化时,网络规模最小化与总权重最小化。
- 克服基于阈值的(Baum)和基于核的(NTK)方法的局限性,尽管其神经元数量高效,但权重幅值缩放表现差。
- 建立一种新的理论框架,利用复值神经元重组与调和分析,实现接近最优的泛化复杂度。
提出的方法
- 提出一种基于复值ReLU神经元重组的调和网络构造,其中每个神经元由复权重向量w + iw′参数化。
- 通过复解析函数φ(w·x + iw′·x)的实部表示实值函数,利用复嵌入实现多项式逼近。
- 在索引j ∈ {0, ..., m}上采用随机化方案,以随机方式组合形如Sψ((w + jw′)·x − B)的ReLU激活,其中S ∈ {−1, 1},B为从与紧支集函数二阶导数相关的分布中抽取的偏置。
- 应用一个截断函数χ_M将逼近局部化于紧致区域,确保结果函数在ε误差范围内逼近目标函数。
- 推导出逼近系数关于复参数z的连续依赖性,保证构造的平滑性与稳定性。
- 采用类似提升的迭代过程,通过依次添加与残差误差对齐的神经元来构建完整网络,其过程由当前函数与目标标签之间的内积控制。
实验结果
研究问题
- RQ1在温和的数据假设下,两层ReLU网络能否在近似最优的神经元数量与近似最优的总权重下实现近似记忆化?
- RQ2记忆化网络的总权重如何随n、d和ε变化?是否可超越Baum与NTK网络中观察到的n√n缩放?
- RQ3能否为高维空间中分布良好的数据上任意实数标签,构造出具有O(n/(dε))个神经元与Õ(√n)总权重的ReLU网络?
- RQ4复值神经元重组在降低权重复杂度的同时保持逼近精度方面起到何种作用?
- RQ5能否利用调和分析与复嵌入,为ReLU网络建立一种兼具样本效率与权重效率的通用逼近框架?
主要发现
- 所提出的调和网络在k = Õ(n/(dε))个神经元下实现近似记忆化,总权重W(f) = Õ(√n),接近最优,因为对于随机数据,Ω̃(√n)是下界。
- 调和网络在总权重方面优于Baum网络与NTK网络,二者在随机数据上均需Ω(n√n)的权重,远非最优。
- 对于单位球面上、两两内积有Õ(1/√d)上界的点集,调和网络以高概率确保平均平方误差不超过ε。
- 该方法依赖于通过Re(w·x + iw′·x)对函数进行连续的复值表示,从而通过随机化重组实现ReLU激活的多项式逼近。
- 该构造在温和的数据分散假设下具有鲁棒性,除有界内积外,无需强分布假设。
- 理论分析证实,调和网络的权重缩放在对数因子内为最优,因为√n是随机标签设置下总权重的下界。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。