[论文解读] Nonparametric Neural Networks
本文提出非参数神经网络,一种在单次训练过程中通过ℓ₂惩罚和输入/输出权重的ℓₚ正则化持续添加和移除单元来动态调整网络规模的框架。所提出的AdaRad优化算法实现了网络的自动增长与剪枝,在计算成本更低的情况下,准确率高于固定规模网络和传统超参数搜索方法。
Automatically determining the optimal size of a neural network for a given task without prior information currently requires an expensive global search and training many networks from scratch. In this paper, we address the problem of automatically finding a good network size during a single training cycle. We introduce *nonparametric neural networks*, a non-probabilistic framework for conducting optimization over all possible network sizes and prove its soundness when network growth is limited via an L_p penalty. We train networks under this framework by continuously adding new units while eliminating redundant units via an L_2 penalty. We employ a novel optimization algorithm, which we term *adaptive radial-angular gradient descent* or *AdaRad*, and obtain promising results.
研究动机与目标
- 为解决在缺乏先验知识或昂贵全局超参数搜索的情况下自动选择最优神经网络规模的挑战。
- 实现在单次训练过程中动态网络增长与剪枝,避免重复的完整训练周期。
- 在输入或输出权重的ℓₚ正则化下证明该框架的理论合理性,确保收敛到有限规模解。
- 开发一种新型优化算法AdaRad,通过自适应调整径向和角度步长,实现高效的网络规模调整。
- 证明非参数网络在测试准确率上优于固定规模网络和标准超参数搜索方法。
提出的方法
- 提出一种非参数神经网络框架,其中网络宽度(每层单元数)为可学习的超参数,而非预先固定。
- 对输入或输出ℓₚ正则化器(Ω_in 或 Ω_out)进行应用,以防止网络规模无界增长并确保最优规模为有限值。
- 采用一种新型归一化层CapNorm,以在动态调整网络规模时稳定训练过程。
- 提出AdaRad(自适应径向-角度梯度下降)优化算法,自适应调整径向(权重幅值)和角度(方向)步长。
- 采用两阶段训练策略:首先通过添加单元扩展网络,然后在保持性能的前提下通过ℓ₂正则化剪枝冗余单元。
- 在收敛后采用回滚机制以优化超参数,逐步减小步长直至无法进一步提升。
实验结果
研究问题
- RQ1神经网络是否能在单次训练过程中自动确定其最优规模,而无需先验知识或多次完整训练周期?
- RQ2通过ℓ₂和ℓₚ正则化实现的动态网络增长与剪枝,是否能比固定规模网络带来更好的泛化性能?
- RQ3所提出的AdaRad优化算法是否能有效平衡网络扩展与剪枝,从而提升模型准确率?
- RQ4在ℓₚ正则化下,该非参数框架是否具有理论合理性,能否保证获得有限最优网络规模?
- RQ5非参数网络的性能与随机搜索或贝叶斯优化等标准超参数搜索方法相比如何?
主要发现
- 非参数网络在相同规模下测试准确率高于固定规模网络,证明了动态架构自适应的优势。
- 当使用输入或输出ℓₚ正则化且λ > 0时,该框架在有限网络规模下实现训练误差的全局最小值。
- AdaRad实现了网络规模与权重的联合有效优化,在动态设置下优于Adam和RMSprop等标准优化器。
- 在扑克牌数据集上,最佳非参数网络的测试误差为1.44%,优于最佳固定规模网络(1.52%)和所有标准超参数搜索基线。
- 非参数框架选择的网络规模始终小于表现最佳的固定规模网络,表明参数效率更高。
- 消融研究证实,CapNorm层和AdaRad算法在非参数设置下的稳定与高效训练中均不可或缺。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。