[论文解读] Splitting Steepest Descent for Growing Neural Architectures
本文提出了一种新型的渐进式神经架构搜索方法——分裂最速下降(Splitting Steepest Descent, SSD),该方法通过在∞-Wasserstein度量空间中采用函数最速下降框架,自适应地将神经元分裂为后代,从而逐步增长神经网络。该方法实现了二阶下降以逃离鞍点,优于随机和启发式分裂策略,并在资源受限环境下实现了高效、轻量的架构学习。
We develop a progressive training approach for neural networks which adaptively grows the network structure by splitting existing neurons to multiple off-springs. By leveraging a functional steepest descent idea, we derive a simple criterion for deciding the best subset of neurons to split and a splitting gradient for optimally updating the off-springs. Theoretically, our splitting strategy is a second-order functional steepest descent for escaping saddle points in an $\infty$-Wasserstein metric space, on which the standard parametric gradient descent is a first-order steepest descent. Our method provides a new computationally efficient approach for optimizing neural network structures, especially for learning lightweight neural architectures in resource-constrained settings.
研究动机与目标
- 为解决在资源受限环境下高效、自动化的神经架构优化挑战。
- 将基于梯度的优化方法从参数空间拓展至模型结构的离散空间。
- 开发一种系统化、可微的神经网络增长方法,通过神经元分裂而非随机初始化或固定添加来构建网络。
- 实现在持续学习和轻量化模型学习中的更快收敛与更优性能。
- 提供一种二阶函数最速下降方法,通过最优分裂实现对鞍点的逃离。
提出的方法
- 该方法在标准参数化梯度下降与分裂阶段之间交替进行,通过将神经元分裂为后代来扩展网络。
- 分裂过程由∞-Wasserstein度量空间中的函数最速下降准则引导,将网络视为神经元的分布。
- 最优分裂方向由分裂梯度导出,该梯度在后代的无穷小扰动下最小化损失。
- 理论上证明分裂最速下降为二阶下降,而标准参数化下降为一阶。
- 采用基于核函数的MMD(最大均值差异)损失来度量压缩后数据分布与原始数据分布之间的分布相似性。
- 通过核函数的二阶导数计算分裂矩阵,实现后代的最优定位。
实验结果
研究问题
- RQ1我们能否推导出一种系统化、可微的神经网络架构增长策略,通过分裂神经元实现?
- RQ2如何利用∞-Wasserstein空间中的函数最速下降来引导最优神经元分裂?
- RQ3基于分裂的架构增长是否在收敛性和准确性上优于随机或启发式分裂?
- RQ4该方法是否能比标准参数化梯度下降更有效地逃离鞍点?
- RQ5在学习轻量化模型方面,该方法与Frank-Wolfe、随机初始化和基于剪枝的方法相比表现如何?
主要发现
- 所提出的分裂最速下降(最优分裂)在数据压缩实验中,所有迭代周期内均达到最低的MMD损失,优于所有基线方法。
- 该方法收敛速度更快,且在早期迭代中训练损失显著低于随机分裂、新初始化和梯度提升方法。
- 新初始化和梯度提升方法的损失曲线出现“突跳”现象,归因于每次新增粒子后重新加权,而本方法避免了这一问题。
- 该方法无需依赖大规模预训练模型即可实现有效的模型增长,因此特别适用于移动设备和物联网设备等资源受限环境。
- 实验结果表明,SSD能够学习到比现有剪枝方法更准确的小型模型,充分证明了其在紧凑架构学习中的优越性。
- 理论分析证实,分裂阶段执行的是二阶函数最速下降,能够在函数空间中有效逃离鞍点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。