[论文解读] Firefly Neural Architecture Descent: a General Approach for Growing Neural Networks
Firefly Neural Architecture Descent 是一种基于原则的、最速下降框架,通过在当前网络的 $\epsilon$-邻近函数邻域内迭代选择最优架构,实现动态增长神经网络。该方法支持灵活、高效的宽度与深度扩展,在持续学习中实现最先进性能,模型更小、更准确,且能有效避免灾难性遗忘。
We propose firefly neural architecture descent, a general framework for progressively and dynamically growing neural networks to jointly optimize the networks' parameters and architectures. Our method works in a steepest descent fashion, which iteratively finds the best network within a functional neighborhood of the original network that includes a diverse set of candidate network structures. By using Taylor approximation, the optimal network structure in the neighborhood can be found with a greedy selection procedure. We show that firefly descent can flexibly grow networks both wider and deeper, and can be applied to learn accurate but resource-efficient neural architectures that avoid catastrophic forgetting in continual learning. Empirically, firefly descent achieves promising results on both neural architecture search and continual learning. In particular, on a challenging continual image classification task, it learns networks that are smaller in size but have higher average accuracy than those learned by the state-of-the-art methods.
研究动机与目标
- 为以动态、渐进方式联合优化神经网络参数与架构提供解决方案。
- 克服启发式或随机网络增长方法无法保证性能提升的局限性。
- 开发一种通用、灵活的框架,支持神经网络的宽度与深度扩展。
- 通过原则化的网络增长,防止灾难性遗忘,实现有效的持续学习。
- 提供一种可扩展、高效的替代方案,以替代基于二阶或组合搜索的神经架构搜索方法。
提出的方法
- 该方法将网络增长建模为在函数邻域 $\partial(f_t, \epsilon)$ 上的最速下降优化,其中 $f_{t+1}$ 是在复杂度约束下使损失最小的邻域内最佳网络。
- 当 $\epsilon$ 较小时,利用泰勒近似将组合优化问题简化为贪心选择过程,从而实现高效计算。
- 通过统一的、可微分的函数扰动搜索空间,同时支持网络加宽(添加神经元)与加深(添加层)。
- 在持续学习中,通过扩展功能等价但更大的架构来增长网络,以保留先前知识并减少遗忘。
- 该方法通过广义分裂最速下降,允许超出神经元分裂的任意结构变化,包括新增层与神经元。
- 其作为可微分的迭代过程实现,可应用于标准神经网络组件及基于单元的神经架构搜索(如 DARTS)。
实验结果
研究问题
- RQ1能否设计一种基于梯度类下降的方法,以联合优化架构与参数的方式动态增长神经网络?
- RQ2如何使网络增长足够灵活,以在统一框架中同时支持加宽与加深?
- RQ3该方法能否通过减少灾难性遗忘,在持续学习中超越启发式或随机搜索策略?
- RQ4与最先进方法相比,该方法在实现高准确率的同时,能否以更小、更高效的模型实现?
- RQ5泰勒近似如何实现复杂架构搜索空间中的高效、贪心选择?
主要发现
- 在具有挑战性的持续图像分类任务(20类分割CIFAR-100)中,Firefly 学习到的模型体积更小,但平均准确率高于最先进方法。
- Firefly 在 CIFAR-100 上实现了 91.03% 的准确率,最终网络仅含 80 个参数,优于 Learn-to-Grow 和 Compact-Pick-Grow 等方法。
- 该方法通过动态增长功能等价但更大的网络,有效保留先前知识,从而减少灾难性遗忘。
- 在神经架构搜索中,Firefly 在基于 DARTS 的模型中成功优化了单元结构,证明了其在持续学习之外的通用性。
- 通过泰勒展开近似函数邻域,该框架实现了高效、贪心的网络增长,避免了昂贵的二阶计算。
- 实验结果表明,Firefly 在准确率与模型效率方面,始终优于基于启发式的增长方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。