Skip to main content
QUICK REVIEW

[论文解读] Firefly Neural Architecture Descent: a General Approach for Growing Neural Networks

Lemeng Wu, Bo Liu|arXiv (Cornell University)|Feb 17, 2021
Domain Adaptation and Few-Shot Learning被引用 16
一句话总结

Firefly Neural Architecture Descent 是一种基于原则的、最速下降框架,通过在当前网络的 $\epsilon$-邻近函数邻域内迭代选择最优架构,实现动态增长神经网络。该方法支持灵活、高效的宽度与深度扩展,在持续学习中实现最先进性能,模型更小、更准确,且能有效避免灾难性遗忘。

ABSTRACT

We propose firefly neural architecture descent, a general framework for progressively and dynamically growing neural networks to jointly optimize the networks' parameters and architectures. Our method works in a steepest descent fashion, which iteratively finds the best network within a functional neighborhood of the original network that includes a diverse set of candidate network structures. By using Taylor approximation, the optimal network structure in the neighborhood can be found with a greedy selection procedure. We show that firefly descent can flexibly grow networks both wider and deeper, and can be applied to learn accurate but resource-efficient neural architectures that avoid catastrophic forgetting in continual learning. Empirically, firefly descent achieves promising results on both neural architecture search and continual learning. In particular, on a challenging continual image classification task, it learns networks that are smaller in size but have higher average accuracy than those learned by the state-of-the-art methods.

研究动机与目标

  • 为以动态、渐进方式联合优化神经网络参数与架构提供解决方案。
  • 克服启发式或随机网络增长方法无法保证性能提升的局限性。
  • 开发一种通用、灵活的框架,支持神经网络的宽度与深度扩展。
  • 通过原则化的网络增长,防止灾难性遗忘,实现有效的持续学习。
  • 提供一种可扩展、高效的替代方案,以替代基于二阶或组合搜索的神经架构搜索方法。

提出的方法

  • 该方法将网络增长建模为在函数邻域 $\partial(f_t, \epsilon)$ 上的最速下降优化,其中 $f_{t+1}$ 是在复杂度约束下使损失最小的邻域内最佳网络。
  • 当 $\epsilon$ 较小时,利用泰勒近似将组合优化问题简化为贪心选择过程,从而实现高效计算。
  • 通过统一的、可微分的函数扰动搜索空间,同时支持网络加宽(添加神经元)与加深(添加层)。
  • 在持续学习中,通过扩展功能等价但更大的架构来增长网络,以保留先前知识并减少遗忘。
  • 该方法通过广义分裂最速下降,允许超出神经元分裂的任意结构变化,包括新增层与神经元。
  • 其作为可微分的迭代过程实现,可应用于标准神经网络组件及基于单元的神经架构搜索(如 DARTS)。

实验结果

研究问题

  • RQ1能否设计一种基于梯度类下降的方法,以联合优化架构与参数的方式动态增长神经网络?
  • RQ2如何使网络增长足够灵活,以在统一框架中同时支持加宽与加深?
  • RQ3该方法能否通过减少灾难性遗忘,在持续学习中超越启发式或随机搜索策略?
  • RQ4与最先进方法相比,该方法在实现高准确率的同时,能否以更小、更高效的模型实现?
  • RQ5泰勒近似如何实现复杂架构搜索空间中的高效、贪心选择?

主要发现

  • 在具有挑战性的持续图像分类任务(20类分割CIFAR-100)中,Firefly 学习到的模型体积更小,但平均准确率高于最先进方法。
  • Firefly 在 CIFAR-100 上实现了 91.03% 的准确率,最终网络仅含 80 个参数,优于 Learn-to-Grow 和 Compact-Pick-Grow 等方法。
  • 该方法通过动态增长功能等价但更大的网络,有效保留先前知识,从而减少灾难性遗忘。
  • 在神经架构搜索中,Firefly 在基于 DARTS 的模型中成功优化了单元结构,证明了其在持续学习之外的通用性。
  • 通过泰勒展开近似函数邻域,该框架实现了高效、贪心的网络增长,避免了昂贵的二阶计算。
  • 实验结果表明,Firefly 在准确率与模型效率方面,始终优于基于启发式的增长方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。