Skip to main content
QUICK REVIEW

[论文解读] Steepest Descent Neural Architecture Optimization: Escaping Local Optimum with Signed Neural Splitting

Lemeng Wu, Mao Ye|arXiv (Cornell University)|Mar 23, 2020
Neural Networks and Applications参考文献 34被引用 5
一句话总结

本文提出了一种新型神经网络架构优化方法——有符号分裂最速下降法(S3D),该方法在分裂最速下降(S2D)框架的基础上,允许神经元被分裂为带有正负权重的多个副本。通过消除由正定分裂矩阵引起的‘分裂稳定’条件,S3D成功摆脱局部最优解,在CIFAR-100、ImageNet和ModelNet40上实现了更优性能,所学习到的网络更小、更准确且能效更高,优于S2D及其他先前方法。

ABSTRACT

Developing efficient and principled neural architecture optimization methods is a critical challenge of modern deep learning. Recently, Liu et al.[19] proposed a splitting steepest descent (S2D) method that jointly optimizes the neural parameters and architectures based on progressively growing network structures by splitting neurons into multiple copies in a steepest descent fashion. However, S2D suffers from a local optimality issue when all the neurons become "splitting stable", a concept akin to local stability in parametric optimization. In this work, we develop a significant and surprising extension of the splitting descent framework that addresses the local optimality issue. The idea is to observe that the original S2D is unnecessarily restricted to splitting neurons into positive weighted copies. By simply allowing both positive and negative weights during splitting, we can eliminate the appearance of splitting stability in S2D and hence escape the local optima to obtain better performance. By incorporating signed splittings, we significantly extend the optimization power of splitting steepest descent both theoretically and empirically. We verify our method on various challenging benchmarks such as CIFAR-100, ImageNet and ModelNet40, on which we outperform S2D and other advanced methods on learning accurate and energy-efficient neural networks.

研究动机与目标

  • 为解决分裂最速下降(S2D)中的局部最优问题,即由于正定分裂矩阵导致的‘分裂稳定’神经元使优化停滞。
  • 开发一种系统性方法,通过将分裂扩展至包含负权重,突破S2D的限制,实现损失的持续下降。
  • 建立更强的理论收敛保证,并提升在学习紧凑、准确且能效更高的神经网络方面的实际性能。
  • 在CIFAR-100、ImageNet和ModelNet40等多样化基准上,验证有符号分裂(特别是三元组和四元组分裂)的有效性。

提出的方法

  • 提出有符号分裂最速下降(S3D),通过允许神经元分裂为带有正负权重的多个副本,对S2D进行推广。
  • 利用分裂矩阵的最小和最大特征值推导最优分裂规则,即使在分裂矩阵为正定时也能实现损失下降。
  • 采用基于0-1背包问题的建模方法,在总参数量或FLOPs约束下,为每个神经元选择最优分裂方案(二元、三元组、四元组)。
  • 使用瑞利商梯度下降法并结合自动微分,高效计算分裂矩阵的最小和最大特征值,无需显式构造矩阵。
  • 对0-1背包问题应用凸松弛,实现跨神经元分裂配置的可微分、可扩展选择。
  • 在交替优化框架中,结合参数梯度更新与通过有符号分裂实现的架构下降。

实验结果

研究问题

  • RQ1在神经元分裂过程中允许负权重,是否能够消除S2D中因‘分裂稳定’条件导致的局部最优问题?
  • RQ2有符号分裂是否能带来更强的理论收敛保证,并提升神经架构搜索中的实际性能?
  • RQ3使用带正负号的三元组和四元组分裂,是否能实现比仅使用正权重的二元分裂更高的模型准确率与效率?
  • RQ4在CIFAR-100、ImageNet和ModelNet40等挑战性基准上,S3D与S2D及其他先进方法相比,在准确率、参数量和FLOPs方面表现如何?
  • RQ5可微分的0-1背包建模是否能有效平衡网络规模与损失下降?

主要发现

  • 在仅使用0.30M参数和73.69M FLOPs的约束下,S3D在CIFAR-100上达到70.19%的top-1准确率,显著优于S2D-5(69.69%)。
  • 采用基于0-1背包的分裂策略后,S3D在72.19M FLOPs下实现70.01%的准确率,计算成本略有降低,同时保持高性能。
  • 通过允许负权重,S3D消除了分裂稳定性问题,即使分裂矩阵为正定,也能持续实现损失下降。
  • 在CIFAR-100、ImageNet和ModelNet40上,S3D显著优于S2D及其他先进方法,能够学习到更小、更准确且更节能的神经网络。
  • 理论分析表明,S3D收敛至更强的最优性概念:除非所有分裂矩阵均为零,否则损失下降始终可能。
  • 实证结果证实,有符号分裂(特别是正负二元分裂的组合)在实践中极为有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。