Skip to main content
QUICK REVIEW

[论文解读] Neural Architecture Generator Optimization

Binxin Ru, Pedro M. Esperança|arXiv (Cornell University)|Apr 3, 2020
Machine Learning and Data Classification参考文献 65被引用 17
一句话总结

本文提出神经架构生成器优化(NAGO),一种新颖的神经架构搜索(NAS)框架,其重点从优化单个架构转向优化一个随机网络生成器。通过使用具有连续超参数的分层图搜索空间,NAGO 实现了高效的贝叶斯优化,在六个基准测试中(包括 ImageNet)生成了轻量化且极具竞争力的模型,达到最先进性能。

ABSTRACT

Neural Architecture Search (NAS) was first proposed to achieve state-of-the-art performance through the discovery of new architecture patterns, without human intervention. An over-reliance on expert knowledge in the search space design has however led to increased performance (local optima) without significant architectural breakthroughs, thus preventing truly novel solutions from being reached. In this work we 1) are the first to investigate casting NAS as a problem of finding the optimal network generator and 2) we propose a new, hierarchical and graph-based search space capable of representing an extremely large variety of network types, yet only requiring few continuous hyper-parameters. This greatly reduces the dimensionality of the problem, enabling the effective use of Bayesian Optimisation as a search strategy. At the same time, we expand the range of valid architectures, motivating a multi-objective learning approach. We demonstrate the effectiveness of this strategy on six benchmark datasets and show that our search space generates extremely lightweight yet highly competitive models.

研究动机与目标

  • 为解决现有 NAS 方法依赖狭窄、专家设计的搜索空间所带来的局限性,避免陷入局部最优并促进架构创新。
  • 通过将 NAS 框架重构为生成器超参数优化问题,降低其维度,从而更有效地应用全局优化策略。
  • 设计一种高度表达性、分层的图结构搜索空间,能够以最少的连续超参数生成多样化架构。
  • 支持多目标与多保真度优化,实现高效架构发现,同时保持高性能。
  • 证明优化生成器而非单个架构,可生成新颖、轻量化且具有竞争力的模型。

提出的方法

  • 提出一种分层图结构搜索空间(HNAG),包含三个层级:顶层单元、中层单元结构和底层原子操作,每一层均由独立的图生成器控制。
  • 在顶层和底层图生成中采用 Watts-Strogatz 模型,其超参数为 $\bm{\theta}_{top} = [N_t, K_t, P_t]$ 和 $\bm{\theta}_{bottom} = [N_b, K_b, P_b]$,中层图生成采用 Erdős–Rényi 模型,其超参数为 $\bm{\theta}_{mid} = [N_m, P_m]$。
  • 将整个架构视为来自随机生成器的样本,使搜索过程聚焦于优化生成器超参数,而非单个架构。
  • 在多保真度与多目标设置下应用贝叶斯优化(BO),高效探索低维生成器空间。
  • 采用动态通道计算策略,保持固定参数预算,实现轻量化模型生成。
  • 使用 BOHB 与 MOBO 进行高效超参数搜索,在 CIFAR-10、CIFAR-100 和 ImageNet 上进行评估,且在资源受限条件下运行。

实验结果

研究问题

  • RQ1NAS 是否可被有效重构为生成器超参数优化问题,从而摆脱局部最优并发现新颖架构?
  • RQ2具有连续超参数的分层图结构搜索空间是否能显著降低 NAS 的维度,同时保持架构表达能力?
  • RQ3通过贝叶斯优化优化网络生成器,是否能生成在多种视觉基准测试中均轻量化且具有竞争力的模型?
  • RQ4与现有的单次训练和超网络(supernet-based)NAS 方法相比,所提出的 NAGO 框架在准确率与参数效率方面的性能如何?
  • RQ5生成器超参数在多大程度上能提供关于高性能架构全局结构特性的可解释性洞察?

主要发现

  • NAGO 在六个视觉基准测试中(包括 CIFAR-10、CIFAR-100 和 ImageNet)均达到最先进性能,优于现有 NAS 方法。
  • HNAG 搜索空间成功生成了大量多样化架构,涵盖多样的连接模式、内存占用与训练时间,包括类似 DARTS 的结构。
  • 在 ImageNet 上,HNAG-BOHB 方法在仅使用 10 次 BOHB 迭代且搜索预算有限的情况下,仍实现了优于 [14] 及其他基准的平均性能。
  • 该方法通过动态计算通道数,保持固定参数预算,从而生成高度高效且轻量化的模型。
  • 初始训练协议中未使用 DropPath 和辅助塔等技术,表明若采用优化后的训练协议,仍有进一步提升准确率的空间。
  • 该框架通过将生成器超参数与全局结构特性(如连接性与操作类型)关联,实现了对架构设计的可解释性、高层次洞察。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。