Skip to main content
QUICK REVIEW

[论文解读] Towards NNGP-guided Neural Architecture Search

Daniel Park, Jaehoon Lee|arXiv (Cornell University)|Nov 11, 2020
Advanced Neural Network Applications参考文献 61被引用 14
一句话总结

本文提出使用神经网络高斯过程(NNGP)推理作为神经架构搜索(NAS)中预测神经网络性能的计算高效代理方法。通过在初始化时使用蒙特卡洛估计计算NNGP验证准确率,该方法相比缩短训练可实现高达10倍的加速,从而实现有效的搜索空间剪枝,并结合混合指标在CIFAR-10和ImageNet基准上提升了预测准确性。

ABSTRACT

The predictions of wide Bayesian neural networks are described by a Gaussian process, known as the Neural Network Gaussian Process (NNGP). Analytic forms for NNGP kernels are known for many models, but computing the exact kernel for convolutional architectures is prohibitively expensive. One can obtain effective approximations of these kernels through Monte-Carlo estimation using finite networks at initialization. Monte-Carlo NNGP inference is orders-of-magnitude cheaper in FLOPs compared to gradient descent training when the dataset size is small. Since NNGP inference provides a cheap measure of performance of a network architecture, we investigate its potential as a signal for neural architecture search (NAS). We compute the NNGP performance of approximately 423k networks in the NAS-bench 101 dataset on CIFAR-10 and compare its utility against conventional performance measures obtained by shortened gradient-based training. We carry out a similar analysis on 10k randomly sampled networks in the mobile neural architecture search (MNAS) space for ImageNet. We discover comparative advantages of NNGP-based metrics, and discuss potential applications. In particular, we propose that NNGP performance is an inexpensive signal independent of metrics obtained from training that can either be used for reducing big search spaces, or improving training-based performance measures.

研究动机与目标

  • 评估基于NNGP的性能预测是否可作为NAS中最终训练网络性能的低成本、高精度代理。
  • 比较NNGP推理与传统缩短训练指标在计算成本和预测效用方面的表现。
  • 探究NNGP作为信号在减少大规模搜索空间或增强基于训练的性能指标方面的潜力。
  • 展示结合NNGP与基于训练的指标以提升NAS效率与准确性的可行性与优势。

提出的方法

  • 通过在初始化时使用有限宽度网络进行蒙特卡洛估计来计算NNGP核,避免昂贵的精确核计算。
  • 将所得的NNGP验证准确率用作每种架构的性能代理,无需任何基于梯度的训练。
  • 应用基于NNGP的排序对大规模搜索空间进行剪枝,如NAS-Bench-101和MNAS,从而减少需训练的架构数量。
  • 使用线性模型将NNGP性能与早期训练指标(如4轮次准确率)结合,构建混合性能预测器。
  • 在NAS-Bench-101(CIFAR-10)的42.3万个架构和MNAS(ImageNet)的1万个采样网络上评估NNGP和混合指标的预测质量。
  • 通过统计分析和性能比较,评估NNGP与最终训练性能之间的相关性。

实验结果

研究问题

  • RQ1NNGP推理能否为NAS中的最终神经网络性能提供可靠且计算高效的代理?
  • RQ2与缩短训练指标相比,基于NNGP的性能预测在预测准确性和计算成本方面表现如何?
  • RQ3在不牺牲最终性能的前提下,NNGP性能在多大程度上可用于减少大规模神经架构搜索空间的规模?
  • RQ4结合NNGP与早期训练指标是否能生成一种混合性能指标,其表现优于仅使用训练指标?

主要发现

  • NNGP推理的计算成本比缩短训练低一个数量级以上,尤其在小数据集上FLOP计数显著更低。
  • 在NAS-Bench-101上,NNGP性能与最终训练性能高度相关,在搜索空间减少至10%和30%时,相较于随机选择,top-10性能分别提升9.49%和9.12%。
  • 通过NNGP筛选将搜索空间缩减至30%时,性能质量得以保持,同时显著降低计算成本,而随机剪枝则导致性能下降。
  • 将4轮次训练准确率与NNGP准确率结合的混合指标优于单独使用4轮次训练,且计算成本仅略有增加。
  • 即使在MNAS等大规模复杂搜索空间中,基于NNGP的筛选依然有效,尽管ImageNet任务更具挑战性,NNGP仍保持了良好的预测能力。
  • 本研究证明,NNGP性能是一种有效且独立的信号,可作为NAS流程中基于训练指标的补充或替代。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。