Skip to main content
QUICK REVIEW

[论文解读] NASI: Label- and Data-agnostic Neural Architecture Search at Initialization

Yao Shu, Shaofeng Cai|arXiv (Cornell University)|Sep 2, 2021
Advanced Neural Network Applications参考文献 49被引用 7
一句话总结

NASI 提出了一种无需标签和数据依赖的神经架构搜索方法,通过利用神经正切核(NTK)迹范数近似,在模型初始化阶段即可估计架构性能,从而完全跳过模型训练。该方法在 CIFAR-10/100 和 ImageNet 上实现了最先进的搜索效率,并展现出优异的泛化性能,即使在使用随机标签或数据时也具备良好的可迁移性。

ABSTRACT

Recent years have witnessed a surging interest in Neural Architecture Search (NAS). Various algorithms have been proposed to improve the search efficiency and effectiveness of NAS, i.e., to reduce the search cost and improve the generalization performance of the selected architectures, respectively. However, the search efficiency of these algorithms is severely limited by the need for model training during the search process. To overcome this limitation, we propose a novel NAS algorithm called NAS at Initialization (NASI) that exploits the capability of a Neural Tangent Kernel in being able to characterize the converged performance of candidate architectures at initialization, hence allowing model training to be completely avoided to boost the search efficiency. Besides the improved search efficiency, NASI also achieves competitive search effectiveness on various datasets like CIFAR-10/100 and ImageNet. Further, NASI is shown to be label- and data-agnostic under mild conditions, which guarantees the transferability of architectures selected by our NASI over different datasets.

研究动机与目标

  • 在神经架构搜索(NAS)过程中完全消除模型训练,以显著提升搜索效率。
  • 开发一种利用神经正切核(NTK)在模型初始化阶段估计神经架构性能的方法。
  • 确保所选架构在不同数据集、标签和数据分布下均具备良好的泛化能力。
  • 在温和条件下实现无需标签和数据依赖的 NAS,从而支持所搜索架构的可迁移性。
  • 提供一种高效、可微且可扩展的 NAS 框架,在避免昂贵训练的同时保持具有竞争力的性能。

提出的方法

  • 利用神经正切核(NTK)刻画无限宽深度神经网络在初始化阶段的性能,从而实现无需训练的性能估计。
  • 通过受梯度流启发的公式近似 NTK 的迹范数,具体包括样本梯度范数之和与小批量梯度范数之和。
  • 通过 Gumbel-Softmax 松弛化方法将离散的架构选择转化为连续可微的优化问题,从而将 NAS 重构成连续可微的优化问题。
  • 采用基于梯度的优化算法搜索高性能架构,全程无需任何模型训练。
  • 提出一种固定方法来确定约束 ν 和惩罚系数 μ,以平衡架构复杂度与优化性能。
  • 通过皮尔逊相关性分析,在多个搜索空间中验证了 NTK 迹范数近似的有效性,其与精确 NTK 值的相关性较高。

实验结果

研究问题

  • RQ1是否可以在完全不进行模型训练的情况下,在初始化阶段完成神经架构搜索?
  • RQ2是否可以利用神经正切核(NTK)迹范数在初始化阶段准确预测神经架构的性能?
  • RQ3NASI 是否实现了无需标签和数据依赖的搜索,从而在不同数据集和数据分布间具备可迁移性?
  • RQ4对 NTK 迹范数的近似如何影响搜索效率与有效性?
  • RQ5超参数 ν 和 μ 对最终所搜索架构的泛化性能有何影响?

主要发现

  • NASI 在所有对比的 NAS 算法中实现了最低的搜索成本,同时在 CIFAR-10/100 和 ImageNet 上保持了具有竞争力的性能。
  • 在 NAS-Bench-1Shot1 的三个搜索空间中,所提出的 NTK 迹范数近似与精确 NTK 迹范数之间的皮尔逊相关性均超过 0.85。
  • 样本梯度范数之和提供了最佳近似效果,在 S1 上相关性为 0.88,在 S2 上为 0.92,在 S3 上为 0.87。
  • 在不同小批量大小(b=8 至 b=128)下,搜索结果保持稳定,所有设置下的测试误差波动均在 ±0.3 以内,证实了近似的鲁棒性。
  • 最优约束 ν=100 时获得最低的测试误差,优于其他 ν 值,且 μ 对最终性能的影响小于 ν。
  • 即使在使用随机生成的标签或数据时,NASI 仍能在 CIFAR-10 上选择出高性能架构,证实了其无需标签和数据依赖的特性以及强大的可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。