[论文解读] How Powerful are Performance Predictors in Neural Architecture Search?
本文首次对神经架构搜索(NAS)中的31种性能预测器进行了大规模对比研究,评估了基于模型、学习曲线外推、零样本代价和权重共享方法在四个搜索空间及多个数据集上的表现。研究发现,不同家族的预测器具有互补性,组合使用可显著提升预测性能,为在不同计算资源约束下进行NAS提供了实用建议。
Early methods in the rapidly developing field of neural architecture search (NAS) required fully training thousands of neural networks. To reduce this extreme computational cost, dozens of techniques have since been proposed to predict the final performance of neural architectures. Despite the success of such performance prediction methods, it is not well-understood how different families of techniques compare to one another, due to the lack of an agreed-upon evaluation metric and optimization for different constraints on the initialization time and query time. In this work, we give the first large-scale study of performance predictors by analyzing 31 techniques ranging from learning curve extrapolation, to weight-sharing, to supervised learning, to "zero-cost" proxies. We test a number of correlation- and rank-based performance measures in a variety of settings, as well as the ability of each technique to speed up predictor-based NAS frameworks. Our results act as recommendations for the best predictors to use in different settings, and we show that certain families of predictors can be combined to achieve even better predictive power, opening up promising research directions. Our code, featuring a library of 31 performance predictors, is available at https://github.com/automl/naslib.
研究动机与目标
- 在不同初始化和查询时间约束下,比较各类NAS性能预测器家族的性能表现。
- 评估预测器在NAS-Bench-201、NAS-Bench-101、DARTS和NAS-Bench-NLP等多个搜索空间与数据集上的表现一致性与可靠性。
- 评估各类预测器在加速基于预测器的NAS框架(如贝叶斯优化和进化策略)方面的有效性。
- 确定组合不同家族的预测器是否能实现优于单一方法的预测性能。
- 为未来NAS性能预测研究提供可复现的基准和开源库。
提出的方法
- 本研究在四个搜索空间(NAS-Bench-201、NAS-Bench-101、DARTS和NAS-Bench-NLP)上评估了31种性能预测器,使用CIFAR-10、CIFAR-100、ImageNet16-120和Penn TreeBank数据集。
- 通过皮尔逊相关系数、斯皮尔曼等级相关系数、肯德尔tau相关系数和稀疏肯德尔tau相关系数,在随机和基于变异的架构集合上衡量性能表现。
- 采用标准化实验协议,包括超参数调优和原始实现复用,以确保不同方法之间的公平比较。
- 在不同初始化时间和查询时间预算下评估预测器,以分析设置成本与推理速度之间的权衡。
- 将预测器集成到贝叶斯优化和预测器引导的进化工作流中,以测试其在真实场景中的加速潜力。
- 通过NASLib发布了一个包含31种预测器的全面开源库,以支持可复现性与未来基准测试。
实验结果
研究问题
- RQ1在不同计算资源约束下,零样本代价、基于模型、学习曲线外推和权重共享预测器在预测准确率方面如何比较?
- RQ2哪些性能预测器在不同搜索空间和数据集上表现出一致的性能?
- RQ3组合不同家族的预测器是否能显著提升预测能力,优于单一方法?
- RQ4这些预测器在加速真实NAS框架(如贝叶斯优化和进化策略)方面的有效性如何?
- RQ5在标准化评估条件下,性能预测器的已发表结果在多大程度上可被复现?
主要发现
- 本研究证明,来自不同家族的性能预测器(如零样本代价、基于模型、学习曲线外推方法)具有互补优势,组合使用可实现显著高于任一单一方法的预测性能。
- 零样本代价代理(特别是基于梯度和激活统计量的,如SNIP、Grad Norm、Fisher)在极低查询时间下表现优异,适用于低延迟场景。
- 基于模型的预测器(如MLP和LGBoost)在具备足够初始化时间时可实现高等级相关性(如斯皮尔曼相关系数>0.7),表现出色。
- 学习曲线外推方法(如LcSVR、SoTL)在获得适度训练时间后可实现高相关性(斯皮尔曼相关系数>0.93),表现出强预测能力且初始化成本低。
- 作者成功复现了31种预测器中15种的已发表结果,等级相关系数差异小于0.04,验证了基准的可复现性。
- 组合来自不同家族的顶尖预测器可带来显著的性能提升,表明这是未来NAS框架研究的有前景方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。