[论文解读] NAS-Bench-Suite: NAS Evaluation is (Now) Surprisingly Easy
本文提出了 NAS-Bench-Suite,一个统一且可扩展的基准测试套件,将25种不同的神经架构搜索(NAS)搜索空间和数据集整合到单一接口中,实现了快速、可复现且可泛化的神经架构搜索研究。其核心贡献在于揭示了NAS算法与超参数在不同基准之间不具备泛化能力,强调需在更广泛的评估范围内进行实验,以避免因数据集有限而导致的误导性结论。
The release of tabular benchmarks, such as NAS-Bench-101 and NAS-Bench-201, has significantly lowered the computational overhead for conducting scientific research in neural architecture search (NAS). Although they have been widely adopted and used to tune real-world NAS algorithms, these benchmarks are limited to small search spaces and focus solely on image classification. Recently, several new NAS benchmarks have been introduced that cover significantly larger search spaces over a wide range of tasks, including object detection, speech recognition, and natural language processing. However, substantial differences among these NAS benchmarks have so far prevented their widespread adoption, limiting researchers to using just a few benchmarks. In this work, we present an in-depth analysis of popular NAS algorithms and performance prediction methods across 25 different combinations of search spaces and datasets, finding that many conclusions drawn from a few NAS benchmarks do not generalize to other benchmarks. To help remedy this problem, we introduce NAS-Bench-Suite, a comprehensive and extensible collection of NAS benchmarks, accessible through a unified interface, created with the aim to facilitate reproducible, generalizable, and rapid NAS research. Our code is available at https://github.com/automl/naslib.
研究动机与目标
- 为解决现有NAS基准之间缺乏一致性和互操作性的问题,以促进可泛化的研究。
- 探究在少数基准上训练的NAS算法与超参数是否能泛化到其他搜索空间和任务。
- 提供一个统一且可扩展的接口,实现在多样化数据集和架构上对NAS方法的快速、可复现评估。
- 识别并纠正NAS社区中关于算法鲁棒性与超参数可迁移性的常见误解。
- 通过在广泛的问题类型和搜索空间特征上进行综合评估,推动实验严谨性。
提出的方法
- 作者将几乎所有公开可查询的NAS基准整合到一个统一的API中,支持表格型、代理型和真实NAS基准。
- 通过使用NetworkX进行图结构表示,并实现get_dataset_api函数以访问预计算的基准数据,构建了标准化接口。
- 在25种不同的搜索空间与数据集组合上评估NAS算法和性能预测器,涵盖图像分类、自然语言处理、语音识别和目标检测等任务。
- 在每个基准上独立进行超参数优化(HPO),并系统性地测试最优超参数在不同基准间的可迁移性。
- 统计分析包括搜索空间属性(如大小、邻域大小)与算法性能排名之间的Kendall Tau等级相关性。
- 该框架支持真实与代理型基准,使对高达10^18个架构的搜索空间的评估成为可能。
实验结果
研究问题
- RQ1在NAS-Bench-101和NAS-Bench-201上表现良好的NAS算法是否能泛化到其他搜索空间和数据集?
- RQ2NAS方法的最优超参数是否可在不同搜索空间之间迁移,还是高度依赖于特定基准?
- RQ3搜索空间特征(如大小和邻域大小)与不同NAS算法及性能预测器的性能之间存在何种相关性?
- RQ4当在多样化基准上评估时,NAS研究中隐含的假设(如算法鲁棒性)在多大程度上会失效?
- RQ5统一的基准测试套件在在多大程度上能显著提升NAS研究的可复现性与可泛化性?
主要发现
- 许多在NAS-Bench-101和NAS-Bench-201上表现良好的NAS算法在其他基准上无法泛化,表明基于少数基准的结论不具备普遍性。
- NAS方法的最佳超参数高度依赖于具体搜索空间,跨基准迁移调优后的超参数常导致性能显著下降。
- 性能预测器(如XGBoost和随机森林RF)与搜索空间大小和邻域大小表现出强相关性,其中XGBoost在超参数调优后与搜索空间大小的Kendall Tau相关系数达到-0.51。
- BOHAMIANN在未调优时于大邻域大小下表现相对更优(相关系数0.35),而在调优后于小邻域大小下表现更优(相关系数0.37),凸显了其超参数的复杂依赖性。
- 局部搜索与正则化进化算法在小搜索空间及邻域大小较小的场景下表现显著更优,正则化进化算法的性能排名与邻域大小之间的相关系数为-0.51。
- 搜索空间中操作数与准确率四分位距之间存在严格的负相关性,表明更大的搜索空间能产生更一致的性能分布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。