Skip to main content
QUICK REVIEW

[论文解读] A Surgery of the Neural Architecture Evaluators

Xuefei Ning, Wenshuo Li|arXiv (Cornell University)|May 4, 2021
Adversarial Robustness in Machine Learning参考文献 13被引用 8
一句话总结

本文对 NAS-Bench-201 搜索空间中的参数共享和基于预测器的神经架构评估器进行了全面分析,揭示了训练阶段和配置如何影响评估准确率。研究发现高性能架构在适应度相关性方面存在关键缺陷,并提出了可操作的见解与设计原则,以提升评估器的可靠性并指导未来的 NAS 研究。

ABSTRACT

Neural architecture search (NAS) has recently received extensive attention due to its effectiveness in automatically designing effective neural architectures. A major challenge in NAS is to conduct a fast and accurate evaluation of neural architectures. Commonly used fast architecture evaluators include parameter-sharing ones and predictor-based ones. Despite their high evaluation efficiency, the evaluation correlation (especially of the well-performing architectures) is still questionable. In this paper, we conduct an extensive assessment of both the parameter-sharing and predictor-based evaluators on the NAS-Bench-201 search space, and break up how and why different configurations and strategies influence the fitness of the evaluators. Specifically, we carefully develop a set of NAS-oriented criteria to understand the behavior of fast architecture evaluators in different training stages. And based on the findings of our experiments, we give pieces of knowledge and suggestions to guide NAS application and motivate further research.

研究动机与目标

  • 评估快速神经架构评估器(特别是参数共享和基于预测器的方法)在不同训练阶段的可靠性和准确性。
  • 识别架构配置和训练策略如何影响神经架构搜索(NAS)中评估器的性能。
  • 制定面向 NAS 的评估标准,以捕捉评估器在训练过程中的行为特征。
  • 为提升评估器保真度和推动 NAS 方法学发展,提供可操作的知识与设计指南。

提出的方法

  • 作者在 NAS-Bench-201 搜索空间上进行了大量实验,评估了不同训练阶段下参数共享和基于预测器的评估器。
  • 他们引入了一套 NAS 专用标准,用于分析评估器行为,重点关注其与真实验证准确率的相关性。
  • 评估框架系统性地比较了不同配置的评估器,包括不同的训练调度、模型深度和预测器架构。
  • 他们分析了评估器预测与实际架构性能之间的适应度相关性,尤其关注表现优异的架构。
  • 研究通过消融实验隔离了特定设计选择对评估器性能的影响。
  • 研究结果被综合为对 NAS 实践者和未来评估器设计的可操作建议。

实验结果

研究问题

  • RQ1在 NAS 的不同训练阶段,快速架构评估器的适应度相关性如何变化?
  • RQ2哪些特定配置和策略会降低或提升评估器的准确性,尤其是对高性能架构而言?
  • RQ3在 NAS-Bench-201 基准中,参数共享和基于预测器的评估器在多大程度上与真实验证准确率保持一致?
  • RQ4评估器中的架构选择(如深度、宽度、训练调度)如何影响其预测可靠性?
  • RQ5可以推导出哪些设计原则以提升神经架构评估器的保真度?

主要发现

  • 对于高性能架构,参数共享评估器与真实验证准确率的相关性显著较低,尤其是在训练过早截断时。
  • 基于预测器的评估器相关性优于参数共享评估器,但在接近帕累托前沿的架构上仍存在较差的泛化能力。
  • 评估器中训练调度和模型深度的选择对其准确排名架构的能力有显著影响。
  • 在较小或较浅的模型上训练的评估器,往往无法泛化到搜索空间中更深或更复杂的架构。
  • 研究发现,评估器中的过早停止和次优超参数选择会导致性能排名产生误导。
  • 研究结果表明,当前的快速评估器在识别最佳架构方面不可靠,亟需改进训练和设计策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。