Skip to main content
QUICK REVIEW

[论文解读] Rethinking Performance Estimation in Neural Architecture Search

Xiawu Zheng, Rongrong Ji|arXiv (Cornell University)|May 20, 2020
Advanced Neural Network Applications参考文献 49被引用 4
一句话总结

本文提出预算性能估计(BPE)与最小重要性剪枝(MIP),通过系统性地识别并优先处理性能估计中最具影响力的超参数,以加速神经架构搜索(NAS)。通过随机森林对超参数重要性进行排序,并迭代剪除影响最小的参数,MIP 在保持精度损失可忽略的前提下,使 NAS 的速度最高提升 1,000 倍,从而实现对强化学习、进化策略、随机搜索及可微 NAS 方法的高效搜索。

ABSTRACT

Neural architecture search (NAS) remains a challenging problem, which is attributed to the indispensable and time-consuming component of performance estimation (PE). In this paper, we provide a novel yet systematic rethinking of PE in a resource constrained regime, termed budgeted PE (BPE), which precisely and effectively estimates the performance of an architecture sampled from an architecture space. Since searching an optimal BPE is extremely time-consuming as it requires to train a large number of networks for evaluation, we propose a Minimum Importance Pruning (MIP) approach. Given a dataset and a BPE search space, MIP estimates the importance of hyper-parameters using random forest and subsequently prunes the minimum one from the next iteration. In this way, MIP effectively prunes less important hyper-parameters to allocate more computational resource on more important ones, thus achieving an effective exploration. By combining BPE with various search algorithms including reinforcement learning, evolution algorithm, random search, and differentiable architecture search, we achieve 1, 000x of NAS speed up with a negligible performance drop comparing to the SOTA

研究动机与目标

  • 解决 NAS 中的主要瓶颈——在资源受限条件下性能估计(PE)耗时过长的问题。
  • 开发一种系统化框架,以识别性能估计中最具影响力的超参数,从而实现高效且准确的架构搜索。
  • 通过聚焦于最具影响力的超参数,降低 NAS 中的计算成本,同时不牺牲搜索质量。
  • 提供一种统一且可泛化的解决方案,兼容多种搜索策略,包括强化学习、进化策略、随机搜索及可微 NAS。

提出的方法

  • 提出预算性能估计(BPE)作为系统化框架,用于控制学习率、批量大小、训练轮数和图像尺寸等训练超参数,以高效估计神经架构的相对性能。
  • 引入最小重要性剪枝(MIP),利用随机森林回归基于采样配置下的性能评估结果,估计每个超参数的重要性。
  • 在每次迭代中,MIP 剪除估计重要性最低的超参数,从而缩小搜索空间,并将计算资源重新分配给更具影响力的参数。
  • MIP 过程通过迭代减少 BPE 中的超参数数量,集中计算资源于最具影响力的参数,以提升估计效率。
  • 在采样配置及其性能的数据集上训练随机森林预测器,以预测优化后 BPE 下架构的相对排名。
  • 将学习得到的 MIP-BPE 框架应用于多种 NAS 算法,包括强化学习、进化策略、随机搜索及 DARTS,均实现一致的速度提升。

实验结果

研究问题

  • RQ1在严格的计算预算下,如何系统性地优化 NAS 中的性能估计?
  • RQ2在训练过程中,哪些超参数对性能估计中神经架构的相对排名影响最大?
  • RQ3基于超参数重要性的动态剪枝策略是否能在不降低最终模型精度的前提下提升 NAS 的效率?
  • RQ4为何一次性 NAS 方法(如 DARTS)在不同随机种子下表现出高度不稳定性,尽管其全局性能估计表现较差?
  • RQ5所学习的 BPE 配置在多大程度上可泛化至不同搜索算法和数据集?

主要发现

  • 所提出的 MIP-BPE 框架在多种算法(包括强化学习、进化策略、随机搜索及可微搜索)中实现最高达 1,000 倍的 NAS 速度提升,且性能损失可忽略不计。
  • 相对性能排名(rs)与所提目标函数之间的相关性达到 0.65,证实 MIP-BPE 在保持准确的架构相对排名方面具有有效性。
  • 两个最关键的超参数——训练轮数和网络层数——显示出高重要性与陡峭的性能曲线,表明在小范围内微调这些参数即可实现向新数据集的有效迁移。
  • 一次性方法(如 DARTS)表现出较差的全局性能估计(全局 rs 值低),但具有较高的局部 rs 值,表明其依赖于局部优化动态而非全局精度预测。
  • 研究表明,性能估计排名在训练条件发生微小变化时可能发生剧烈变化,凸显了现有代理度量的不稳定性,也凸显了构建鲁棒 BPE 的必要性。
  • 该框架具有良好的泛化能力:一旦在某一数据集上学习到 BPE 配置,即可在其他数据集上有效迁移,尤其在聚焦于训练轮数和层数时,仅需极少再训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。