Skip to main content
QUICK REVIEW

[论文解读] Bag of Tricks for Neural Architecture Search

Thomas Elsken, Benedikt Staffler|arXiv (Cornell University)|Jul 8, 2021
Advanced Neural Network Applications参考文献 57被引用 4
一句话总结

本文提出了一套全面的实用技术——如权重热身、归一化层调整、正则化和代理训练——以提升神经架构搜索(NAS)方法的稳定性、效率和最终性能。作者证明,这些‘实用技巧’显著增强了搜索的可靠性与准确性,通常优于随机搜索,并降低了对超参数的敏感性。

ABSTRACT

While neural architecture search methods have been successful in previous years and led to new state-of-the-art performance on various problems, they have also been criticized for being unstable, being highly sensitive with respect to their hyperparameters, and often not performing better than random search. To shed some light on this issue, we discuss some practical considerations that help improve the stability, efficiency and overall performance.

研究动机与目标

  • 解决神经架构搜索(NAS)方法中普遍报告的不稳定性和超参数敏感性问题。
  • 通过识别并分享广泛使用但常被隐藏的实用技术,提升NAS的可靠性和可复现性。
  • 通过架构选择和训练流程优化,增强代理任务与真实评估之间的相关性,缩小性能差距。
  • 证明训练流程选择(例如数据增强、正则化)对最终准确率的影响,可能超过架构设计本身。

提出的方法

  • 在更新架构参数之前,先对网络权重进行显著比例的训练时间,实现权重热身,防止过早收敛。
  • 在架构搜索过程中禁用归一化层(如批量归一化)中的可学习参数,以避免架构权重更新的不稳定。
  • 应用强正则化技术,如丢弃路径(drop path)、权重衰减和数据增强,以平滑损失曲面并提升搜索稳定性。
  • 使用低保真代理任务(如更小的数据集、更少的训练轮次、更浅的模型深度)来加速NAS,同时保持与全精度性能的相关性。
  • 在多组件架构(如语义分割、目标检测)中缓存固定主干网络的特征,以加快搜索过程中的评估速度。
  • 使用性能感知方法从连续松弛中提取最终离散架构,例如通过最小化操作移除后的准确率下降,而非简单选择最大权重操作。

实验结果

研究问题

  • RQ1在实践中,如何缓解基于梯度的NAS方法的不稳定性与超参数敏感性?
  • RQ2正则化与归一化技术在多大程度上影响架构搜索的可靠性?
  • RQ3代理训练任务与全精度评估在所搜索架构的排名一致性方面有何差异?
  • RQ4与架构选择相比,训练流程因素(如数据增强、学习率调度)在最终模型性能中扮演何种角色?
  • RQ5通过使用微调权重或子一阶段模型重新评估候选架构,能否提升架构性能?

主要发现

  • 权重热身显著提升了搜索稳定性,防止训练速度较快的架构(如包含大量跳跃连接的架构)在搜索中占据主导地位。
  • 批量归一化在NAS中通常具有破坏性,应禁用或替换为同步归一化或组归一化等替代方案,以提升训练稳定性。
  • 更强的正则化(如丢弃路径和数据增强)可平滑损失曲面,提升搜索收敛性与性能。
  • 训练流程(包括数据增强和学习率调度)对最终准确率的影响可能超过架构设计本身,当训练流程不匹配时,性能差异可达3.2%。
  • 当使用相同的最先进训练流程时,MobileNetV3相较于MobileNetV2的准确率提升从3.2%降至2.0%,凸显了公平比较的重要性。
  • 使用子一阶段模型缓解共适应问题,可提升一阶段模型排名与最终微调架构性能之间的相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。