Skip to main content
QUICK REVIEW

[论文解读] Prior-Guided One-shot Neural Architecture Search

Peijie Dong, Xin Niu|arXiv (Cornell University)|Jun 27, 2022
Human Pose and Action Recognition被引用 11
一句话总结

该论文提出了一种先验引导的一次性神经架构搜索方法(PGONAS),通过使用更平滑的激活函数、基于夹心法则的平衡采样策略,以及结合FLOPs和Zen-Score的先验引导正则化,提升了一次性NAS中的排名一致性。该方法在CVPR 2022 NAS Challenge超网络赛道中取得了83.20的皮尔逊相关系数,排名第三。

ABSTRACT

Neural architecture search methods seek optimal candidates with efficient weight-sharing supernet training. However, recent studies indicate poor ranking consistency about the performance between stand-alone architectures and shared-weight networks. In this paper, we present Prior-Guided One-shot NAS (PGONAS) to strengthen the ranking correlation of supernets. Specifically, we first explore the effect of activation functions and propose a balanced sampling strategy based on the Sandwich Rule to alleviate weight coupling in the supernet. Then, FLOPs and Zen-Score are adopted to guide the training of supernet with ranking correlation loss. Our PGONAS ranks 3rd place in the supernet Track Track of CVPR2022 Second lightweight NAS challenge. Code is available in https://github.com/pprp/CVPR2022-NAS?competition-Track1-3th-solution.

研究动机与目标

  • 为解决一次性NAS中超网络与独立模型之间排名相关性弱的问题,该问题阻碍了性能的准确估计。
  • 通过改进采样策略和激活函数设计,减少权重耦合,提升超网络训练的稳定性。
  • 通过在损失函数中引入无需训练的度量指标(如FLOPs和Zen-Score)作为先验,提升性能预测的准确性。
  • 在无需大量重训练或额外监督的情况下,实现一次性NAS中的最先进排名一致性。

提出的方法

  • 用Mish和PReLU等更平滑的激活函数替代ReLU,以改善通道间信息流动并提升排名可预测性。
  • 提出一种基于夹心法则的平衡采样策略,通过采样最大、中间和最小架构来稳定训练并减少干扰。
  • 引入一种排名损失,使超网络的性能排名与无需训练的代理度量(如FLOPs和Zen-Score)保持一致。
  • 采用损失系数的预热调度策略,逐步增加正则化强度,避免训练不稳定。
  • 通过架构距离和损失加权精细调节正则化效果,提升在多样化架构上的泛化能力。
  • 将基于先验的正则化与超网络训练相结合,增强超网络预测与实际独立模型准确率之间的相关性。

实验结果

研究问题

  • RQ1不同的激活函数如何影响权重共享超网络中子网络的排名一致性?
  • RQ2基于夹心法则的平衡采样策略能否提升超网络训练的稳定性并减少权重耦合?
  • RQ3无需训练的度量指标(如FLOPs和Zen-Score)在多大程度上可作为有效先验,用于指导超网络训练并改善性能排名?
  • RQ4在先验引导的超网络训练中,正则化损失系数的最佳调度策略是什么?
  • RQ5结合多个先验(如FLOPs和Zen-Score)是否比使用单一先验带来更好的排名一致性?

主要发现

  • 使用Mish激活函数实现了最高的排名相关系数81.56,显著优于ReLU(78.20),证明了更平滑非线性激活的优势。
  • 基于夹心法则的平衡采样策略达到了81.63的皮尔逊相关系数,优于均匀采样(72.49)和渐进缩小策略(69.03)。
  • 损失系数的预热调度策略表现最佳,相关系数达83.20,优于恒定、余弦和多阶段调度策略。
  • FLOPs引导的排名损失达到83.20的相关系数,略高于Zen-Score引导的损失(83.00),表明FLOPs作为先验更具有效性。
  • 在无先验引导的情况下,最佳相关系数为80.65;加入FLOPs或Zen-Score先验后,相关系数分别提升至83.20和83.00,证明了基于先验正则化的有效性。
  • 可视化结果显示,FLOPs与Zen-Score具有高度相关性(95.97),但分布模式不同,Zen-Score呈现丝带状集中分布,可能限制其泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。