[论文解读] Unifying and Boosting Gradient-Based Training-Free Neural Architecture Search
本文提出了一种梯度驱动的训练无关神经架构搜索(NAS)的统一理论分析,揭示了现有度量之间的关联,并实现了新型混合NAS(HNAS)框架的开发,该框架结合了训练无关的效率与基于训练的有效性。HNAS在保持低搜索成本的同时实现了最先进的搜索准确率,在多个基准测试中均优于纯训练无关和基于训练的NAS方法。
Neural architecture search (NAS) has gained immense popularity owing to its ability to automate neural architecture design. A number of training-free metrics are recently proposed to realize NAS without training, hence making NAS more scalable. Despite their competitive empirical performances, a unified theoretical understanding of these training-free metrics is lacking. As a consequence, (a) the relationships among these metrics are unclear, (b) there is no theoretical interpretation for their empirical performances, and (c) there may exist untapped potential in existing training-free NAS, which probably can be unveiled through a unified theoretical understanding. To this end, this paper presents a unified theoretical analysis of gradient-based training-free NAS, which allows us to (a) theoretically study their relationships, (b) theoretically guarantee their generalization performances, and (c) exploit our unified theoretical understanding to develop a novel framework named hybrid NAS (HNAS) which consistently boosts training-free NAS in a principled way. Remarkably, HNAS can enjoy the advantages of both training-free (i.e., the superior search efficiency) and training-based (i.e., the remarkable search effectiveness) NAS, which we have demonstrated through extensive experiments.
研究动机与目标
- 建立梯度驱动的训练无关NAS度量的统一理论理解,因为这些度量目前缺乏理论基础。
- 阐明现有训练无关度量之间的理论关系,并解释其经验成功的原因。
- 通过理论洞察识别训练无关NAS中尚未开发的潜力,从而提升搜索性能。
- 开发一个原则化的框架,将训练无关NAS的效率与基于训练NAS的有效性相结合。
- 通过在标准NAS基准上的广泛实验验证理论洞察。
提出的方法
- 利用基于梯度的训练无关度量,推导出深度神经网络(DNNs)的统一泛化界,从而实现对其性能的理论解释。
- 理论上证明,在特定条件下,训练无关度量倾向于选择与基于训练的NAS相似的架构拓扑(如宽或深的结构)。
- 提出混合NAS(HNAS)框架,该框架将贝叶斯优化(BO)与训练无关度量相结合,利用基于训练和训练无关的性能信号共同指导架构搜索。
- 在HNAS中使用超参数μ和ν来平衡泛化保证与基于训练的验证性能,通过BO进行调优以获得最佳结果。
- 使用测试误差与泛化界之间的Spearman等级相关系数来监控搜索进度,并验证HNAS的有效性。
- 在BO中应用不同的采集函数(如EI、UCB),以评估HNAS在不同优化策略下的鲁棒性与稳定性。
实验结果
研究问题
- RQ1现有基于梯度的训练无关NAS度量之间存在何种理论关系?
- RQ2能否推导出一个统一的泛化界,以解释训练无关NAS的经验成功?
- RQ3理论分析是否表明训练无关NAS倾向于选择与基于训练NAS相似的架构拓扑?
- RQ4能否设计一种混合框架,将训练无关NAS的效率与基于训练NAS的有效性相结合?
- RQ5所提出的HNAS框架对贝叶斯优化采集函数的变化有多大的鲁棒性?
主要发现
- 在CIFAR-10上,HNAS实现了94.10 ± 0.16%的测试准确率,在CIFAR-100上为72.48 ± 0.95%,在ImageNet-16-145上为46.30 ± 0.17%,分别接近最优性能94.37%、73.51%和47.31%。
- HNAS框架相较于纯训练无关变体κ/ℳTrace(在CIFAR-10上仅实现93.50%准确率)表现出显著改进,证明了通过基于训练的反馈调优μ和ν的优越性。
- 随着BO迭代的进行,测试误差与泛化界之间的相关性持续上升,证实HNAS逐步选择了更优的架构。
- 不同采集函数(EI与UCB)的性能几乎完全相同,表明HNAS对BO算法选择具有鲁棒性。
- 理论分析表明,训练无关度量在隐式上倾向于选择与基于训练NAS具有相似归纳偏置(如宽或深结构)的架构,验证了该方法的理论一致性。
- HNAS成功统一了训练无关与基于训练NAS的优势,在原则化的方式下实现了更优的搜索效率与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。