[论文解读] BS-NAS: Broadening-and-Shrinking One-Shot NAS with Searchable Numbers of Channels
该论文提出BS-NAS,一种新颖的One-Shot神经架构搜索框架,通过引入弹簧模块(spring block)在超网络训练期间实现通道数的可搜索性,随后采用逐步缩减策略以消除表现较差的操作。该方法通过改进搜索空间表征和排名相关性,在ImageNet上实现了76.3%的SOTA top-1准确率。
One-Shot methods have evolved into one of the most popular methods in Neural Architecture Search (NAS) due to weight sharing and single training of a supernet. However, existing methods generally suffer from two issues: predetermined number of channels in each layer which is suboptimal; and model averaging effects and poor ranking correlation caused by weight coupling and continuously expanding search space. To explicitly address these issues, in this paper, a Broadening-and-Shrinking One-Shot NAS (BS-NAS) framework is proposed, in which `broadening' refers to broadening the search space with a spring block enabling search for numbers of channels during training of the supernet; while `shrinking' refers to a novel shrinking strategy gradually turning off those underperforming operations. The above innovations broaden the search space for wider representation and then shrink it by gradually removing underperforming operations, followed by an evolutionary algorithm to efficiently search for the optimal architecture. Extensive experiments on ImageNet illustrate the effectiveness of the proposed BS-NAS as well as the state-of-the-art performance.
研究动机与目标
- 解决现有One-Shot NAS方法中因固定且手动预定义的通道数导致的次优性能问题。
- 缓解因超网络训练中权重耦合与搜索空间扩大所导致的模型平均化效应及排名相关性差的问题。
- 通过在超网络训练期间实现动态通道数搜索,丰富搜索空间的表征能力。
- 通过一种新颖的逐步缩减策略,逐步消除表现较差的操作,从而提高One-Shot架构排名的可靠性。
- 通过端到端框架结合扩展、缩减与进化搜索,实现在ImageNet上的SOTA性能。
提出的方法
- 引入一种弹簧模块,解耦深度可分离卷积与逐点卷积,实现在不破坏网络稳定性的前提下灵活调整输出通道数。
- 通过将输出通道数设为可学习、可微的超参数,使超网络在训练过程中能够搜索最优通道数。
- 提出一种逐步缩减策略,基于各层在训练过程中的验证准确率,分层排序并移除表现较差的操作。
- 在缩减后的搜索空间上应用进化算法,以高效识别最优架构,同时最小化重新训练的开销。
- 采用渐进式消除机制,仅让在各次缩减阶段中始终表现优异的操作留存,从而减少冗余并提升排名保真度。
- 通过设计模块化、可扩展的组件,保持与MobileNetV2以外多种神经架构的兼容性。
实验结果
研究问题
- RQ1在超网络训练期间动态搜索通道数,是否能提升One-Shot NAS中搜索空间的表征能力?
- RQ2渐进式、分层的缩减策略是否能有效缓解模型平均化效应,并提升One-Shot模型与独立训练模型排名之间的相关性?
- RQ3与固定通道数的One-Shot方法相比,所提出的框架在搜索效率与最终架构性能方面提升程度如何?
- RQ4弹簧模块是否能在保持性能稳定的同时,实现跨不同架构的灵活通道数自适应?
- RQ5扩展与缩减策略的结合,对ImageNet上搜索模型的最终准确率与鲁棒性有何影响?
主要发现
- 所提出的BS-NAS框架在ImageNet数据集上实现了76.3%的SOTA top-1准确率,优于现有One-Shot NAS方法。
- 逐步缩减策略显著改善了One-Shot模型的准确率分布,最终缩减后的搜索空间所生成的模型即使在较少训练轮次下,也优于未进行缩减训练的模型。
- 从最终缩减后的搜索空间(仅保留10%的操作)中训练的模型,从零开始训练即可达到75.1%的top-1准确率,表明剩余操作的质量较高。
- One-Shot模型排名与对应独立训练模型准确率之间的相关性显著提升,表明权重耦合减少,预测保真度更高。
- One-Shot与独立模型之间的准确率差距约为14%,这归因于通道数搜索复杂度的提升,凸显了搜索空间缩减在提升收敛性与排名性能方面的重要性。
- 弹簧模块在不破坏训练稳定性的前提下实现了有效的通道数搜索,且该框架可扩展至MobileNetV2以外的其他神经架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。