[论文解读] NSGANetV2: Evolutionary Multi-Objective Surrogate-Assisted Neural Architecture Search
NSGANetV2 提出了一种基于进化多目标神经架构搜索(NAS)的方法,采用两种代理模型——在架构层面的在线代理模型以提升样本效率,以及在权重层面的超网络以提升训练效率,在标准和非标准数据集上实现了最先进性能,且搜索成本降低数个数量级,在移动设备约束下,于 STL-10 和 Flowers102 等基准测试中超越了现有方法。
In this paper, we propose an efficient NAS algorithm for generating task-specific models that are competitive under multiple competing objectives. It comprises of two surrogates, one at the architecture level to improve sample efficiency and one at the weights level, through a supernet, to improve gradient descent training efficiency. On standard benchmark datasets (C10, C100, ImageNet), the resulting models, dubbed NSGANetV2, either match or outperform models from existing approaches with the search being orders of magnitude more sample efficient. Furthermore, we demonstrate the effectiveness and versatility of the proposed method on six diverse non-standard datasets, e.g. STL-10, Flowers102, Oxford Pets, FGVC Aircrafts etc. In all cases, NSGANetV2s improve the state-of-the-art (under mobile setting), suggesting that NAS can be a viable alternative to conventional transfer learning approaches in handling diverse scenarios such as small-scale or fine-grained datasets. Code is available at https://github.com/mikelzc1990/nsganetv2
研究动机与目标
- 为解决在涉及自定义、非标准数据集且存在多个竞争目标的实际场景中,神经架构搜索(NAS)计算成本过高的问题。
- 通过用聚焦于当前帕累托前沿的在线自适应代理模型替代离线代理学习,提升高层架构搜索中的样本效率。
- 通过利用超网络实现候选架构的快速微调,降低对完整 SGD 迭代的依赖,从而提升低层权重优化的训练效率。
- 证明在移动部署约束下,NAS 可在小样本和细粒度数据集上超越传统迁移学习。
- 实现在多样化数据集和多目标场景下的可扩展、实用化 NAS,包括准确率、FLOPs、延迟和模型大小等目标。
提出的方法
- 该方法采用双重代理策略:在架构层面使用在线代理模型,可动态学习靠近当前帕累托前沿的架构,显著提升相比离线方法的样本效率。
- 在权重层面,训练一个超网络以提供候选架构的初始权重,实现快速微调,减少从头开始完整训练的需求。
- 算法采用进化多目标优化框架(NSGA-II)探索架构空间,同时保持多样性并收敛至帕累托前沿。
- 在线代理模型在搜索过程中迭代更新,优先选择靠近当前权衡边界的架构,不同于以往工作中随机或均匀采样的代理模型。
- 该方法支持标量化单目标与多目标优化,实现准确率、FLOPs、参数量和推理延迟之间的权衡。
- 搜索在自定义数据集上进行,使用 8 块 GPU,预算为一天,通过早停和渐进式超网络训练加速收敛。
实验结果
研究问题
- RQ1与离线代理学习相比,在架构层面使用在线代理模型是否能显著提升 NAS 中的样本效率?
- RQ2基于超网络的微调策略是否能降低评估候选架构的训练成本,同时不损失性能?
- RQ3在移动设备约束下,NAS 是否能在非标准数据集(如 STL-10 和 Flowers102)上超越迁移学习?
- RQ4在实际应用中,多个竞争目标(准确率、FLOPs、延迟和模型大小)如何相互作用?NAS 是否能有效应对这些权衡?
- RQ5所提出方法在多样化数据集(包括细粒度和小样本基准)上是否具备可扩展性和有效性?
主要发现
- NSGANetV2 在 ImageNet 上实现 79.56% 的 top-1 准确率,仅需 596M FLOPs,优于 EfficientNet-B1 在准确率和效率两方面的表现。
- 在 STL-10 上,NSGANetV2 超越了半监督学习方法的最先进结果,证明 NAS 是迁移学习的可行替代方案。
- 在 Flowers102 上,NSGANetV2 的准确率高于 EfficientNet-B3,且 FLOPs 减少 14 亿,证实了其在效率-准确率权衡上的优越性。
- 该方法仅需 350 个架构样本即可达到与 OnceForAll(16,000 个样本)和 PNAS(1,160 个样本)相当的性能,证明样本效率显著提升。
- 在包含五个目标(准确率、FLOPs、参数量、CPU/GPU 延迟)的多目标设置中,清晰地呈现出帕累托表面,显示出非平凡的权衡,尤其在 FLOPs 与参数量之间。
- 在五维目标空间中非支配的架构,在简化为两维目标问题时往往变为被支配,凸显了完整多目标优化的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。