Skip to main content
QUICK REVIEW

[论文解读] A Hardware-Aware Framework for Accelerating Neural Architecture Search Across Modalities

Daniel Cummings, Anthony Sarah|arXiv (Cornell University)|May 19, 2022
Machine Learning and Data Classification被引用 4
一句话总结

本文提出 LINAS,一种硬件感知的神经架构搜索(NAS)框架,通过迭代结合进化算法与轻量级性能预测器,加速跨模态的多目标神经架构搜索。该方法通过减少验证开销,在保持针对 GPU、CPU 和移动平台的硬件特定优化的前提下,显著加快了对帕累托最优子网络的收敛速度,尤其在图像分类和推荐任务中表现突出。

ABSTRACT

Recent advances in Neural Architecture Search (NAS) such as one-shot NAS offer the ability to extract specialized hardware-aware sub-network configurations from a task-specific super-network. While considerable effort has been employed towards improving the first stage, namely, the training of the super-network, the search for derivative high-performing sub-networks is still under-explored. Popular methods decouple the super-network training from the sub-network search and use performance predictors to reduce the computational burden of searching on different hardware platforms. We propose a flexible search framework that automatically and efficiently finds optimal sub-networks that are optimized for different performance metrics and hardware configurations. Specifically, we show how evolutionary algorithms can be paired with lightly trained objective predictors in an iterative cycle to accelerate architecture search in a multi-objective setting for various modalities including machine translation and image classification.

研究动机与目标

  • 为解决在硬件感知神经架构搜索(NAS)中搜索最优子网络所面临的高计算成本,特别是在针对多样化硬件平台和多种性能指标时的挑战。
  • 通过引入基于轻量级预测器的搜索循环,减少 NAS 过程中对昂贵的完整验证周期的依赖,从而加速架构空间的探索。
  • 在保持硬件感知的前提下,实现对图像分类、机器翻译和推荐系统等不同模态的子网络的高效多目标优化。
  • 证明将进化算法与预测模型结合,可在超体积(hypervolume)和收敛速度方面优于标准 NAS 基线方法(如随机搜索和 NSGA-II)。
  • 提供一个可泛化的框架,支持在不同深度学习工作负载和硬件配置下灵活集成多种搜索算法与预测模型。

提出的方法

  • 该框架使用预训练的超网络(具有权重共享),以实现无需微调即可高效提取子网络。
  • 采用两阶段循环:内部进化算法(EA)利用轻量级性能预测器的预测结果来探索架构空间。
  • 性能预测器在少量采样的子网络上进行训练,可预测新架构的关键指标(如准确率和延迟)。
  • 进化算法(如 NSGA-II、U-NSGA-III)基于预测性能生成新的候选子网络,从而减少对完整验证的依赖。
  • 该过程通过迭代优化预测器并利用多目标优化演化种群,逐步收敛至帕累托最优子网络前沿。
  • 该框架具有模块化设计,支持可插拔的搜索算法与预测模型,并可在 GPU、CPU 和移动设备等多种硬件平台上部署。

实验结果

研究问题

  • RQ1基于轻量级预测器的进化循环是否能在多目标 NAS 场景中显著加速对硬件优化子网络的搜索?
  • RQ2在不同模态下,LINAS 在超体积和收敛速度方面与标准 NAS 基线(如随机搜索和 NSGA-II)相比表现如何?
  • RQ3所选进化算法或预测模型在多大程度上影响最终帕累托最优子网络集合的质量?
  • RQ4LINAS 框架在图像分类、推荐系统(NCF)和基于 Transformer 的模型等不同模态下的泛化能力如何?
  • RQ5LINAS 是否能在缺乏延迟范围或平台特定特征先验知识的情况下,实现有效的硬件感知优化?

主要发现

  • 与 NSGA-II 和随机搜索相比,LINAS 在图像分类任务(如 MobileNetV3 和 ResNet50)中显著加快了对更高超体积值的收敛速度,仅需 50% 的评估次数即可达到相近性能。
  • 在内部循环中使用基于帕累托的多目标进化算法(如 NSGA-II、U-NSGA-III)相比单目标方法(如 MOTPE)表现更优,后者因评估时间过长而受限。
  • 在 MobileNetV3 搜索空间中,内部 EA 循环的种群规模为 50 时,在探索与收敛速度之间实现了最佳平衡。
  • LINAS 在 GPU、CPU 和移动设备等多种硬件平台上均表现出一致性能,且无需平台特定调优或延迟先验知识。
  • 尽管在高度受限的搜索空间(如 NCF 和 Transformer)中优势不那么明显(因高性能架构分布更密集),LINAS 仍显著优于基线方法。
  • 该框架的模块化设计支持灵活集成多种搜索算法与预测模型,且对最终性能影响极小,验证了其在不同模态与硬件目标下的可泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。