Skip to main content
QUICK REVIEW

[论文解读] Generalized Latency Performance Estimation for Once-For-All Neural Architecture Search

Muhtadyuzzaman Syed, Arvind Akpuram Srinivasan|arXiv (Cornell University)|Jan 4, 2021
Advanced Neural Network Applications参考文献 8被引用 5
一句话总结

本文提出了一种针对一次性搜索神经架构搜索(OFA)的广义延迟预测框架,该框架用可学习的延迟预测器替代了硬件特定的查表机制。通过引入微调和GPU泛化策略,该方法在延迟预测上实现了比ProxylessNAS低50%以上的RMSE,且在多种硬件平台上性能匹配或超过基线水平,显著减少了人工工作量,并实现了高效、硬件无关的神经架构搜索。

ABSTRACT

Neural Architecture Search (NAS) has enabled the possibility of automated machine learning by streamlining the manual development of deep neural network architectures defining a search space, search strategy, and performance estimation strategy. To solve the need for multi-platform deployment of Convolutional Neural Network (CNN) models, Once-For-All (OFA) proposed to decouple Training and Search to deliver a one-shot model of sub-networks that are constrained to various accuracy-latency tradeoffs. We find that the performance estimation strategy for OFA's search severely lacks generalizability of different hardware deployment platforms due to single hardware latency lookup tables that require significant amount of time and manual effort to build beforehand. In this work, we demonstrate the framework for building latency predictors for neural network architectures to address the need for heterogeneous hardware support and reduce the overhead of lookup tables altogether. We introduce two generalizability strategies which include fine-tuning using a base model trained on a specific hardware and NAS search space, and GPU-generalization which trains a model on GPU hardware parameters such as Number of Cores, RAM Size, and Memory Bandwidth. With this, we provide a family of latency prediction models that achieve over 50% lower RMSE loss as compared to with ProxylessNAS. We also show that the use of these latency predictors match the NAS performance of the lookup table baseline approach if not exceeding it in certain cases.

研究动机与目标

  • 解决OFA中硬件特定延迟查表机制缺乏泛化能力的问题,后者需要在每个平台上进行大量手动校准。
  • 降低在神经架构搜索(NAS)中为新硬件平台构建延迟查表所需的计算和人力成本。
  • 为一次性搜索神经架构搜索(OFA NAS)提供高效、硬件无关的延迟估计,以支持CNN模型在多平台上的部署。
  • 开发一种可扩展、可训练的延迟预测框架,在多种硬件配置下保持高精度。
  • 证明学习得到的延迟预测器可匹配或超越传统基于查表的NAS性能,同时将训练开销最小化。

提出的方法

  • 在特定硬件平台(如三星Note 10)上,使用CNN层配置及其测量延迟的数据集,训练基础延迟预测器。
  • 通过使用小规模、针对性的数据集(仅为完整训练数据的20%),对基础模型进行微调,以适应新的硬件平台。
  • 引入GPU泛化策略,训练一个以GPU硬件参数(核心数、内存大小、内存带宽)作为输入特征的延迟预测器。
  • 通过迁移学习和架构适配,构建一个统一的延迟预测模型,使其在多个硬件平台上具有泛化能力。
  • 将训练好的延迟预测器用作NAS搜索循环中的性能估计算法,替代查表以实现高效架构评估。
  • 在四个硬件平台上评估该框架:三星Galaxy Note 10、英特尔Xeon CPU、RTX 2080 Ti GPU和Tesla P40 GPU。

实验结果

研究问题

  • RQ1一个单一的延迟预测器是否能在无需为每个平台单独维护查表的情况下,有效泛化到多种不同的硬件平台?
  • RQ2在新硬件平台上对预训练延迟预测器进行微调,与从零开始训练相比,在准确性和数据效率方面表现如何?
  • RQ3在GPU参数(如核心数、内存带宽)上训练的延迟预测器,能在多大程度上泛化到不同型号的GPU?
  • RQ4在NAS中使用学习得到的延迟预测器是否会导致模型准确率或搜索效率相比基线查表方法下降?
  • RQ5在NAS中应用迁移学习进行延迟估计时,预测准确率(RMSE)与数据效率之间的权衡如何?

主要发现

  • 所提出的延迟预测器相比ProxylessNAS基线,RMSE降低超过50%,证明了其在预测精度上的显著优势。
  • 仅使用原始数据集20%的微调模型,其性能即可与硬件特定的查表机制相当,显著降低了数据和训练开销。
  • 微调后的延迟预测器在NAS性能上与查表基线持平或更优,且未造成模型准确率或搜索效率的下降。
  • GPU泛化策略使得单一模型能够通过输入硬件配置信息,预测多种GPU类型下的延迟,从而减少了对每类GPU单独校准的需求。
  • 在RTX 2080 Ti上,微调后的延迟预测器在某些延迟约束条件下,性能优于查表方法和直接测量方法,表明其具备更强的鲁棒性。
  • 该框架实现了无需为每种硬件手动测量延迟的高效多平台NAS,大幅减少了CO2排放和GPU使用时长。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。