Skip to main content
QUICK REVIEW

[论文解读] Neural Architecture Design for GPU-Efficient Networks

Ming Lin, Hesen Chen|arXiv (Cornell University)|Jun 24, 2020
Advanced Neural Network Applications参考文献 23被引用 11
一句话总结

本文提出了一种GPU高效的神经网络架构设计原则,通过在低层使用全卷积、高层使用逐通道/瓶颈卷积,充分发挥现代GPU硬件的优势。利用一种轻量级神经架构搜索方法(LLR-NAS),作者设计了GENets——高效且高精度的模型,在现代GPU上实现的推理速度比EfficientNet-B3快达6.4倍,同时在ImageNet上的top-1准确率保持在81.3%以上。

ABSTRACT

Many mission-critical systems are based on GPU for inference. It requires not only high recognition accuracy but also low latency in responding time. Although many studies are devoted to optimizing the structure of deep models for efficient inference, most of them do not leverage the architecture of extbf{modern GPU} for fast inference, leading to suboptimal performance. To address this issue, we propose a general principle for designing GPU-efficient networks based on extensive empirical studies. This design principle enables us to search for GPU-efficient network structures effectively by a simple and lightweight method as opposed to most Neural Architecture Search (NAS) methods that are complicated and computationally expensive. Based on the proposed framework, we design a family of GPU-Efficient Networks, or GENets in short. We did extensive evaluations on multiple GPU platforms and inference engines. While achieving $\geq 81.3\%$ top-1 accuracy on ImageNet, GENet is up to $6.4$ times faster than EfficienNet on GPU. It also outperforms most state-of-the-art models that are more efficient than EfficientNet in high precision regimes. Our source code and pre-trained models are available from \url{https://github.com/idstcv/GPU-Efficient-Networks}.

研究动机与目标

  • 为解决现有高效神经网络在现代GPU上推理性能不佳的问题,这些问题通常忽略了GPU特有的硬件特性。
  • 识别并形式化一种专门针对现代GPU硬件优化的神经网络架构设计原则,重点关注延迟和吞吐量。
  • 开发一种轻量级神经架构搜索方法(LLR-NAS),在简化的、硬件感知的设计空间内高效搜索GPU高效架构。
  • 构建一个高精度、低延迟的网络家族(GENets),在多种GPU平台和推理引擎上,其速度与精度均优于当前最先进模型。

提出的方法

  • 提出一种GPU优化的设计空间,结合低层阶段使用全卷积、高层阶段使用逐通道/瓶颈卷积,基于对核奇异值和延迟的实证分析。
  • 采用轻量级神经架构搜索算法LLR-NAS,通过扰动初始架构并训练每个变体30个周期,以预测准确率和延迟。
  • 调整关键超参数,包括卷积核大小(3,5)、通道宽度(2.0c至0.5c)、深度(相对于基准±2)以及不同模块类型的瓶颈比(r),均在特定范围内。
  • 使用数据增强(mix-up、随机擦除、自动增强)、标签平滑和从ResNet-152教师模型蒸馏的方法,将最终的GENet模型训练480个周期。
  • 在三种设置下基准推理速度:V100(FP16,PyTorch)、T4(FP16,TensorRT)和T4(INT8,TensorRT),使用标准ImageNet划分。
  • 应用TensorRT内置的INT8校准功能,实现混合精度推理,以在T4 GPU上最大化速度。

实验结果

研究问题

  • RQ1在不同网络深度下,全卷积、逐通道卷积和瓶颈卷积等不同卷积算子在现代GPU上的延迟表现如何?
  • RQ2简化的、硬件感知的设计空间是否能在不依赖计算成本高昂的NAS方法的前提下,实现有效且高效的神经架构搜索?
  • RQ3当受到有原则的设计空间指导时,轻量级NAS方法(LLR-NAS)在发现高性能、GPU优化架构方面能达到何种程度?
  • RQ4GENets在多种GPU平台和推理引擎上,与EfficientNet和OFANet等最先进模型相比,在准确率和推理速度方面表现如何?
  • RQ5采用混合卷积算子(早期使用全卷积,后期使用逐通道/瓶颈卷积)的网络是否相比使用统一算子的模型具有更好的GPU效率?

主要发现

  • GENet-large在T4 + TensorRT + INT8推理设置下,ImageNet上的top-1准确率达到81.3%,推理速度比EfficientNet-B3快6.4倍。
  • GENet-normal在80.0%准确率水平下,比EfficientNet-B2快6.8倍,比OFANet快4.2倍,表明其在高准确率场景下具有卓越的效率。
  • 在V100上使用FP16和PyTorch时,GENet-large在相同推理速度下比EfficientNet-B0准确率高出5.0%,凸显其在准确率-延迟权衡上的优势。
  • 设计原则——即在低层阶段使用全卷积、高层阶段使用逐通道/瓶颈卷积——显著提升了GPU利用率并降低了延迟。
  • GENets表现出强迁移能力:在不同GPU平台(V100、T4)和推理引擎(PyTorch、TensorRT)上,性能增益保持一致。
  • 结合有原则的设计空间,使用轻量级LLR-NAS方法,仅需约60 GPU小时(在24块V100上)即可完成高效架构搜索,避免了暴力NAS带来的计算开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。