Skip to main content
QUICK REVIEW

[论文解读] Single-Path NAS: Device-Aware Efficient ConvNet Design

Dimitrios Stamoulis, Ruizhou Ding|arXiv (Cornell University)|May 10, 2019
Advanced Neural Network Applications参考文献 24被引用 12
一句话总结

Single-Path NAS 提出了一种新颖的可微分 NAS 方法,将架构搜索建模为从每层的单一过参数化 '超核' 中选择权重子集的问题,从而消除了对多路径超网络训练的需求。该方法将 NAS 搜索成本降低至仅 8 个周期(在 TPUv2 上耗时 3.75 小时),在 ImageNet 上实现了 74.96% 的 top-1 准确率,且在 Pixel 1 上延迟仅为 79.48ms,创下类似延迟约束下硬件高效卷积神经网络的最新 SOTA 记录。

ABSTRACT

Can we automatically design a Convolutional Network (ConvNet) with the highest image classification accuracy under the latency constraint of a mobile device? Neural Architecture Search (NAS) for ConvNet design is a challenging problem due to the combinatorially large design space and search time (at least 200 GPU-hours). To alleviate this complexity, we propose Single-Path NAS, a novel differentiable NAS method for designing device-efficient ConvNets in less than 4 hours. 1. Novel NAS formulation: our method introduces a single-path, over-parameterized ConvNet to encode all architectural decisions with shared convolutional kernel parameters. 2. NAS efficiency: Our method decreases the NAS search cost down to 8 epochs (30 TPU-hours), i.e., up to 5,000x faster compared to prior work. 3. On-device image classification: Single-Path NAS achieves 74.96% top-1 accuracy on ImageNet with 79ms inference latency on a Pixel 1 phone, which is state-of-the-art accuracy compared to NAS methods with similar latency (<80ms).

研究动机与目标

  • 为降低传统 NAS 方法在移动优化卷积神经网络中所需的高昂计算成本(通常超过 200 GPU 小时),以实现高效搜索。
  • 设计一种硬件感知的 NAS 方法,直接针对 Pixel 1 等移动平台的设备端推理延迟进行优化。
  • 通过将 NAS 搜索空间重新构想为单路径、权重子集选择问题,消除多路径超网络架构的低效性。
  • 在移动设备上严格延迟约束(≤80ms)下,实现 ImageNet 图像分类任务的最先进准确率。
  • 通过用紧凑、可微分的超核公式替代复杂的多路径训练,实现快速、高效且可复现的 NAS。

提出的方法

  • 该方法在每个卷积神经网络层引入一个单路径、过参数化的 '超核',将所有候选操作(如 3×3 和 5×5 卷积)编码为共享权重的子集。
  • 架构决策被建模为选择激活超核权重的哪些子集,通过使用 Sigmoid 函数对指示函数进行可微分松弛来实现。
  • 搜索空间基于类似 MobileNetV2 的宏观架构构建,其中每一层为具有可变卷积核大小和扩展比的移动倒置瓶颈(MBConv)。
  • 通过设备端性能分析训练一个设备感知的运行时模型,以预测每层的延迟,利用学习到的阈值整合卷积核大小和扩展比的决策。
  • NAS 目标函数结合了准确率与延迟,将延迟模型作为训练过程中的可微分约束,以指导架构搜索。
  • 最终架构通过从训练好的超核中剪除未激活的权重子集获得,从而生成一个紧凑且高效的模型。

实验结果

研究问题

  • RQ1能否将移动卷积神经网络的 NAS 加速至 4 小时以内,同时保持或提升准确率?
  • RQ2单路径、基于超核的公式能否替代多路径超网络训练,从而降低内存与计算开销?
  • RQ3可微分的权重子集选择方法能否在严格设备端延迟约束下实现最先进准确率?
  • RQ4与 MnasNet、ProxylessNAS 和 FBNet 等先前的 NAS 方法相比,该方法在搜索成本与性能上表现如何?
  • RQ5能否准确训练并集成一个设备专用的延迟模型到 NAS 目标中,以指导高效架构搜索?

主要发现

  • Single-Path NAS 在 ImageNet 上实现了 74.96% 的 top-1 准确率,创下在 Pixel 1 上类似设备端延迟(≤80ms)下的 NAS 方法新 SOTA 记录。
  • 该方法将 NAS 搜索成本降低至仅 8 个周期(在 TPUv2 上耗时 3.75 小时),相比 MnasNet 提高了 5,000 倍,相比 ProxylessNAS 提高了 25 倍。
  • 延迟预测模型的均方根误差为 1.32ms(平均误差 1.76%),实现了搜索过程中准确且可微分的延迟约束。
  • 在相似延迟条件下,Single-Path NAS 相较 MobileNetV2 提升了 +1.37% 的 top-1 准确率,相较 MnasNet 提升 +0.35%,相较 FBNet-B 提升 +0.86%。
  • 该方法比 FBNet 快 11 倍,比 ProxylessNAS 快 25 倍,总搜索成本为 30 TPU 小时,显著降低了高效、硬件感知模型设计的门槛。
  • 该方法已完全开源并配有完整文档,支持可复现性,并可扩展至其他硬件约束(如功耗、内存或通信)的未来研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。