Skip to main content
QUICK REVIEW

[论文解读] $\mu$NAS: Constrained Neural Architecture Search for Microcontrollers.

Edgar Liberis, Łukasz Dudziak|arXiv (Cornell University)|Oct 27, 2020
Advanced Neural Network Applications参考文献 41被引用 5
一句话总结

µNAS 是一种专为微控制器(MCUs)设计的神经架构搜索系统,明确针对 RAM、持久存储和推理速度的限制。通过使用高度细粒度的搜索空间与精确的资源估算,结合进化搜索,其在准确率上最高可提升 4.8%,或在内存占用上减少 13 倍,优于以往针对 MCU 优化的模型。

ABSTRACT

IoT devices are powered by microcontroller units (MCUs) which are extremely resource-scarce: a typical MCU may have an underpowered processor and around 64 KB of memory and persistent storage, which is orders of magnitude fewer computational resources than is typically required for deep learning. Designing neural networks for such a platform requires an intricate balance between keeping high predictive performance (accuracy) while achieving low memory and storage usage and inference latency. This is extremely challenging to achieve manually, so in this work, we build a neural architecture search (NAS) system, called $\\mu$NAS, to automate the design of such small-yet-powerful MCU-level networks. $\\mu$NAS explicitly targets the three primary aspects of resource scarcity of MCUs: the size of RAM, persistent storage and processor speed. $\\mu$NAS represents a significant advance in resource-efficient models, especially for "mid-tier" MCUs with memory requirements ranging from 0.5 KB to 64 KB. We show that on a variety of image classification datasets $\\mu$NAS is able to (a) improve top-1 classification accuracy by up to 4.8%, or (b) reduce memory footprint by 4--13x, or (c) reduce the number of multiply-accumulate operations by at least 2x, compared to existing MCU specialist literature and resource-efficient models.

研究动机与目标

  • 解决在 RAM、Flash 存储和处理能力有限的资源受限微控制器(MCUs)上部署高准确率、高效率神经网络的挑战。
  • 克服现有 NAS 和模型压缩方法的局限性,这些方法通常针对移动设备或 GPU 平台设计,难以适配至 MCU 级别的约束。
  • 开发一种 NAS 系统,明确建模并优化微控制器中三大主要资源瓶颈:RAM、持久存储和推理延迟。
  • 实现可在“中端”MCU 上部署的小型高准确率神经架构发现,其 SRAM 和 Flash 最大容量达 64 KB。

提出的方法

  • 设计高度细粒度的神经架构搜索空间,以捕捉与 MCU 效率相关的细微架构选择,包括层类型、深度、宽度和连接方式。
  • 采用老化进化(AE),一种进化局部搜索算法,高效探索搜索空间,同时保持种群多样性并避免过早收敛。
  • 在搜索过程中集成精确的逐层资源使用估算(特别是针对 RAM、Flash 和乘加(MAC)操作),以指导架构选择。
  • 在搜索后应用模型剪枝,进一步减小模型大小和 MAC 操作次数,同时保持准确率损失可忽略。
  • 使用标量化的多目标优化方法,在搜索过程中平衡准确率、模型大小和推理速度。
  • 通过模块化设计提升搜索效率,支持独立替换组件,如搜索算法、压缩技术或资源估算器。

实验结果

研究问题

  • RQ1能否设计一种 NAS 系统,有效探索并优化微控制器的极端资源约束,包括 RAM、持久存储和推理速度?
  • RQ2高度细粒度的搜索空间结合精确的资源估算,如何影响 MCU 部署所发现模型的质量?
  • RQ3结合形态学变换(如老化进化)的进化搜索,能否高效导航复杂且细粒度的搜索空间,以发现小型高准确率模型?
  • RQ4µNAS 在准确率、模型大小和 MAC 操作方面,相较于现有模型压缩和 NAS 方法,在 MCU 平台上能提升多少?
  • RQ5随着数据集复杂度的增加(如 CIFAR-10 与 MNIST),µNAS 的搜索效率如何变化?

主要发现

  • 在 MNIST 上,µNAS 发现了一款剪枝后的全连接模型,参数量小于 0.5 KB,且 top-1 准确率超过 99%,证明了超小型模型的可行性。
  • 在多个图像分类数据集上,µNAS 相较于现有 MCU 专用模型和文献基线,top-1 准确率最高提升 4.8%。
  • 与现有资源高效模型及 MCU 领域文献相比,µNAS 将模型内存占用减少了 4 至 13 倍。
  • 与现有模型相比,乘加(MAC)操作次数至少减少 2 倍,表明推理效率得到提升。
  • 尽管搜索过程较慢(CIFAR-10 上约 8000 步,耗时约 40 个 GPU 天),但 Pareto 前沿逐渐推进,表明延长搜索时间仍有进一步优化潜力。
  • µNAS 的模块化设计支持复用组件,如搜索算法、压缩技术或资源估算器,便于未来适配不同执行策略或硬件目标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。