Skip to main content
QUICK REVIEW

[论文解读] UDC: Unified DNAS for Compressible TinyML Models

I. A. Fedorov, Ramon Matas|arXiv (Cornell University)|Jan 15, 2022
Advanced Neural Network Applications被引用 6
一句话总结

UDC 提出了一种统一的可微神经架构搜索(DNAS)框架,联合优化神经网络架构、各层权重位宽和稀疏度水平,以生成适用于神经处理单元(NPUs)的可压缩 TinyML 模型。通过将硬件感知压缩(量化与剪枝)整合到搜索空间中,UDC 实现了最先进性能——在 ImageNet 上实现相同精度时模型尺寸缩小最多达 3.35 倍,或在相同尺寸下准确率提升 6.25%,同时确保在严格的 NPU 内存限制内部署。

ABSTRACT

Deploying TinyML models on low-cost IoT hardware is very challenging, due to limited device memory capacity. Neural processing unit (NPU) hardware address the memory challenge by using model compression to exploit weight quantization and sparsity to fit more parameters in the same footprint. However, designing compressible neural networks (NNs) is challenging, as it expands the design space across which we must make balanced trade-offs. This paper demonstrates Unified DNAS for Compressible (UDC) NNs, which explores a large search space to generate state-of-the-art compressible NNs for NPU. ImageNet results show UDC networks are up to $3.35 imes$ smaller (iso-accuracy) or 6.25% more accurate (iso-model size) than previous work.

研究动机与目标

  • 为解决在低成本物联网设备有限内存下设计 TinyML 模型的挑战。
  • 实现对 NPU 上硬件模型压缩(量化与稀疏)的充分利用,而软件型 MCU 无法高效利用这些技术。
  • 在保证符合硬性 NPU 内存约束的前提下,联合搜索神经架构、各层位宽与稀疏度水平。
  • 开发一种可微分的、硬件感知的搜索算法,避免过正则化并确保高效的权重共享。
  • 生成在准确率与模型尺寸方面对 NPU 部署呈帕累托最优的可压缩、可部署 TinyML 模型。

提出的方法

  • 将可微 NAS(DNAS)扩展至使用可微分、压缩感知的目标函数,联合优化各层权重稀疏度与位宽。
  • 提出一种新颖的可微分压缩感知度量,基于剪枝掩码与量化权重的熵限压缩,支持基于梯度的优化。
  • 采用基于 Gumbel-Softmax 的搜索机制,提升探索-利用控制能力并减少偏差,避免过正则化。
  • 引入新型权重表示与训练算法,稳定稀疏且低比特权重模型的训练,此类模型原本极难优化。
  • 通过可微分的模型尺寸近似施加硬性压缩模型尺寸约束,确保所有生成模型均符合目标 NPU 内存限制。
  • 使用真实 Vela NPU 编译器验证压缩收益,该编译器对掩码与非零权重应用 Golomb-Rice 编码与游程编码。

实验结果

研究问题

  • RQ1统一的可微 NAS 框架能否联合优化神经架构、各层位宽与稀疏度水平,以生成可部署于 NPU 的 TinyML 模型?
  • RQ2如何使搜索过程对过正则化与有偏的 Gumbel-Softmax 近似具有鲁棒性,同时保持高准确率与高可压缩性?
  • RQ3联合搜索架构、位宽与稀疏度在模型尺寸与准确率方面,相较于顺序设计与条件化方法,能提升多少?
  • RQ4所提方法能否保证生成的模型满足硬性 NPU 内存约束而无需人工调优?
  • RQ5与随机搜索及消融变体相比,所提的压缩感知搜索在最终模型性能与搜索效率方面表现如何?

主要发现

  • UDC 生成的模型在保持相同 ImageNet 顶级-1 准确率下,尺寸最大可缩小 3.35 倍,展现出显著的压缩增益。
  • 在相同模型尺寸下,UDC 模型在 ImageNet 上的准确率比以往最先进模型高出 6.25%。
  • 理论压缩模型尺寸与使用 Vela NPU 编译器实测尺寸高度吻合,差异在两位小数以内。
  • 消融研究显示,若禁用 UDC 的任意组件,CIFAR100 与 ImageNet 上的性能均显著下降。
  • 在系统特定运行时,UDC 比 FBNet 与 FBNetV2 快 1.4 倍,且在归一化搜索成本(460 张图片/秒系统下为 3.2 GPUD)方面除两者外优于所有其他方法。
  • 所提的数值格式与训练算法使极稀疏、低比特权重模型的训练得以稳定,而此类模型原本极难优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。