[论文解读] EH-DNAS: End-to-End Hardware-aware Differentiable Neural Architecture Search
EH-DNAS 提出了一种端到端的硬件感知可微神经架构搜索框架,通过学习一个可微模型来预测端到端硬件延迟,将硬件性能基准测试与可微架构搜索相结合。该方法在定制化加速器和现有硬件平台上的硬件性能平均提升了1.4倍和1.6倍,同时保持了分类准确率。
In hardware-aware Differentiable Neural Architecture Search (DNAS), it is challenging to compute gradients of hardware metrics to perform architecture search. Existing works rely on linear approximations with limited support to customized hardware accelerators. In this work, we propose End-to-end Hardware-aware DNAS (EH-DNAS), a seamless integration of end-to-end hardware benchmarking, and fully automated DNAS to deliver hardware-efficient deep neural networks on various platforms, including Edge GPUs, Edge TPUs, Mobile CPUs, and customized accelerators. Given a desired hardware platform, we propose to learn a differentiable model predicting the end-to-end hardware performance of neural network architectures for DNAS. We also introduce E2E-Perf, an end-to-end hardware benchmarking tool for customized accelerators. Experiments on CIFAR10 and ImageNet show that EH-DNAS improves the hardware performance by an average of $1.4 imes$ on customized accelerators and $1.6 imes$ on existing hardware processors while maintaining the classification accuracy.
研究动机与目标
- 为解决将真实硬件性能反馈整合到不同硬件平台的可微神经架构搜索(DNAS)中的挑战。
- 克服线性近似和代理指标(如 FLOPS、参数量)与实际硬件延迟相关性差的局限性。
- 实现在定制化加速器上的有效架构搜索,包括具有非标准内存和计算模式的加速器。
- 开发一种可扩展的、可微的硬件损失函数,支持通用和流水线式加速器范式。
- 在 CIFAR10 和 ImageNet 等基准数据集上实现高硬件效率,同时不牺牲模型准确率。
提出的方法
- 提出 E2E-Perf,一种硬件基准测试工具,可在定制化加速器上测量神经架构的端到端推理延迟,实现准确的性能数据采集。
- 学习一个可微函数 $\mathcal{F}_\phi$,以将硬件性能近似为架构的函数,从而在 DNAS 中实现基于梯度的优化。
- 将学习到的硬件损失 $\mathcal{L}_{\text{hw}}(\mathbf{a}) = \mathcal{F}_\phi(\mathbf{a})$ 直接集成到 DNAS 训练目标中,实现准确率与硬件效率的联合优化。
- 采用具有可学习嵌入的深度神经网络,以建模跨层和加速器类型的复杂非线性硬件性能关系。
- 采用两阶段流程:首先通过 E2E-Perf 收集硬件性能数据;其次在端到端 DNAS 之前训练可微硬件损失模型。
- 支持通用和流水线式加速器范式,相比以往的线性近似方法具有更广泛的硬件兼容性。
实验结果
研究问题
- RQ1能否从端到端硬件测量中有效学习一个可微硬件损失函数,以指导 DNAS?
- RQ2与 LUT 方法和代理方法相比,所提出的 EH-DNAS 框架在硬件性能估计准确性方面表现如何?
- RQ3EH-DNAS 在保持模型准确率的前提下,能在多大程度上提升定制化加速器上的硬件效率?
- RQ4该框架是否能在包括边缘 GPU、边缘 TPU、移动 CPU 和定制加速器在内的多样化硬件平台上实现泛化?
- RQ5所学习硬件损失模型中的模型复杂度如何影响估计准确率和搜索性能?
主要发现
- EH-DNAS 在定制化加速器上平均提升了 1.4 倍的硬件性能,在现有硬件处理器(边缘 GPU、边缘 TPU、移动 CPU)上平均提升了 1.6 倍,同时保持了分类准确率。
- 所提出的可微硬件损失在定制化加速器上的平均估计误差率为 3.6%,显著低于 LUT 方法的 32.5% 误差率。
- 在 Raspberry Pi 4 和 Pixel 3 等移动平台,EH-DNAS 的误差率分别降低至 38.0% 和 48.4%,优于 LUT 方法,后者因操作系统和内存瓶颈导致高方差。
- 该框架发现的架构比 LUT 方法更复杂且更高效,后者倾向于通过减少层复杂度来过度简化。
- 消融实验表明,硬件损失模型中嵌入大小为 10 时,在复杂度与准确率之间实现了最佳平衡,误差率为 3.6%。
- 通过调整硬件损失权重超参数 $\beta$,EH-DNAS 实现了硬件性能 2 倍的提升,且准确率下降不足 1%,展示了强大的效率-准确率权衡能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。