Skip to main content
QUICK REVIEW

[论文解读] Efficient Deep Neural Networks

BoRui Wu|arXiv (Cornell University)|Aug 20, 2019
Advanced Neural Network Applications参考文献 167被引用 10
一句话总结

本论文提出了一套全面的高效深度神经网络框架,涵盖模型、数据、硬件和设计效率四个维度。提出了 SqueezeDet 和 SqueezeSeg 以实现高速、低功耗的视觉任务;LATTE 实现了 6.2 倍的 LiDAR 标注速度提升;Shift & Synetgy 通过软硬件协同设计,实现 11.6 倍的推理加速;以及可微神经架构搜索(DNAS),其搜索成本相比先前方法降低 421 倍,同时达到最先进精度。

ABSTRACT

The success of deep neural networks (DNNs) is attributable to three factors: increased compute capacity, more complex models, and more data. These factors, however, are not always present, especially for edge applications such as autonomous driving, augmented reality, and internet-of-things. Training DNNs requires a large amount of data, which is difficult to obtain. Edge devices such as mobile phones have limited compute capacity, and therefore, require specialized and efficient DNNs. However, due to the enormous design space and prohibitive training costs, designing efficient DNNs for different target devices is challenging. So the question is, with limited data, compute capacity, and model complexity, can we still successfully apply deep neural networks? This dissertation focuses on the above problems and improving the efficiency of deep neural networks at four levels. Model efficiency: we designed neural networks for various computer vision tasks and achieved more than 10x faster speed and lower energy. Data efficiency: we developed an advanced tool that enables 6.2x faster annotation of a LiDAR point cloud. We also leveraged domain adaptation to utilize simulated data, bypassing the need for real data. Hardware efficiency: we co-designed neural networks and hardware accelerators and achieved 11.6x faster inference. Design efficiency: the process of finding the optimal neural networks is time-consuming. Our automated neural architecture search algorithms discovered, using 421x lower computational cost than previous search methods, models with state-of-the-art accuracy and efficiency.

研究动机与目标

  • 解决在计算资源、数据和模型复杂度受限的边缘设备上部署高精度深度神经网络的挑战。
  • 通过计算开销极小的自动化神经架构搜索,克服训练和设计高效模型的高昂成本。
  • 通过先进的标注工具和领域自适应技术提升数据效率,减少对昂贵真实世界数据采集的依赖。
  • 通过神经网络与加速器的协同设计,提升硬件效率,实现在边缘硬件上的更快推理。
  • 开发自动化、可微的神经架构搜索方法,以极低的搜索成本发现高精度、高效的模型。

提出的方法

  • 提出 SqueezeDet 和 SqueezeSeg,采用 1x1 卷积和火模块的轻量级 CNN,实现高速度和低功耗。
  • 提出 LATTE,一种一键式标注系统,利用传感器融合与跟踪技术,将 LiDAR 点云标注速度提升 6.2 倍。
  • 开发领域自适应技术——学习型强度渲染、测地线相关对齐和渐进式校准,以利用模拟数据进行真实世界 LiDAR 分割。
  • 设计 Shift 操作符作为深度可分离卷积的硬件友好替代方案,实现在定制加速器上的高效推理。
  • 协同设计 DiracDeltaNet 与 Synetgy 加速器,以充分利用 Shift 操作的计算效率,在边缘设备上实现 11.6 倍的推理加速。
  • 采用可微神经架构搜索(DNAS)结合 Gumbel-Softmax,实现端到端、基于梯度的架构搜索,相比先前方法将计算成本降低 421 倍。

实验结果

研究问题

  • RQ1我们能否设计出在边缘部署时速度提升 10 倍、能效更高的深度神经网络,同时保持最先进精度?
  • RQ2如何在不降低标注质量的前提下,显著降低 3D LiDAR 点云的标注成本?
  • RQ3通过领域自适应,模拟数据在多大程度上可用于训练鲁棒的 3D 语义分割模型?
  • RQ4硬件感知的神经网络设计能否在边缘加速器上实现显著的推理速度提升?
  • RQ5可微神经架构搜索能否在保持或提升性能的同时,将神经架构发现的计算成本降低数个数量级?

主要发现

  • SqueezeDet 在 KITTI 目标检测基准上实现超过 10 倍的推理速度提升,并显著降低能耗。
  • 与传统人工标注方法相比,LATTE 将 LiDAR 点云标注时间减少 6.2 倍。
  • SqueezeSegV2 配合领域自适应技术,在仅使用合成 GTA-LiDAR 数据的情况下,即可在真实世界 LiDAR 数据上实现具有竞争力的性能,大幅减少对真实世界标注的依赖。
  • 通过利用 Shift 操作的计算效率,Shift & Synetgy 协同设计框架在边缘硬件上实现 11.6 倍的推理加速。
  • DNAS 以相比先前神经架构搜索方法低 421 倍的计算成本,发现了具有最先进精度的模型。
  • DNAS 框架已成为新的 SOTA 基线,发表一年内被引用超过 30 次,并启发了后续在混合精度量化和目标检测方面的研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。