Skip to main content
QUICK REVIEW

[论文解读] CoCoPIE: Making Mobile AI Sweet As PIE --Compression-Compilation Co-Design Goes a Long Way

Shaoshan Liu, Bin Ren|arXiv (Cornell University)|Mar 14, 2020
Advanced Neural Network Applications参考文献 55被引用 13
一句话总结

CoCoPIE 提出了一种压缩-编译器协同设计框架,无需专用硬件即可在通用设备上实现实时移动AI,通过联合优化模型压缩与编译,使DNN剪枝速度提升最高达180倍,并在速度和能效方面超越ASIC/FPGA加速器。

ABSTRACT

Assuming hardware is the major constraint for enabling real-time mobile intelligence, the industry has mainly dedicated their efforts to developing specialized hardware accelerators for machine learning and inference. This article challenges the assumption. By drawing on a recent real-time AI optimization framework CoCoPIE, it maintains that with effective compression-compiler co-design, it is possible to enable real-time artificial intelligence on mainstream end devices without special hardware. CoCoPIE is a software framework that holds numerous records on mobile AI: the first framework that supports all main kinds of DNNs, from CNNs to RNNs, transformer, language models, and so on; the fastest DNN pruning and acceleration framework, up to 180X faster compared with current DNN pruning on other frameworks such as TensorFlow-Lite; making many representative AI applications able to run in real-time on off-the-shelf mobile devices that have been previously regarded possible only with special hardware support; making off-the-shelf mobile devices outperform a number of representative ASIC and FPGA solutions in terms of energy efficiency and/or performance.

研究动机与目标

  • 挑战业界普遍认为专用硬件对实现实时移动AI不可或缺的假设。
  • 证明通过有效的压缩-编译器协同设计,可在主流移动处理器上实现无需定制加速器的实时推理。
  • 通过利用通用处理器,降低定制AI硬件相关的时间成本、经济成本和技术门槛。
  • 通过纯软件优化,推动现有移动设备和物联网设备上实时AI的广泛应用。
  • 将协同设计原则从DNN扩展至端到端AI应用优化与隐私敏感的部署。

提出的方法

  • 提出双组件框架:CoCo-Gen用于自动化、高性能的DNN压缩,CoCo-Tune用于智能编译与优化。
  • 采用协同设计方法,使模型压缩(剪枝与量化)受底层硬件执行模式指导,以提升编译效率。
  • 借鉴编译器设计中的洞察(如模块化与可组合性),指导压缩决策,以生成更优代码并提升性能。
  • 采用需求感知的协同设计方法,使压缩选择与处理器偏好(如内存访问模式、指令级并行性)对齐。
  • 从高层DNN模型(CNN、RNN、Transformer)端到端优化至移动CPU和GPU的可执行代码。
  • 通过合成数据生成支持无数据剪枝,实现在隐私受限环境中的优化。

实验结果

研究问题

  • RQ1能否通过软件协同设计在主流移动设备上实现实时AI推理,而无需专用AI加速器?
  • RQ2与传统独立的压缩和编译流程相比,压缩-编译器协同设计在减少调优时间与提升性能方面有何优势?
  • RQ3通用处理器在移动AI工作负载的速度和能效方面,能在多大程度上超越定制ASIC和FPGA?
  • RQ4协同设计原则如何从DNN模型扩展至整个AI应用优化与异构部署系统?
  • RQ5能否在不访问原始训练数据的情况下,通过合成数据实现隐私保护的DNN优化?

主要发现

  • 与TensorFlow Lite及其他领先框架相比,CoCoPIE的DNN剪枝速度最高提升180倍,显著缩短优化时间。
  • CoCoPIE使多种DNN(包括CNN、RNN、Transformer和大语言模型)在无需专用硬件的现成移动设备上实现实时推理。
  • 在设备端性能方面,CoCoPIE在速度和能效上均优于多个ASIC和FPGA解决方案,尤其在28–65nm AI加速器上表现突出。
  • 该框架支持所有主流DNN架构与操作,是首个统一支持CNN、RNN和基于Transformer模型的框架。
  • CoCoPIE的无数据剪枝能力使模型优化无需原始训练数据,扩展了其在隐私敏感场景中的适用性。
  • 该框架使此前无法实现的实时AI用例成为可能,如移动摄像头上的实时视频风格迁移,以及低带宽条件下的实时高清视频超分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。