Skip to main content
QUICK REVIEW

[論文レビュー] CoCoPIE: Making Mobile AI Sweet As PIE --Compression-Compilation Co-Design Goes a Long Way

Shaoshan Liu, Bin Ren|arXiv (Cornell University)|Mar 14, 2020
Advanced Neural Network Applications参考文献 55被引用数 13
ひとこと要約

CoCoPIEは、特化したハードウェアを必要とせず、一般のデバイスでリアルタイムのモバイルAIを実現するための圧縮・コンパイラー共同設計フレームワークを導入した。このフレームワークは、モバイルCPUおよびGPU向けにモデル圧縮とコンパイルを共同最適化することで、DNNの pruning が最大180倍高速化され、ASIC/FPGAアクセラレータを上回る速度およびエネルギー効率を達成した。

ABSTRACT

Assuming hardware is the major constraint for enabling real-time mobile intelligence, the industry has mainly dedicated their efforts to developing specialized hardware accelerators for machine learning and inference. This article challenges the assumption. By drawing on a recent real-time AI optimization framework CoCoPIE, it maintains that with effective compression-compiler co-design, it is possible to enable real-time artificial intelligence on mainstream end devices without special hardware. CoCoPIE is a software framework that holds numerous records on mobile AI: the first framework that supports all main kinds of DNNs, from CNNs to RNNs, transformer, language models, and so on; the fastest DNN pruning and acceleration framework, up to 180X faster compared with current DNN pruning on other frameworks such as TensorFlow-Lite; making many representative AI applications able to run in real-time on off-the-shelf mobile devices that have been previously regarded possible only with special hardware support; making off-the-shelf mobile devices outperform a number of representative ASIC and FPGA solutions in terms of energy efficiency and/or performance.

研究の動機と目的

  • 専用ハードウェアがリアルタイムのモバイルAIに不可欠であるという業界の一般的な仮定に挑戦すること。
  • 効果的な圧縮・コンパイラー共同設計が、カスタムアクセラレータを必要とせず、主流のモバイルプロセッサ上でリアルタイム推論を達成できることを示すこと。
  • 一般用途プロセッサを活用することで、カスタムAIハードウェアに伴う時間的・コスト的・技術的障壁を低減すること。
  • ソフトウェアオンリーオプティマイゼーションにより、既存のモバイルおよびIoTデバイスにおけるリアルタイムAIの広範な採用を可能にすること。
  • DNNにとどまらず、包括的なAIアプリケーション最適化およびプライバシー配慮型デプロイメントまで、共同設計の原則を拡張すること。

提案手法

  • 二段階フレームワークを導入:高パフォーマンスなDNN圧縮を自動化するCoCo-Genと、インテリジェントなコンパイルおよび最適化を実現するCoCo-Tune。
  • モデル圧縮(pruningおよびquantization)が低レベルのハードウェア実行パターンに従ってガイドされることで、コンパイル効率が向上する協調的設計を採用。
  • モジュラリティや合成可能性といったコンパイラー設計の知見を活用し、より良いコード生成とパフォーマンスを実現するための圧縮意思決定を支援。
  • 需要に応じた共同設計アプローチを採用し、圧縮選択をプロセッサの好み(メモリアクセスパターン、命令レベル並列性など)に一致させる。
  • 高レベルのDNNモデル(CNN、RNN、Transformers)からモバイルCPUおよびGPU用実行可能コードまで、エンドツーエンドの最適化を実施。
  • 訓練データにアクセスできない環境でも最適化可能な、合成データ生成によるデータフリーpruningをサポート。

実験結果

リサーチクエスチョン

  • RQ1カスタムAIアクセラレータを必要とせず、ソフトウェア共同設計により主流のモバイルデバイスでリアルタイムAI推論を達成できるか?
  • RQ2従来の独立した圧縮とコンパイルパイプラインと比較して、圧縮・コンパイラー共同設計はチューニング時間をどれほど短縮し、パフォーマンスをどのように向上させるか?
  • RQ3一般用途プロセッサは、モバイルAIワークロードにおいて、カスタムASICおよびFPGAを上回る速度およびエネルギー効率を達成できるか、その程度はいかほどか?
  • RQ4共同設計の原則は、DNNモデルにとどまらず、AIアプリケーション全体および異種デプロイメントシステムの最適化へどのように拡張できるか?
  • RQ5元の訓練データにアクセスできない状況でも、合成データを用いてプライバシー保護型DNN最適化を実現できるか?

主な発見

  • CoCoPIEは、TensorFlow Liteや他の主要フレームワークと比較して、DNNのpruningが最大180倍高速化され、最適化時間の大幅な短縮を実現した。
  • CoCoPIEは、従来は専用ハードウェアを必要としていた、CNN、RNN、Transformers、および大規模言語モデルを含む多様なDNNに対して、市販のモバイルデバイス上でもリアルタイム推論を可能にした。
  • 28–65nmのAIアクセラレータを含む複数のASICおよびFPGAソリューションと比較して、CoCoPIEのデバイス内パフォーマンスは、速度およびエネルギー効率の両面で優れていた。
  • フレームワークは、主要なすべてのDNNアーキテクチャと演算をサポートしており、CNN、RNN、およびトランスフォーマー基盤モデルの間で統合的なサポートを初めて実現した。
  • データフリーpruning機能により、元の訓練データにアクセスできない状況でもモデル最適化が可能となり、プライバシー制約のある環境での応用範囲が拡大した。
  • CoCoPIEは、従来は実現不可能とされていたリアルタイムAIユースケースを可能にした。具体的には、モバイルカメラでのリアルタイムビデオスタイル変換や、低帯域幅環境下でのリアルタイムHDビデオアップスケーリングが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。