[論文レビュー] An Image Enhancing Pattern-based Sparsity for Real-time Inference on Mobile Devices
本論文は、パターンと接続性スパarsityを組み合わせた新しいスパarsity次元「パターンベーススパarsity」を導入し、深層ニューラルネットワークにおける高いモデル精度とハードウェア効率を両立することを可能にする。パターンに配慮したプルーニングフレームワークを設計し、コンパイラ最適化コード生成を活用することで、ResNet-18、ResNet-50、VGG-16などの大規模DNNについて、モバイルデバイス上でリアルタイム推論を実現。精度と速度の両面で先行手法を上回る性能を発揮する。
Weight pruning has been widely acknowledged as a straightforward and effective method to eliminate redundancy in Deep Neural Networks (DNN), thereby achieving acceleration on various platforms. However, most of the pruning techniques are essentially trade-offs between model accuracy and regularity which lead to impaired inference accuracy and limited on-device acceleration performance. To solve the problem, we introduce a new sparsity dimension, namely pattern-based sparsity that comprises pattern and connectivity sparsity, and becoming both highly accurate and hardware friendly. With carefully designed patterns, the proposed pruning unprecedentedly and consistently achieves accuracy enhancement and better feature extraction ability on different DNN structures and datasets, and our pattern-aware pruning framework also achieves pattern library extraction, pattern selection, pattern and connectivity pruning and weight training simultaneously. Our approach on the new pattern-based sparsity naturally fits into compiler optimization for highly efficient DNN execution on mobile platforms. To the best of our knowledge, it is the first time that mobile devices achieve real-time inference for the large-scale DNN models thanks to the unique spatial property of pattern-based sparsity and the help of the code generation capability of compilers.
研究の動機と目的
- 構造的および非構造的重みプルーニングにおけるモデル精度とハードウェア効率のトレードオフを解消すること。
- 構造的プルーニングでは精度を犠牲にし、非構造的プルーニングではハードウェア加速を達成できないという既存のプルーニング手法の限界を克服すること。
- 新しいスパarsity次元を導入することで、大規模DNNのモバイルデバイス上でのリアルタイム推論を可能にし、内在的なハードウェア互換性を有すること。
- パターンライブラリ抽出、パターンおよび接続性プルーニング、重み微調整を同時に実行する統合フレームワークを設計すること。
提案手法
- 入力カーネル内パターンスパarsityとカーネル間接続性スパarsityを統合した新しいスパarsity次元「パターンベーススパarsity」を提案する。
- プルーニング問題をADMM最適化問題として定式化し、確率的勾配降下法と正則化を分離するためのプライマルプロキシメソッドを用いて解く。
- 空間的な構造を活かして特徴抽出とモデル精度を向上させる画像強化型カーネルパターンのセットを設計する。
- 命令レベルおよびスレッドレベルの並列性を維持するためのフィルターカーネル再順序化を実装し、最大限のハードウェア加速を実現する。
- TFLite、TVM、MNNを用いて、完全最適化を有効にしたコンパイラー最適化推論パイプラインにパターンベーススパースモデルを統合する。
- コード生成とハードウェアに配慮したコンパイルを活用することで、パターンベーススパarsityの規則性を活かし、リアルタイム推論を実現する。
実験結果
リサーチクエスチョン
- RQ1パターンスパarsityと接続性スパarsityを統合した新しいスパarsity次元が、高いモデル精度とハードウェア効率を両立できるか?
- RQ2慎重に設計されたカーネルパターンが特徴抽出と画像品質を向上させ、モデル性能の向上に寄与するか?
- RQ3パターンベーススパarsityは、モバイルプラットフォーム上で効率的にコンパイル・実行可能であり、リアルタイム推論を可能にするか?
- RQ4本手法のフレームワークは、モバイルデバイス上での精度、圧縮率、推論速度の面で、既存のプルーニング手法と比較してどのように優れているか?
- RQ5パターンに配慮したプルーニングフレームワークは、同時にパターンライブラリ抽出、パターンプルーニング、接続性プルーニング、重み微調整を実行できるか?
主な発見
- ResNet-18を用いたImageNetでは、16倍の圧縮率と8.0倍の高速化を達成し、94.0%のトップ-1精度を実現。モバイルCPU上でリアルタイム推論が可能となった。
- ResNet-50では、16倍の圧縮率で94.2%のトップ-1精度を維持し、5.8倍の高速化を達成。モバイルデバイスでのリアルタイム推論要件を満たした。
- VGG-16では、19.7倍の圧縮率で93.5%のトップ-1精度を達成し、12.0倍の高速化を実現。より深いモデルに対しても有効性を示した。
- パターンベーススパarsityフレームワークにより、すべての評価対象モデル(大規模DNNを含む)において、モバイルCPUおよびGPUでリアルタイム推論(≤33ms/フレーム)が可能となった。
- パターンに配慮したプルーニングフレームワークは、パターンライブラリの抽出に成功し、パターンと接続性の併用プルーニングを実行し、ベースライン手法と比較して精度を維持または向上させた。
- パターンベースモデルのコンパイラー最適化実行により、非最適化ベースラインと比較して最大16倍の高速化を達成。ハードウェアに配慮した設計の有効性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。