Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Hardware Realization of Convolutional Neural Networks using Intra-Kernel Regular Pruning

Maurice Yang, Mahmoud Faraj|arXiv (Cornell University)|Mar 15, 2018
Advanced Neural Network Applications参考文献 21被引用数 5
ひとこと要約

本稿では、畳み込みカーネル内での重みの冗長性を削除しつつも、効率的なハードウェア加速を可能にするための正則なカーネル構造を維持する細分化されたプルーニング手法であるIntra-Kernel Regular (IKR)プルーニングを提案する。本手法は、1%未満の精度低下で最大10倍のパラメータ削減と7倍の計算量削減を達成し、リソース制約のあるハードウェア上でのコンパクトで高効率なCNN推論を可能にする。

ABSTRACT

The recent trend toward increasingly deep convolutional neural networks (CNNs) leads to a higher demand of computational power and memory storage. Consequently, the deployment of CNNs in hardware has become more challenging. In this paper, we propose an Intra-Kernel Regular (IKR) pruning scheme to reduce the size and computational complexity of the CNNs by removing redundant weights at a fine-grained level. Unlike other pruning methods such as Fine-Grained pruning, IKR pruning maintains regular kernel structures that are exploitable in a hardware accelerator. Experimental results demonstrate up to 10x parameter reduction and 7x computational reduction at a cost of less than 1% degradation in accuracy versus the un-pruned case.

研究の動機と目的

  • リソース制約のある環境における深層CNNの増大する計算およびメモリ要件に対処すること。
  • 細分化されたプルーニングの限界を克服し、効率的なハードウェア実装を妨げる不規則なスパarsityを回避すること。
  • 高いスパarsityを達成しつつも、効率的なハードウェアマッピングを可能にする正則なカーネルパターンを維持する構造的プルーニング手法を開発すること。
  • 細分化されたプルーニングの利点とハードウェアフレンドリーなカーネル構造を組み合わせることで、コンパクトで低消費電力なCNN推論を実現すること。
  • IKRプルーニングネットワーク向けに提案されたスパースプロセッシングエンジン(SPE)アーキテクチャを通じて、実用的なハードウェア実現可能性を示すこと。

提案手法

  • 各畳み込みカーネル内で個々の重みレベルでイントラカーネルプルーニングを適用し、冗長なパラメータを削除する。
  • カーネル間で正則なプルーニングパターンを強制することで、構造的正則性を維持し、効率的なハードウェアマッピングを可能にする。
  • 非ゼロ重みとそのマスクインデックスのみを格納するため、メモリフットプリントを最小限に抑えるために圧縮スパースパターン(CSP)フォーマットを採用する。
  • 最適なプルーニングパターンを特定し、モデル精度を保持するためのパターン生成および選択メカニズムを採用する。
  • スケジュールされた学習率を用いた微調整により、プルーニング後の精度回復を実現する。
  • IKRプルーニングされたカーネルが示す正則なスパarsityを効果的に活用できるように、特定のハードウェアアーキテクチャであるスパースプロセッシングエンジン(SPE)を設計する。

実験結果

リサーチクエスチョン

  • RQ1正則なカーネル構造を維持することで、細分化されたプルーニングを効率的なハードウェア加速と適合可能にすることができるか?
  • RQ2イントラカーネル正則プルーニングを用いることで、顕著な精度低下を伴わずにCNNのパラメータと計算量の複雑さをどの程度まで低減できるか?
  • RQ3スパarsity、精度、ハードウェア効率の観点から、既存のプルーニング手法(細分化およびカーネルレベルプルーニング)と比較してIKRプルーニングはどのように異なるか?
  • RQ4構造的CNNプルーニングにおいて、スパarsity、精度、ハードウェア実装可能性の最適なバランスは何か?
  • RQ5IKRプルーニングが生成する正則なスパarsityパターンを効果的に活用できる専用ハードウェアアクセラレータ(SPE)は、高性能かつ低エネルギーな推論を実現できるか?

主な発見

  • IKRプルーニングは、LeNet-5において最大10倍のネットワークパラメータ削減と7倍の計算量削減を達成し、未プルーニングのベースラインと比較して誤差率が0.5%上昇するにとどまった。
  • CIFAR-10データセットを用いた$CNN_{small}$では、IKRプルーニングによりモデルサイズを4倍に、計算量を6倍に削減し、1%の精度低下でFMKプルーニングと同等の重みスパarsityを達成した。
  • IKRプルーニングされたネットワークは、極めて高い精度(未プルーニングモデルと1%以内)を維持したが、これは重要でない重みの効果的な保持を示している。
  • 提案された圧縮スパースパターン(CSP)フォーマットにより、非ゼロ重みとそのマスクインデックスのみを格納することで、IKRプルーニングされたカーネルのコンパクトな保存が可能になった。
  • スパースプロセッシングエンジン(SPE)アーキテクチャは、IKRプルーニングされたカーネルの正則なスパarsityを効果的に活用できるように設計され、高スループットかつ低消費電力の推論を実現した。
  • IKRプルーニングは、粗粒度プルーニング手法よりも精度で優れており、同時にハードウェアフレンドリーな構造を維持しており、スパarsityと効率性のバランスに優れた代替手段を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。