Skip to main content
QUICK REVIEW

[論文レビュー] NESTA: Hamming Weight Compression-Based Neural Proc. Engine

Ali Mirzaeian, Houman Homayoun|arXiv (Cornell University)|Oct 1, 2019
Advanced Neural Network Applications参考文献 33被引用数 10
ひとこと要約

NESTA は、3×3 カーネルの 9 個の入力値を並列に処理する階層的ハミング重みコンプレッサーに、従来の乗算累積(MAC)ユニットを置き換えることで、畳み込みニューラルネットワーク(CNN)の推論を高速化する専用のニューラルプロセッシングエンジンである。近似部分和を計算し、残留キャリー補正を最終サイクルまで延期することで、クリティカルパス遅延を短縮し、MACベースの加速器と比較して 33–78% の低いパワー・ディレイ・プロダクト(PDP)を達成している。

ABSTRACT

In this paper, we present NESTA, a specialized Neural engine that significantly accelerates the computation of convolution layers in a deep convolutional neural network, while reducing the computational energy. NESTA reformats Convolutions into $3 imes 3$ batches and uses a hierarchy of Hamming Weight Compressors to process each batch. Besides, when processing the convolution across multiple channels, NESTA, rather than computing the precise result of a convolution per channel, quickly computes an approximation of its partial sum, and a residual value such that if added to the approximate partial sum, generates the accurate output. Then, instead of immediately adding the residual, it uses (consumes) the residual when processing the next batch in the hamming weight compressors with available capacity. This mechanism shortens the critical path by avoiding the need to propagate carry signals during each round of computation and speeds up the convolution of each channel. In the last stage of computation, when the partial sum of the last channel is computed, NESTA terminates by adding the residual bits to the approximate output to generate a correct result.

研究の動機と目的

  • CNN畳み込み層の処理において、従来のMACベースのDNN加速器が示す高い計算エネルギーと遅延を解消すること。
  • 1サイクルあたり9値(3×3カーネル)をバッチ化・圧縮処理することで、データ移動量と部分和生成量を削減すること。
  • 時間的キャリービットと階層的コンプレッサーを用いたキャリーパラレルの延期により、エネルギー効率とスループットを向上させること。
  • 既存のMACベースおよびMAC9ベースのニューラルプロセッシングユニットよりも高い性能と低いPDPを達成すること。

提案手法

  • NESTA は 3×3 畳み込みをバッチ化し、ハミング重みコンプレッサーの階層を用いて、近似部分和と残留キャリービットを並列に計算する。
  • 各サイクルで近似和(S′)と時間的キャリー(P)を計算し、最終サイクルまで最終補正を延期する。
  • 即時のキャリーパラレルを避けて、利用可能な容量がある次のコンプレッサーで残留ビットを消費することで、クリティカルパスを短くする。
  • 最終的な出力は、残留キャリービットを近似和に加算する最終段階の加算処理によって生成される。
  • 乗算器と従来のアダーを回避し、正しい結果を得るために圧縮と1回の最終加算にのみ依存する。
  • NESTA は、AlexNet および VGG を用いたレイアウト後シミュレーションにより、さまざまなMACおよびMAC9設定と比較してスループット、遅延、PDPを評価した。

実験結果

リサーチクエスチョン

  • RQ1圧縮ベースのプロセッシングエンジンは、CNN推論においてエネルギー効率とスループットの面で、従来のMACユニットを上回ることができるか?
  • RQ2時間的キャリービットを用いたキャリー伝搬の延期は、畳み込み計算におけるクリティカルパスと全体の遅延にどのように影響するか?
  • RQ3残留補正付きの近似部分和計算は、DNN加速器におけるパワー・ディレイ・プロダクト(PDP)をどの程度低減できるか?
  • RQ49入力値(3×3カーネル)の階層的圧縮は、標準的なMACユニットと比較して、面積、消費電力、性能にどのような影響を与えるか?

主な発見

  • レイアウト後シミュレーションでは、NESTA はさまざまな9入力MACユニットと比較して、PDPが30–67%低減した。
  • 最良および最悪のMACベース設計と比較して、NESTA はエネルギー効率を33–78%向上させ、スループットを1–37%向上させた。
  • 時間的キャリービットの使用と遅延補正の延期により、キャリー伝搬を各計算サイクル中に回避することで、クリティカルパス遅延が短縮された。
  • AlexNet および VGG のすべてのレイヤーにおいて、NESTA はMAC9および個別のMACユニットの両方を遅延と消費電力の面で上回った。
  • 提案されたアーキテクチャは、最終的な残留補正により正確性を維持しながら、最悪のMAC設定と比較してPDPを最大78%低減した。
  • 9入力圧縮モデルと階層的ハミング重みコンプレッサーを組み合わせたNESTA は、結果の正しさを損なわず、顕著な面積およびエネルギーの削減を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。