Skip to main content
QUICK REVIEW

[論文レビュー] NullaNet: Training Deep Neural Networks for Reduced-Memory-Access Inference

Mahdi Nazemi, Ghasem Pasandi|arXiv (Cornell University)|Jul 23, 2018
Advanced Neural Network Applications被引用数 12
ひとこと要約

NullaNetは、活性化を二値に制約することで、深層ニューラルネットワークの層をブール論理関数に変換する新しいトレーニング手法を提案する。論理最適化によりメモリフリーの推論を実現し、メモリアクセスを最大2,095倍削減し、計算コストを77%削減。浮動小数点演算とDRAMアクセスを排除することで、精度の損失を最小限に抑えつつFPGA上で高い効率性を達成する。

ABSTRACT

Deep neural networks have been successfully deployed in a wide variety of applications including computer vision and speech recognition. However, computational and storage complexity of these models has forced the majority of computations to be performed on high-end computing platforms or on the cloud. To cope with computational and storage complexity of these models, this paper presents a training method that enables a radically different approach for realization of deep neural networks through Boolean logic minimization. The aforementioned realization completely removes the energy-hungry step of accessing memory for obtaining model parameters, consumes about two orders of magnitude fewer computing resources compared to realizations that use floatingpoint operations, and has a substantially lower latency.

研究の動機と目的

  • モバイルデバイスなどのエネルギー制約のあるプラットフォームにおいて、深層ニューラルネットワーク(DNN)の高いエネルギー消費と遅延コストを低減すること。
  • 推論中にモデルパラメータのメモリアクセスを排除するため、DNNの層を二値活性化を持つブール関数に再定義すること。
  • 顕著な精度の低下を伴わずに、計算リソースおよびメモリリソースの使用量を大幅に削減すること。
  • 浮動小数点演算ではなくブール論理最適化を用いたハードウェア実装によるDNNの効率的実現を達成すること。
  • 完全精度の重みを保持しつつ、超低メモリアクセスおよび低消費電力を実現できることを示すこと。

提案手法

  • DNNの各層を二値入出力活性化を持つものにトレーニングし、各層を多入力・多出力のブール関数に変換する。
  • オフラインシミュレーションを用いて、二値入力下での各ニューロンの活性化動作の真理値表を抽出する。
  • ブール論理最小化アルゴリズムを適用し、各ニューロンの論理関数を最適化し、ハードウェアの複雑さを低減する。
  • テクノロジーマッピングとFPGA合成を用いて最適化されたブール関数を実装し、浮動小数点演算を回避する。
  • パイプライン処理と並列処理を活用し、FPGA上で低遅延・高スループットの推論を実現する。
  • 完全精度の浮動小数点重みおよびバイアスを保持し、量子化に起因する精度損失を回避する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークの推論を、モデルパラメータのメモリアクセスなしに行うことは可能か?
  • RQ2ブール論理最適化は、DNNにおけるハードウェアリソース使用量と遅延をどの程度削減できるか?
  • RQ3量子化または二値化されたネットワークと比較して、完全精度の重みを保持した場合の精度への影響はいかほどか?
  • RQ4MAC演算をブール論理に置き換えた場合、エネルギー効率と計算コストの削減はどの程度得られるか?
  • RQ5提案手法は、重みのメモリアクセスを完全に排除しながら、高い精度を達成できるか?

主な発見

  • NullaNetは、32ビット浮動小数点実装と比較して、CNNで最大2,095倍のメモリアクセス削減を達成。1入力パッチあたり110ビットのアクセスと比較し、28.13 KBのアクセスを削減。
  • 全ネットワーク全体で、メモリアクセスを77%、MAC演算を76%削減。全精度ベースラインと比較。
  • ハードウェア実装では15,990個のALMと41.77 mWの消費電力を要し、遅延は14.26 ns。単精度および半精度MACと比較して、それぞれ0.41倍および0.67倍の遅延を達成。
  • 最適化されたISF(含意固有関数)を用いた場合、標準的なドット積計算と比較して分類精度は0.29%低下。活性化を二値化した場合、0.79%の低下を示した。
  • 重みのメモリアクセスを完全に排除し、DRAMアクセスのエネルギーコスト(1ビットあたり最大13,000倍の正規化エネルギー)を解消できる。
  • 浮動小数点ベースのDNN実装と比較して、計算リソース使用量を2桁低減し、精度の損失は最小限に抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。