Skip to main content
QUICK REVIEW

[論文レビュー] FLightNNs: Lightweight Quantized Deep Neural Networks for Fast and Accurate Inference

Ruizhou Ding, Zeye Liu|arXiv (Cornell University)|Apr 5, 2019
Advanced Neural Network Applications参考文献 1被引用数 8
ひとこと要約

FLightNNは、軽量化された量子化ニューラルネットワークにおける、各フィルタごとの微分可能でk値選択のメカニズムを導入し、畳み込みフィルタごとにシフトアド演算(k ∈ {1,2})の最適化を動的に可能にした。これにより、精度と遅延・消費電力の連続的で柔軟なトレードオフが実現され、固定k値のLightNNと比較して最大2倍の高速化を達成したが、精度の低下は0.1%にとどまり、FPGAおよびASICプラットフォーム上での4ビット固定小数点量子化よりも速度と精度の両面で優れている。

ABSTRACT

To improve the throughput and energy efficiency of Deep Neural Networks (DNNs) on customized hardware, lightweight neural networks constrain the weights of DNNs to be a limited combination (denoted as $k\in\{1,2\}$) of powers of 2. In such networks, the multiply-accumulate operation can be replaced with a single shift operation, or two shifts and an add operation. To provide even more design flexibility, the $k$ for each convolutional filter can be optimally chosen instead of being fixed for every filter. In this paper, we formulate the selection of $k$ to be differentiable, and describe model training for determining $k$-based weights on a per-filter basis. Over 46 FPGA-design experiments involving eight configurations and four data sets reveal that lightweight neural networks with a flexible $k$ value (dubbed FLightNNs) fully utilize the hardware resources on Field Programmable Gate Arrays (FPGAs), our experimental results show that FLightNNs can achieve 2$ imes$ speedup when compared to lightweight NNs with $k=2$, with only 0.1\% accuracy degradation. Compared to a 4-bit fixed-point quantization, FLightNNs achieve higher accuracy and up to 2$ imes$ inference speedup, due to their lightweight shift operations. In addition, our experiments also demonstrate that FLightNNs can achieve higher computational energy efficiency for ASIC implementation.

研究の動機と目的

  • 既存の軽量化量子化ネットワーク(例:LightNN-1およびLightNN-2)が示す離散的で不連続なパレートフロントの問題を解決し、精度、遅延、エネルギー効率の間の微細なトレードオフを可能にすること。
  • 畳み込みフィルタごとにシフトアド演算の回数(k ∈ {1,2})を最適化することで、より柔軟で連続的なハードウェアリソースのトレードオフを実現すること。
  • 標準的なSGDを用いて、ネットワーク重みとk値をエンドツーエンドで最適化可能な微分可能トレーニング手法を開発すること。
  • 固定k値モデルおよび4ビット固定小数点量子化モデルと比較して、FPGAおよびASICプラットフォーム上での推論速度、エネルギー効率、精度の優位性を実証すること。

提案手法

  • 各畳み込みフィルタのk値選択を微分可能最適化問題として定式化し、確率的勾配降下法(SGD)を用いたエンドツーエンド学習を可能にする。
  • 各フィルタごとに学習可能な離散的k値集合{ k₁, ..., k_F }を導入し、それぞれのk_i ∈ {1,2}として、乗算を置き換えるシフトアド演算の回数を制御する。
  • バックプロパゲーション中に勾配伝播を可能にするために、離散的k選択プロセスの微分可能リラクゼーションを導入し、重みとk値の共同最適化を実現する。
  • パイプライン化され、ハードウェアにやさしい設計を用いて、FPGAおよびASIC上に実装されたFLightNNモデルを実装する。
  • スループット、精度、リソース使用率の評価を目的として、8つの構成と4つのデータセットを用いた広範なFPGA実験を実施する。
  • 計算エネルギー消費量と精度のトレードオフを評価するため、65nm標準セルライブラリを用いたASICシミュレーションを実施する。

実験結果

リサーチクエスチョン

  • RQ1軽量化量子化ネットワークにおけるフィルタごとのk値選択は、精度、遅延、エネルギー効率の連続的で柔軟なパレートフロントを実現できるか?
  • RQ2微分可能トレーニング手法は、エンドツーエンドでネットワーク重みとk値(k ∈ {1,2})を効果的に最適化できるか?
  • RQ3FPGAおよびASICプラットフォーム上での推論速度とエネルギー効率において、FLightNNは固定k値のLightNNおよび4ビット固定小数点量子化モデルを上回るか?
  • RQ4FLightNNは、ハードウェア効率を維持したまま、LightNN-1およびLightNN-2よりも精度とエネルギー効率で優れているか?

主な発見

  • FPGA上では、固定k値のLightNN-2と比較して最大2倍の高速化を達成したが、精度の低下は0.1%にとどまり、優れた推論効率を示した。
  • FPGA上では、4ビット固定小数点量子化よりも高いスループットを達成し、最大2倍の高速化とより高い精度を実現した。
  • FLightNNは、精度対エネルギー/遅延のパレートフロントをより連続的に実現し、テストした全データセットおよびネットワークアーキテクチャにおいて、LightNN-1およびLightNN-2を上回った。
  • ASICシミュレーションの結果、FLightNNはLightNN-1およびLightNN-2よりも低い計算エネルギー消費量を達成し、一部のケースでは高い精度を示した。
  • FLightNNは、LightNN-1およびLightNN-2を上回る精度-ストレージのパレートフロントを実現し、より大きな有効な設計空間を示した。
  • 微分可能トレーニング手法により、反復的またはヒューリスティックな探索を伴わず、効率的なエンドツーエンド最適化が可能となり、トレーニングのオーバーヘッドが削減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。