Skip to main content
QUICK REVIEW

[論文レビュー] ADaPTION: Toolbox and Benchmark for Training Convolutional Neural Networks with Reduced Numerical Precision Weights and Activation

Moritz B. Milde, Daniel Neil|arXiv (Cornell University)|Nov 13, 2017
Model Reduction and Neural Networks被引用数 8
ひとこと要約

ADaPTIONは、固定小数点演算を用いて重みと活性化の両方の精度を低減した畳み込みニューラルネットワークの学習および量子化を可能にするCaffeベースのツールボックスです。VGG16を16ビット固定小数点に量子化した場合、SOTA(最先端)のImageNet Top-1精度(0.8%以内の低下)を達成するとともに、スパarsityを最大50%まで向上させ、NullHopのような固定小数点ハードウェアアクセラレータ上で効率的な推論を可能にします。

ABSTRACT

Deep Neural Networks (DNNs) and Convolutional Neural Networks (CNNs) are useful for many practical tasks in machine learning. Synaptic weights, as well as neuron activation functions within the deep network are typically stored with high-precision formats, e.g. 32 bit floating point. However, since storage capacity is limited and each memory access consumes power, both storage capacity and memory access are two crucial factors in these networks. Here we present a method and present the ADaPTION toolbox to extend the popular deep learning library Caffe to support training of deep CNNs with reduced numerical precision of weights and activations using fixed point notation. ADaPTION includes tools to measure the dynamic range of weights and activations. Using the ADaPTION tools, we quantized several CNNs including VGG16 down to 16-bit weights and activations with only 0.8% drop in Top-1 accuracy. The quantization, especially of the activations, leads to increase of up to 50% of sparsity especially in early and intermediate layers, which we exploit to skip multiplications with zero, thus performing faster and computationally cheaper inference.

研究の動機と目的

  • モバイルおよび組み込みデバイスにおけるエネルギー効率的でメモリ消費量の少ない推論の増大するニーズに対応するため、CNNの低精度学習を可能にすること。
  • 既存のツールボックスが固定小数点活性化量子化をサポートしていないという制限を克服し、スパース計算およびハードウェア効率の鍵となる要因を提供すること。
  • 多様でカスタマイズ可能なネットワークアーキテクチャを用いて、CNNアクセラレータの評価を標準化したベンチマークフレームワークを提供すること。
  • 正確なビット幅制御と動的レンジ認識量子化を可能にすることで、NullHopのような固定小数点ハードウェアアクセラレータ上で、量子化モデルのエンドツーエンドデプロイメントを支援すること。
  • 特に初期層および中間層において、活性化および重みのスパarsityを高めることで、ハードウェア効率を向上させ、より高速で低消費電力の推論を実現すること。

提案手法

  • Caffeディープラーニングフレームワークに、固定小数点量子化を前方および逆伝搬の両方で適用する3つの新しい低精度レイヤー型(LPInnerProduct、LPConvolution、LPAct)を拡張した。
  • 重みと活性化の固定小数点フォーマット(例:Q1.15)と丸め戦略を定義するための3つの設定可能なパラメータ(BD(小数点前)、AD(小数点後)、丸め方式)を導入した。
  • 重みと活性化の観察された動的レンジに基づき、整数部と小数部の間で利用可能なビット数をレイヤーごとに動的に割り当てる戦略を実装した。
  • ユーザーが指定した精度と丸め方式を用いて、事前学習済みの高精度モデルのファインチューニングおよび新規からの学習を両方可能にした。
  • 固定小数点ハードウェアアクセラレータ向けに、量子化済みモデルをNullHop互換のファイル形式にエクスポートするパイプラインを提供した。
  • 固定小数点アクセラレータの評価を支援するため、1フレームあたり1 GOpで、36時間の学習後にImageNet Top-1精度38%を達成する新しいベンチマークネットワーク「Giga1Net」を開発した。

実験結果

リサーチクエスチョン

  • RQ1重みと活性化の両方を固定小数点で量子化することで、深層CNNにおいて高い分類精度を維持しつつ、効率的なハードウェアデプロイメントを実現できるか?
  • RQ2整数部と小数部の間でレイヤーごとに動的にビット数を割り当てる戦略が、低精度ネットワークにおけるモデル精度とスパarsityに与える影響は何か?
  • RQ3活性化の量子化がどれほどスパarsityを高めるか、そしてこのスパarsityは、固定小数点アクセラレータ上でより高速で低消費電力の推論を実現するためにどのように活用できるか?
  • RQ4ADaPTIONは、Ristrettoのような既存のツールボックスと比較して、固定小数点活性化量子化およびハードウェア互換のモデルデプロイメントをどの程度優れているか?
  • RQ5Giga1Netのような新規でカスタマイズ可能なベンチマークネットワークは、新興のCNNアクセラレータハードウェア設計の評価に現実的で多様なテストベッドとして機能できるか?

主な発見

  • ADaPTIONは、重みと活性化の両方を16ビット固定小数点精度に量子化したCNNの学習を可能にし、VGG16に適用した場合、ImageNet Top-1精度がわずか0.8%低下するにとどまった。
  • 活性化の量子化により、スパarsityが最大50%まで向上し、特に初期層および中間層で顕著であった。これにより、推論時にゼロ値乗算を効率的にスキップできるようになった。
  • ADaPTIONの動的ビット割り当て戦略は、精度と動的レンジの両立に効果的に寄与し、重みと活性化の動的レンジが著しく異なる場合でも、正確な量子化を可能にした。
  • ADaPTIONは、NullHopのようなプラットフォームでスパarsityとハードウェア加速を可能にするために不可欠な固定小数点活性化量子化をサポートする点で、Ristrettoを上回った。
  • ADaPTIONを用いて学習されたGiga1Netベンチマークネットワークは、GTX980 Tiで36時間の学習後、ImageNetで38%のTop-1精度を達成し、1フレームあたり1 GOpの計算コストを有した。
  • このツールボックスはCaffeと完全に互換性があり、事前学習済みモデルのファインチューニングと新規からの学習の両方をサポートしており、固定小数点ハードウェアアクセラレータへの柔軟なデプロイメントを可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。