Skip to main content
QUICK REVIEW

[論文レビュー] No Multiplication? No Floating Point? No Problem! Training Networks for Efficient Inference

Shumeet Baluja, David Marwood|arXiv (Cornell University)|Sep 24, 2018
Topic Modeling参考文献 40被引用数 4
ひとこと要約

本論文では、推論時に浮動小数点演算、乗算、非線形関数の計算を一切行わないように、重みと活性化を小さな離散値の集合に量子化することで、深層ニューラルネットワークを訓練する手法を提案する。訓練中に周期的な適応的クラスタリングを用いることで、分類および回帰タスクでほぼ理想に近い性能を達成し、標準の浮動小数点ネットワークの3分の1未満のモデルサイズにまで削減できる。

ABSTRACT

For successful deployment of deep neural networks on highly--resource-constrained devices (hearing aids, earbuds, wearables), we must simplify the types of operations and the memory/power resources used during inference. Completely avoiding inference-time floating-point operations is one of the simplest ways to design networks for these highly-constrained environments. By discretizing both our in-network non-linearities and our network weights, we can move to simple, compact networks without floating point operations, without multiplications, and avoid all non-linear function computations. Our approach allows us to explore the spectrum of possible networks, ranging from fully continuous versions down to networks with bi-level weights and activations. Our results show that discretization can be done without loss of performance and that we can train a network that will successfully operate without floating-point, without multiplication, and with less RAM on both regression tasks (auto encoding) and multi-class classification tasks (ImageNet). The memory needed to deploy our discretized networks is less than one third of the equivalent architecture that does use floating-point operations.

研究の動機と目的

  • 補聴器やイヤホンなど、極めてリソース制約の厳しいデバイスへの深層ニューラルネットワークのデプロイを可能にすること。
  • 推論時に浮動小数点演算と乗算を排除することで、電力消費とメモリ使用量を低減すること。
  • 重みと活性化の極端な量子化に対しても高いモデル性能を維持すること。
  • 重みを少数の固有値にクラスタリングすることで、ネットワーク容量と効率性のトレードオフを調査すること。
  • 同じアーキテクチャと訓練プロセスを用いても、量子化ネットワークがフル精度モデルと同等またはそれを上回る性能を達成できることを実証すること。

提案手法

  • 出力空間における均一量子化を用いて、ネットワークの活性化を固定された事前定義されたレベル(例:32レベル)に量子化する。
  • 訓練中に周期的な適応的クラスタリングを適用し、すべてのネットワーク重みを少数の固有値(例:100〜1000個)にグループ化することで、メモリ使用量を削減する。
  • 量子化された非線形関数(例:tanhD)に対して、勾配の微分可能近似を用い、元の非量子化関数を通じて逆伝播を行う。
  • 量子化された活性化とクラスタ化された重みの積を事前に計算して格納したルックアップテーブル(LUT)を用いて、乗算演算を置き換える。
  • 乗算および加算ステップのすべての入力が事前に境界が定まっており、既知であることを保証することで、固定小数点演算と効率的なハードウェアマッピングを可能にする。
  • 浮動小数点精度を用いて標準的なバックプロパゲーションでネットワークを訓練するが、最終的なモデルは整数演算と離散値のみを用いてデプロイする。

実験結果

リサーチクエスチョン

  • RQ1推論時に浮動小数点演算、乗算、非線形関数の評価を一切行わない深層ニューラルネットワークを、訓練およびデプロイ可能か?
  • RQ2周期的な適応的クラスタリングによる重みクラスタリングは、メモリ使用量を大幅に削減しながらもモデル精度を維持できるか?
  • RQ3量子化された活性化と重みは、回帰および分類タスクの両方でどれほど高い性能を維持できるか?
  • RQ4量子化は一般化性能にどのような影響を及ぼし、ドロップアウトが存在しない状況で正則化の役割を果たす可能性はあるか?
  • RQ5クラスタリング戦略の選択(グローバル vs. レイヤーごと)が、モデル性能とメモリ効率に与える影響はいかほどか?

主な発見

  • 重みを少数の固有値にクラスタリングすることで、本手法は同等の浮動小数点ネットワークの3分の1未満のモデルメモリサイズにまで削減できた。
  • 量子化ネットワークは、ImageNet分類およびオートエンコーダ回帰タスクの両方で、フル精度ネットワークと同等またはそれ以上の性能を達成した。
  • 周期的な適応的クラスタリングの使用により、極端な量子化下でも安定した訓練が可能となり、多様なアーキテクチャで高い精度を維持できた。
  • 固定小数点演算とルックアップテーブルへの置き換えにより、推論時に浮動小数点演算と乗算の両方の必要性が排除された。
  • 本手法は正則化効果を示し、ドロップアウトを併用するかしないかに関わらず、性能の向上が観察された。
  • 最終的なモデルは、ウェアラブル機器やイヤホンなど、超低消費電力デバイスにデプロイ可能であり、リモート処理を伴わずにオンデバイス推論を実現できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。