Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Numerical Representations for Deep Neural Networks

Parker Hill, Babak Zamirai|arXiv (Cornell University)|Aug 7, 2018
Numerical Methods and Algorithms参考文献 16被引用数 7
ひとこと要約

本論文は、生産用の大規模モデル(例:GoogLeNet や VGG)において、平均 7.6× の高速化を達成しつつ 1% 未満の精度損失で、深層ニューラルネットワーク(DNN)推論のためのカスタム精度浮動小数点および固定小数点表現を、効率的に探索するための新規手法を提案する。精度を予測するために最終層の活性化値を用いる高速な探索手法を導入し、全範囲の評価を実施せずに、最適な精度設定を迅速に同定可能である。

ABSTRACT

With ever-increasing computational demand for deep learning, it is critical to investigate the implications of the numeric representation and precision of DNN model weights and activations on computational efficiency. In this work, we explore unconventional narrow-precision floating-point representations as it relates to inference accuracy and efficiency to steer the improved design of future DNN platforms. We show that inference using these custom numeric representations on production-grade DNNs, including GoogLeNet and VGG, achieves an average speedup of 7.6x with less than 1% degradation in inference accuracy relative to a state-of-the-art baseline platform representing the most sophisticated hardware using single-precision floating point. To facilitate the use of such customized precision, we also present a novel technique that drastically reduces the time required to derive the optimal precision configuration.

研究の動機と目的

  • 大規模 DNN 推論における数値精度の影響が、効率性と精度に与える影響を理解するという重要なギャップを埋める。
  • 小規模ネットワークの知見が、GoogLeNet や VGG などの生産用大規模 DNN に一般化可能であるという仮定に疑問を呈する。
  • 全範囲評価を必要とせず、高速かつスケーラブルな最適カスタム精度設定を同定するための手法を開発する。
  • 浮動小数点表現が、同等の精度を維持するために固定小数点よりもはるかに少ないビット幅で実現可能であることを示し、大規模モデルにおいて優位であることを示す。
  • 将来の DNN ハードウェアプラットフォームが、精度に配慮した設計により、より高いパフォーマンスとエネルギー効率を達成できるようにする。

提案手法

  • 著者らは、DNN の最終層からの活性化値を用いて、さまざまな精度設定下での精度を推定する予測モデルを導入し、完全な推論実行を減らす。
  • 複数の DNN(例:LeNet、CIFARNET)を用いた交差検証により、アーキテクチャの多様性にわたる一般化を確保する。
  • 2段階の最適化プロセスにより、1回の探索でたった2つの精度設定しか評価しないが、全範囲探索と同等の結果を得られ、探索時間を 170× 短縮する。
  • 予測された精度に基づき、動的に精度設定を調整することで、ターゲット精度(例:99%)を最小限のパフォーマンス損失で達成する。
  • GoogLeNet や VGG を含む大規模 DNN に対して、カスタムアクセラレータファブリック上での速度向上を測定することで、手法の妥当性を検証した。
  • 固定小数点と浮動小数点の両方の表現を、広範な設計空間において体系的に評価し、仮数部と指数部、または整数部・小数部のビット幅を最適なトレードオフを実現するように調整した。

実験結果

リサーチクエスチョン

  • RQ1DNN 推論における精度要件は、小規模モデルから大規模モデルへと一般化可能か、特にネットワークアーキテクチャの違いにかかわらず成り立つか?
  • RQ2GoogLeNet や VGG などの大規模 DNN に適用した場合、固定小数点と浮動小数点の両表現が、精度と効率性の観点でどのように比較されるか?
  • RQ3最終層の活性化に基づく高速で予測可能なモデルが、完全な推論評価を伴わずに、最適な精度設定を正確に同定できるか?
  • RQ4生産用 DNN で高い推論精度を維持するために、固定小数点および浮動小数点表現に必要な最小限の精度は何か?
  • RQ5カスタム精度設計により、精度を損なわず、どの程度の推論速度向上が達成可能か?

主な発見

  • GoogLeNet では、妥当な精度を達成するためには固定小数点表現で 40 ビット以上が必要であり、小規模ネットワークの研究から想定されていたよりも顕著に多い。
  • 17 ビットの浮動小数点表現が、単精度浮動小数点と同等の精度を達成する一方で、ハードウェア面積と消費電力が著しく削減される。
  • 提案手法の探索時間は、全範囲探索と同等の結果を得ながらも、170× 短縮され、1回の探索でたった2つの設定しか評価しない。
  • GoogLeNet、VGG およびその他の大規模 DNN における平均的な推論速度向上は 7.6× であり、精度低下は 1% 未満にとどまる。
  • 浮動小数点表現は、大規模モデルにおいて固定小数点よりも効率的であり、精度を維持するために必要なビット数が少ない。
  • 予測モデルは、実際の精度と相関係数 0.96 を達成し、計算コストを最小限に抑えつつ、信頼性の高い精度設定選定が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。