Skip to main content
QUICK REVIEW

[論文レビュー] EDEN: Enabling Energy-Efficient, High-Performance Deep Neural Network Inference Using Approximate DRAM

Skanda Koppula, Lois Orosa|arXiv (Cornell University)|Oct 11, 2019
Ferroelectric and Negative Capacitance Devices被引用数 5
ひとこと要約

EDENは、電圧と遅延を低減した近似DRAMを用いることで、ユーザーが指定したDNN精度を維持しながら、エネルギー効率が高く高性能なディープニューラルネットワーク(DNN)推論を可能にするフレームワークである。DNN再訓練による誤り耐性の向上と、データ型をDRAMパーティションに知的にマッピングする手法を組み合わせ、CPU、GPU、アクセラレータにおいて最大37%のDRAMエネルギー削減と17%の遅延高速化を達成している。

ABSTRACT

The effectiveness of deep neural networks (DNN) in vision, speech, and language processing has prompted a tremendous demand for energy-efficient high-performance DNN inference systems. Due to the increasing memory intensity of most DNN workloads, main memory can dominate the system's energy consumption and stall time. One effective way to reduce the energy consumption and increase the performance of DNN inference systems is by using approximate memory, which operates with reduced supply voltage and reduced access latency parameters that violate standard specifications. Using approximate memory reduces reliability, leading to higher bit error rates. Fortunately, neural networks have an intrinsic capacity to tolerate increased bit errors. This can enable energy-efficient and high-performance neural network inference using approximate DRAM devices. Based on this observation, we propose EDEN, a general framework that reduces DNN energy consumption and DNN evaluation latency by using approximate DRAM devices, while strictly meeting a user-specified target DNN accuracy. EDEN relies on two key ideas: 1) retraining the DNN for a target approximate DRAM device to increase the DNN's error tolerance, and 2) efficient mapping of the error tolerance of each individual DNN data type to a corresponding approximate DRAM partition in a way that meets the user-specified DNN accuracy requirements. We evaluate EDEN on multi-core CPUs, GPUs, and DNN accelerators with error models obtained from real approximate DRAM devices. For a target accuracy within 1% of the original DNN, our results show that EDEN enables 1) an average DRAM energy reduction of 21%, 37%, 31%, and 32% in CPU, GPU, and two DNN accelerator architectures, respectively, across a variety of DNNs, and 2) an average (maximum) speedup of 8% (17%) and 2.7% (5.5%) in CPU and GPU architectures, respectively, when evaluating latency-bound DNNs.

研究の動機と目的

  • メモリ集約的なワークロードに起因するDNN推論における増大するエネルギーと遅延のボトル neck を解消すること。
  • 高性能DNNシステムにおける商用DRAMの限界を、電圧とアクセス遅延を低減した近似メモリを活用することで克服すること。
  • ユーザー定義の精度目標を損なわず、実世界のDNNアクセラレータにおける近似DRAMの実用的導入を可能にすること。
  • DNNデータ型の誤り耐性に基づいて、それらをDRAMパーティションにマッピングする汎用的なフレームワークの開発。
  • CPU、GPU、および特殊なDNNアクセラレータを含む多様なハードウェアプラットフォームにおいて、信頼性とパフォーマンスの向上を確保すること。

提案手法

  • 反復的プロファイリングを用いて、近似DRAMパラメータ(電圧と遅延)を変化させた場合のDNNの誤り耐性を評価する。
  • 再訓練中に段階的にビットエラー率を増加させる新規なカリキュラム再訓練メカニズムを適用し、高エラー率に耐性を持つDNNの構築を促進する。
  • 測定された誤り耐性に基づいて、個々のDNNデータ型(例:重み、活性化)を特定の近似DRAMパーティションにマッピングする。
  • ユーザーが指定した精度目標を満たしつつ、エネルギーと遅延を最小限に抑えるように、データ型の近似DRAM領域へのマッピングを最適化する。
  • VoltronとFlexible-Latency DRAMからの実世界のDRAMエラーモデルを活用し、実用性とハードウェアの関連性を確保する。
  • シミュレーションおよび実ハードウェア評価を通じて、CPU、GPU、Eyeriss、TPUを含む複数のアーキテクチャにフレームワークを統合する。

実験結果

リサーチクエスチョン

  • RQ1電圧と遅延を低減した近似DRAMを用いることで、DNN推論におけるDRAMエネルギー消費を効果的に削減できるか、精度を損なわないか?
  • RQ2近似DRAMが引き起こす高ビットエラー率に耐えられるように、DNNをどのように再訓練すればよいか、かつターゲット精度を維持できるか?
  • RQ3誤り耐性に基づいて、異なるDNNデータ型を個別の近似DRAMパーティションにマッピングする最適な戦略は何か?
  • RQ4EDENは、CPU、GPU、DNNアクセラレータを含む多様なハードウェアプラットフォームにおいて、エネルギーと遅延をどの程度削減できるか?
  • RQ5フレームワークは、最先端のDNNモデルやさまざまな精度制約の下で、どの程度スケーラブルに機能するか?

主な発見

  • EDENは、複数の最先端DNNを対象に、CPUで平均21%、GPUで最大37%、Eyerissで31%、TPUで32%のDRAMエネルギー削減を達成した。
  • 遅延制限のDNNでは、CPUで平均8%(最大17%)、GPUで2.7%(最大5.5%)の速度向上を達成した。
  • カリキュラム再訓練メカニズムにより、DNNの誤り耐性が1桁向上し、高ビットエラー率下でも信頼性のある動作が可能になった。
  • EDENは、電圧と遅延を低減した近似DRAMを用いても、元のモデルと比較して精度を1%以内に維持できた。
  • フレームワークは、さまざまなメモリ技術とハードウェアプラットフォームに広く一般化でき、エネルギー効率とパフォーマンスの両面で一貫した向上を示した。
  • 評価結果から、再訓練と知的なデータパーティショニングマッピングの組み合わせが、高いエネルギー効率とパフォーマンス向上を達成する上で不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。