Skip to main content
QUICK REVIEW

[論文レビュー] A Competitive Edge: Can FPGAs Beat GPUs at DCNN Inference Acceleration in Resource-Limited Edge Computing Applications?

Ian Colbert, Jake Daly|arXiv (Cornell University)|Jan 30, 2021
Generative Adversarial Networks and Image Synthesis参考文献 25被引用数 8
ひとこと要約

本稿では、リソース制限のあるエッジデバイスにおける効率的なディコンボリューショナルニューラルネットワーク(DCNN)推論のための、空間的・時間的並列化されたFPGAアクセラレータを提案する。ゼロパディングを不要とするデコンボリューションアルゴリズムをマイクロアーキテクチャ的革新と統計的分析で最適化することで、MNISTおよびCelebAデータセットにおいて、NVIDIA Jetson TX1 GPUよりも高いスループット対消費電力比と低いランタイムごとの性能ばらつきを達成した。

ABSTRACT

When trained as generative models, Deep Learning algorithms have shown exceptional performance on tasks involving high dimensional data such as image denoising and super-resolution. In an increasingly connected world dominated by mobile and edge devices, there is surging demand for these algorithms to run locally on embedded platforms. FPGAs, by virtue of their reprogrammability and low-power characteristics, are ideal candidates for these edge computing applications. As such, we design a spatio-temporally parallelized hardware architecture capable of accelerating a deconvolution algorithm optimized for power-efficient inference on a resource-limited FPGA. We propose this FPGA-based accelerator to be used for Deconvolutional Neural Network (DCNN) inference in low-power edge computing applications. To this end, we develop methods that systematically exploit micro-architectural innovations, design space exploration, and statistical analysis. Using a Xilinx PYNQ-Z2 FPGA, we leverage our architecture to accelerate inference for two DCNNs trained on the MNIST and CelebA datasets using the Wasserstein GAN framework. On these networks, our FPGA design achieves a higher throughput to power ratio with lower run-to-run variation when compared to the NVIDIA Jetson TX1 edge computing GPU.

研究の動機と目的

  • モバイルおよびエッジコンピューティング環境における、低消費電力でデバイス内での推論が可能な深層生成モデルの需要に対応すること。
  • Prunedモデルに一般的に見られる非構造的スパarsityおよび条件付き実行パターンに対処できないGPUの限界を克服すること。
  • リソース制限のあるFPGA向けに、電力効率が高く再構成可能なハードウェアアクセラレータを設計すること。
  • DCNNにおける重みプルーニングを適用する際の、ハードウェア性能と生成品質のトレードオフをバランスさせること。
  • FPGAが、DCNN推論タスクにおけるスループット対消費電力効率において、最適化されたエッジGPUでさえも上回ることを実証すること。

提案手法

  • Zhangら[26]のゼロ挿入なしデコンボリューションアルゴリズムを採用し、リソース使用量の削減とハードウェア内でのデータフローの最適化を図る。
  • 空間的タイリングと時間的パイプライン処理を併用した、空間的・時間的並列化アーキテクチャを実装し、メモリアクセスと計算の効率を高める。
  • 実行時依存関係計算を排除するための事前処理としてのモジュロ算術処理を適用し、スループットを向上させる。
  • オンチップバッファリングとメモリ階層最適化を統合し、外部メモリアクセスを最小限に抑え、遅延を低減する。
  • 非構造的重みプルーニングの過程で、生成品質と実行速度のバランスを取るためにMMDに基づく最適化指標(式6)を用いる。
  • 高次元統計的分析を実施し、スパarsityが性能とモデル忠実度に与える影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1エッジアプリケーションにおけるDCNN推論において、FPGAベースアクセラレータはGPUよりも高いスループット対消費電力効率を達成できるか?
  • RQ2非構造的重みプルーニングは、FPGAアクセラレートDCNN推論における生成品質とハードウェア性能にどのように影響を与えるか?
  • RQ3リソース使用量を削減しつつ高いスループットを維持するための、FPGAベースDCNNアクセラレータで最も効果的なアーキテクチャ的最適化は何か?
  • RQ4GPUワークロードと比較して、FPGAがネイティブにサポートする条件付き実行(例:ゼロスキップ)は、スパースでプルーニングされたモデルの性能にどの程度向上効果をもたらすか?
  • RQ5FPGAアクセラレートGAN推論において、推論速度と生成品質のバランスを取る最適なスパarsityレベルは存在するか?

主な発見

  • FPGAベースアクセラレータは、MNISTおよびCelebAの両DCNNにおいて、NVIDIA Jetson TX1 GPUよりも高いスループット対消費電力比を達成した。
  • GPUと比較して、性能のランタイムごとのばらつきが低く、さまざまなワークロード下でも高い一貫性を示した。
  • 提案されたアルゴリズム的およびアーキテクチャ的最適化により、先行手法と比較してリソース使用量が削減され、データフロー効率が向上した。
  • 非構造的重みプルーニングによりゼロスキップが実現され、顕著な高速化が達成されたが、MMD距離で測定した生成品質は劣化した。
  • 提案されたMMDに基づく最適化指標(式6)により、性能と品質のトレードオフのピーク点が特定され、バランスの取れたスパarsity選択が可能になった。
  • FPGA実装は条件付き実行においても安定した性能を維持したのに対し、GPUはこのようなワークロードで非効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。