Skip to main content
QUICK REVIEW

[論文レビュー] QuTiBench: Benchmarking Neural Networks on Heterogeneous Hardware

Michaela Blott, Lisa Halder|arXiv (Cornell University)|Sep 11, 2019
Advanced Neural Network Applications参考文献 51被引用数 5
ひとこと要約

QuTiBench は、FPGA、GPU、CPU などの異種ハードウェアプラットフォーム上でニューラルネットワークのパフォーマンスを評価することを目的とした、新規のマルチティアードベンチマークスイートである。量子化などのアルゴリズム最適化をサポートし、精度、遅延、エネルギー効率のシステムレベル比較を可能にする。エッジおよび埋め込み環境におけるFPGA、GPU、CPUの間で性能ボトルネックやトレードオフを明らかにし、ハードウェア・ソフトウェア共同設計のためのスケーラブルなフレームワークを提供する。

ABSTRACT

Neural Networks have become one of the most successful universal machine learning algorithms. They play a key role in enabling machine vision and speech recognition for example. Their computational complexity is enormous and comes along with equally challenging memory requirements, which limits deployment in particular within energy constrained, embedded environments. In order to address these implementation challenges, a broad spectrum of new customized and heterogeneous hardware architectures have emerged, often accompanied with co-designed algorithms to extract maximum benefit out of the hardware. Furthermore, numerous optimization techniques are being explored for neural networks to reduce compute and memory requirements while maintaining accuracy. This results in an abundance of algorithmic and architectural choices, some of which fit specific use cases better than others. For system level designers, there is currently no good way to compare the variety of hardware, algorithm and optimization options. While there are many benchmarking efforts in this field, they cover only subsections of the embedded design space. None of the existing benchmarks support essential algorithmic optimizations such as quantization, an important technique to stay on chip, or specialized heterogeneous hardware architectures. We propose a novel benchmark suite, QuTiBench, that addresses this need. QuTiBench is a novel multi-tiered benchmarking methodology that supports algorithmic optimizations such as quantization and helps system developers understand the benefits and limitations of these novel compute architectures in regard to specific neural networks and will help drive future innovation. We invite the community to contribute to QuTiBench in order to support the full spectrum of choices in implementing machine learning systems.

研究の動機と目的

  • 埋め込みシステムにおけるニューラルネットワークのための、アルゴリズム最適化(例:量子化)と異種ハードウェアプラットフォームを包括的に評価するベンチマークの不足に対処すること。
  • 多様なハードウェアおよびソフトウェア構成において、公平で再現可能であるベンチマーク比較を可能にする、標準化されたマルチティアードベンチマーク手法をシステム設計者に提供すること。
  • ニューラルネットワークワークロードを異なる抽象化レベルで分析することで、計算、メモリアクセス、またはデータ移動などのパフォーマンスボトルネックを特定すること。
  • ハードウェア特性とエンドアプリケーションのパフォーマンス・精度の関連を結びつけることで、アルゴリズムとアクセラレータの共同設計を支援すること。
  • FPGA、GPU、CPU、DPUs をカバーするスケーラブルで拡張可能なベンチマークスイートを提供することで、コミュニティ主導のイノベーションを促進すること。

提案手法

  • QuTiBench は、理論的分析、アルゴリズム最適化、システムレベルのパフォーマンス評価をカバーするマルチティアードベンチマーク手法(Ti)を採用している。
  • 量子化などのアルゴリズム最適化をサポートし、精度を保持したまま低精度表現(例:三値、二値)の評価を可能にする。
  • FPGA(ZCU104)、GPU(NVIDIA TX2)、CPU など多様なハードウェアプラットフォーム上でニューラルネットワークを評価し、複数のパフォーマンス指標を用いる。
  • システムレベルのパフォーマンスは、データ移動オーバーヘッド、計算時間、遅延、消費電力、スループット(GOP/s、TOP/s)を含む。
  • パレート曲線を用いて、異なるハードウェアおよびモデル構成における精度、遅延、エネルギー効率のトレードオフを可視化する。
  • MLPerf などの既存の取り組みと統合し、deep500.org にインspired されたインfrastrucure を通じて自動テストと再現性を支援する。

実験結果

リサーチクエスチョン

  • RQ1量子化済みおよびフル精度のニューラルネットワークを実行する際、FPGA、GPU、CPU といった異なるハードウェアプラットフォームは、遅延、スループット、エネルギー効率の観点でどのように比較されるか?
  • RQ2量子化などのアルゴリズム最適化は、精度を損なわずに、異種アクセラレータ上でパフォーマンスを向上させるとともにリソース使用量を削減する程度はどの程度か?
  • RQ3ニューラルネットワーク推論パイプラインにおけるパフォーマンスボトルネックは、計算ユニット、メモリ帯域幅、それともコンponents間のデータ移動に起因するか?
  • RQ4マルチティアードベンチマーク手法は、多様なハードウェアおよびアルゴリズム構成において、精度、遅延、エネルギー効率のトレードオフを効果的に捉えうるか?
  • RQ5DPUs や再構成可能なFPGAといった新興アクセラレータを、エッジコンピューティングおよび埋め込みコンピューティング環境で効果的にサポートするには、ベンチマークフレームワークをどのように拡張できるか?

主な発見

  • GPU は、より最適化されたハードウェアのおかげで、FPGA よりも高い電力効率を示した。アイドル時の消費電力は、TX2 で 5W、ZCU104 で 19.9W であった。
  • GPU の遅延はバッチサイズに応じて 8ms から 1838.5ms の間で変動したが、FPGA の遅延は 9.65ms から 65ms の間で安定しており、FPGA での高いパフォーマンスの一貫性が示された。
  • 量子化により、精度への影響を最小限に抑えながら、顕著なハードウェアコスト削減が可能であることが、先行研究(Blott et al., 2017)で確認されており、埋め込みデプロイメントにおける重要性が裏付けられた。
  • ベンチマークにより、データ移動オーバーヘッドがシステムレベルの遅延の一貫した要因であることが判明し、最適化戦略がオンチップデータストリーミングを考慮すべきであることが示唆された。
  • パレート曲線は、精度とパフォーマンスのトレードオフを効果的に可視化し、異なるネットワークトポロジーおよびハードウェアプラットフォーム間での明確な比較を可能にした。
  • マルチティアードアプローチにより、再帰的層や全結合層のようなボトルネックが特定され、メモリアクセスがシステムパフォーマンスに与える役割が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。