Skip to main content
QUICK REVIEW

[論文レビュー] Open-source FPGA-ML codesign for the MLPerf Tiny Benchmark

Hendrik Borras, Giuseppe Di Guglielmo|arXiv (Cornell University)|Jun 23, 2022
Anomaly Detection Techniques and Applications被引用数 5
ひとこと要約

本論文は、hls4ml および FINN を用いて、MLPerf Tiny 推論ベンチマーク向けに量子化されたニューラルネットワークを最適化する、オープンソースでエンドツーエンドの FPGA-ML コデザインワークフローを提示する。このアプローチにより、Pynq-Z2 および Arty A7-100T プラットフォーム上で、推論遅延が 20 μs 未満、1 推論あたりの消費エネルギーが 30 μJ にまで低減され、量子化に配慮した学習、ハイパララメータ最適化、およびハードウェアに配慮したモデル圧縮を組み合わせることで、高い効率性と設定の柔軟性を実証した。QONNX を共通の交換フォーマットとして用いることで、柔軟な量子化ニューラルネットワークの実装を可能にした。

ABSTRACT

We present our development experience and recent results for the MLPerf Tiny Inference Benchmark on field-programmable gate array (FPGA) platforms. We use the open-source hls4ml and FINN workflows, which aim to democratize AI-hardware codesign of optimized neural networks on FPGAs. We present the design and implementation process for the keyword spotting, anomaly detection, and image classification benchmark tasks. The resulting hardware implementations are quantized, configurable, spatial dataflow architectures tailored for speed and efficiency and introduce new generic optimizations and common workflows developed as a part of this work. The full workflow is presented from quantization-aware training to FPGA implementation. The solutions are deployed on system-on-chip (Pynq-Z2) and pure FPGA (Arty A7-100T) platforms. The resulting submissions achieve latencies as low as 20 $μ$s and energy consumption as low as 30 $μ$J per inference. We demonstrate how emerging ML benchmarks on heterogeneous hardware platforms can catalyze collaboration and the development of new techniques and more accessible tools.

研究の動機と目的

  • オープンソースツールを用いて、小さな機械学習ワークロード向けに効率的で低遅延かつ低消費電力な FPGA 基盤の推論を実証すること。
  • 量子化ニューラルネットワークの FPGA 上でのデプロイメントを統一的かつオープンなワークフローとして提供することにより、AI-ハードウェアのコデザインの民主化を実現すること。
  • キーワード検出、異常検知、画像分類のベンチマークにおいて、モデルのパフォーマンス、遅延、リソース使用量を最適化すること。
  • レイヤーフュージョン、FIFO バッファチューニング、および柔軟な量子化ニューラルネットワークを可能にする共通の QONNX フォーマットを含む、新規の最適化手法を開発・統合すること。
  • SoC および純粋な FPGA プラットフォームの両方で、量子化に配慮した学習から FPGA デプロイまでをカバーする再現可能でエンドツーエンドのパイプラインを確立すること。

提案手法

  • QKeras および Brevitas を用いて量子化に配慮した学習(QAT)を実施し、1〜12ビットの低精度固定小数点推論を可能にした。
  • Determined AI および KerasTuner を用いたハイパララメータ最適化により、精度、遅延、リソース使用量のバランスを取ったモデルアーキテクチャの探索を実施した。
  • レイヤーフュージョンや FIFO バッファチューニングを含む、ハードウェアに配慮した最適化を適用し、スループットの向上と遅延の低減を実現した。
  • hls4ml および FINN を用いて Python API を介してモデルを合成し、Pynq-Z2 および Arty A7-100T FPGA 上での検証、点検、デプロイメントを実施した。
  • QONNX を共通の交換フォーマットとして用いることで、ツール間での量子化ニューラルネットワークの表現を標準化した。
  • Joulescope JS110 およびカスタム電力モニタリングセットアップを用いて、遅延および消費エネルギーを測定する統一されたベンチマーキングパイプラインを実装した。

実験結果

リサーチクエスチョン

  • RQ1オープンソースの FPGA-ML コデザインワークフローは、どのようにして小さな機械学習推論において超低遅延および低消費電力の実現を達成できるか?
  • RQ2量子化に配慮した学習およびハードウェアに配慮したモデル圧縮は、リソース制限のある FPGA において、どの程度パフォーマンスを向上させられるか?
  • RQ3QONNX を用いた統一的でオープンソースのワークフローは、hls4ml および FINN ツールチェーン間での相互運用性と再現可能性をどのように実現できるか?
  • RQ4FPGA アクcelレートされた小さな機械学習において、モデルの精度、遅延、エネルギー効率の最適なトレードオフは何か?
  • RQ5ハイパララメータ最適化およびデザインスペース探索の統合は、FPGA 基盤の機械学習デプロイメントの効率性をどのように向上させるか?

主な発見

  • FPGA 実装は、MLPerf Tiny ベンチマークのすべての3つのタスクで、遅延が 20 μs 未満にまで低減され、高いスループットを実現した。
  • 消費エネルギーは、1 推論あたり 30 μJ まで低減され、顕著なエネルギー効率の高さが示された。
  • 実装は、基準モデルと同等の精度または AUC を維持しており、極端な量子化にもかかわらず、パフォーマンスの著しい低下がないことが確認された。
  • Arty A7-100T FPGA 唯一のプラットフォームとして、MLPerf Tiny 提出において初めて使用されたことで、デプロイの柔軟性が拡張された。
  • レイヤーフュージョンおよび FIFO バッファ最適化の統合により、ハードウェアの利用効率が向上し、遅延が顕著に低減された。
  • QONNX を含むオープンソースワークフローにより、完全な再現性が達成され、産学の協働を促進した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。