Skip to main content
QUICK REVIEW

[論文レビュー] Low Latency Neural Networks using Heterogenous Resources on FPGA for the Belle II Trigger

S. Baehr, S. Mccarney|arXiv (Cornell University)|Oct 30, 2019
Particle Detector Development and Performance参考文献 8被引用数 4
ひとこと要約

本論文は、乗算累積(MAC)演算の時間多重スケジューリングとSRAM-LUTとDSPのバランスの取れた使用により、DSPリソース使用量を40%削減したFPGAベースのニューラルz-Vertexトリガを提示する。この手法により、5µsの遅延予算内で2つの並列ニューラルネットワークを実行可能となり、Throughputを向上させつつVirtex UltraScale FPGA上でタイミングクロージャを維持できる。

ABSTRACT

One of the major components of the Belle II trigger system is the neural network trigger. Its task is to estimate the z-Vertex particle tracks observed in the experiments drift chamber. The trigger is implemented on FPGAs to ensure exibility during operation and leverage their IO capabilities. Meanwhile the implementation has to estimate the vertex in a few hundred nanoseconds to fulfil the requirements of the experiment. A first version of that trigger was operational during the first collisions. While it was able to estimate the vertex, it had some drawbacks regarding the possible throughput and timing closure. These are the focus of this work, which modifies the original design to allow two networks running in parallel and less routing congestion. We conducted a rescheduling of multiply and accumulate which are the basic operations in such networks. While the original design tried to parallelize as much as possible, the rescheduling tries to reduce the number of parallel data transmission by reusing processing modules. This way resource consumption was reduced by 40% for DSPs. To further increase the throughput by operating an additional network in parallel, we investigated the balanced use of SRAM-LUTs and DSPs for multiply and accumulate operations. With the found balancing ratio the trigger is able to operate two neural networks in parallel on the targeted FPGA within the required latency.

研究の動機と目的

  • Belle II用の既存のFPGAベースのニューラルz-Vertexトリガにおけるリソース混雑とスループット制限を解決する。
  • 5µsの遅延と31.75 MHzのスループット要件を維持しつつ、DSPリソース消費を削減する。
  • SRAM-LUTとDSP間のリソースバランス最適化により、1つのFPGA上で2つの並列ニューラルネットワークを実行可能にする。
  • MAC演算のクロックサイクル間での再スケジューリングにより、ルーティング効率とタイミングクロージャを向上させる。
  • 将来のアップグレードでより高いトラック処理能力を要する場合にスケーラブルなソリューションを開発する。

提案手法

  • MAC演算を複数のクロックサイクルに分散させることで、並列データ伝送を削減し、処理ユニットの再利用を実現する。
  • 1つのニューロン内および複数のニューロン間でMACの時間多重実行を実装し、リソース要求を最小限に抑える。
  • MAC計算をDSPとSRAM-LUTの間でバランスさせ、40%をLUT、60%をDSPに割り当て、リソースのボトルネックを回避する。
  • レイヤーのインタリーブとパイプライン化により、遅延を低減し、5µsのデッドラインを超えないようリソース利用を最適化する。
  • 時間多重設計におけるマルチプレクサルーティングとクロックサイクル間のデータフローを制御するコントローラを実装する。
  • リソース使用量とタイミング解析を用いて、Virtex UltraScale XCVU080 FPGA上で設計を評価する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークトリガにおけるMAC演算をどのように再スケジューリングすることで、遅延を増加させずにDSPリソース使用量を削減できるか?
  • RQ2低遅延FPGA設計におけるMACユニット実装において、SRAM-LUTとDSPの最適なバランスは何か?
  • RQ3異種リソース使用を用いて、MACの時間多重化により5µsの遅延予算内で2つの並列ニューラルネットワークを実行可能か?
  • RQ4MACの時間多重化はルーティング混雑と全体的な設計のルータビリティにどのように影響するか?
  • RQ5必要な31.75 MHzのスループットと5µsの遅延を維持しつつ、リソース消費をどの程度まで削減できるか?

主な発見

  • MAC演算の時間多重化により、元の並列設計と比較してDSP使用量が40%削減され、297個のDSPベースMACユニットを達成した。
  • 異種実装ではDSPが44%、SRAM-LUTが30%を占めたが、DSPオンリーアプローチではDSPが68%、LUTが17%を占めた。
  • SRAM-LUTとDSPのバランスの取れた使用により、入力値の再利用が可能になり、ルーティング混雑が軽減された。
  • 設計は最大周波数127 MHzを達成し、パイプライン化が増加したにもかかわらず、5µsの遅延制約を満たした。
  • 最適化された設計により、同じFPGA上で2つの並列ニューラルネットワークを実行可能となり、将来的なアップグレードに向けたスループット向上が可能になった。
  • 重要なパスにおけるリソース圧力を軽減し、XCVU080 FPGA上でタイミングクロージャと設計安定性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。