[論文レビュー] Heterogeneous FPGA+GPU Embedded Systems: Challenges and Opportunities
本稿では、エッジコンピューティングにおけるパフォーマンスとエネルギー効率を最適化するため、異種のFPGA+GPU組み込みシステムを提案する。FPGAアクセラレーションのためのストリームコンピューティングフレームワーク、パフォーマンス/パワーのモデリング技術、および動的タスクスケジューリング戦略を導入し、画像ヒストограм、密行列・スパース行列のベクトル乗算ワークロードにおいて、両アクセラレータを並列に実行した場合に1.79倍のスループット向上と2.29倍のエネルギー効率向上を達成した。
The edge computing paradigm has emerged to handle cloud computing issues such as scalability, security and low response time among others. This new computing trend heavily relies on ubiquitous embedded systems on the edge. Performance and energy consumption are two main factors that should be considered during the design of such systems. Focusing on performance and energy consumption, this paper studies the opportunities and challenges that a heterogeneous embedded system consisting of embedded FPGAs and GPUs (as accelerators) can provide for applications. We study three design, modeling and scheduling challenges throughout the paper. We also propose three techniques to cope with these three challenges. Applying the proposed techniques to three applications including image histogram, dense matrix-vector multiplication and sparse matrix-vector multiplications show 1.79x and 2.29x improvements in performance and energy consumption, respectively, when both FPGA and GPU execute the corresponding application in parallel.
研究の動機と目的
- IoTおよび組み込みシステムにおける高パフォーマンスで低消費電力なエッジコンピューティングの増大するニーズに対応する。
- 最適なパフォーマンスとエネルギー効率を達成するための、異種FPGA+GPUシステムの設計、モデリング、スケジューリングの課題を克服する。
- 組み込みFPGAとGPU間での効率的なタスクオフロードを可能にする体系的な手法を開発する。
- 画像処理やスパース/密行列演算を含む実世界ワークロードにおける共同実行の利点を実証する。
提案手法
- 高水準合成(HLS)ツールを用いたストリームコンピューティングエンジンを提案し、多様なアプリケーションを組み込みFPGAに効率的にマッピングする。
- FPGAおよびGPUワークロードの実行特性を予測するためのパフォーマンスおよびパワーのモデリング技術を開発する。
- データサイズおよびプラットフォームの能力に基づいて、ワークロードをFPGAとGPUの間で分割する動的タスクスケジューリングアルゴリズムを設計する。
- 画像ヒストограм、密行列ベクトル乗算(DeMV)、スパース行列ベクトル乗算(SpMV)の3つのアプリケーションでフレームワークを実装および評価する。
- 共有アドレス空間を介したゼロコピーメモリアクセスを活用し、PCIeのオーバーヘッドを排除してメモリ帯域幅の利用効率を向上させる。
- FPGA設計におけるループアンローリングおよびパイプライン化技術を適用し、高いスループットと低イニシャリゼーションインターバル(II=1)を達成する。
実験結果
リサーチクエスチョン
- RQ1異種FPGA+GPU組み込みシステムは、単独のアクセラレータと比較して、どのようにしてより優れたパフォーマンスとエネルギー効率を達成できるか?
- RQ2HLSツールを用いたFPGAアクセラレーションのための、多様なワークロードを効率的に行う体系的な設計手法は何か?
- RQ3共有メモリの組み込みシステムにおいて、FPGAおよびGPU部品のパフォーマンスとエネルギー消費を正確にモデリングするにはどうすればよいか?
- RQ4並列タスクをFPGAとGPUの間で最適に分割するスケジューリング戦略は何か? これにより、実行時間とエネルギー消費を最小限に抑えることができるか?
主な発見
- 提案されたFPGA+GPU協働処理は、GPU単体実行と比較して1.79倍のパフォーマンス向上と2.29倍のエネルギー効率向上を達成した。
- 画像ヒストグラムワークロードでは、Zynq MPSoC FPGAはJetson TX1 GPUと比較して顕著に低い電力消費(最大5.2倍少ない)を示した。
- DeMVアプリケーションでは、ZynqとJetsonの間でタスクを分割した場合、GPU単体実行と比較して1.48倍のパフォーマンス向上と1.19倍のエネルギー効率向上が得られた。
- SpMVワークロードでは、大容量データに対してJetsonはZynq MPSoCよりも3.2倍のスループット向上を示したが、FPGAとGPUを併用した場合、1.46倍のパフォーマンス向上と1.23倍のエネルギー効率向上が得られた。
- ループアンローリング後のFPGAベースの設計はII=1を達成し、最大スループットを実現し、パイプラインのボトルネックを排除した。
- ゼロコピーアクセスを備えた共有メモリアーキテクチャは、プロセッサ間通信のオーバーヘッドを低減し、メモリ帯域幅の利用効率を向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。