Skip to main content
QUICK REVIEW

[論文レビュー] High Performance Computing with FPGAs and OpenCL

Hamid Reza Zohouri|arXiv (Cornell University)|Oct 23, 2018
Parallel Computing and Optimization Techniques参考文献 58被引用数 10
ひとこと要約

この論文は、OpenCLおよびハイレベル合成を用いたFPGAアクセラレーションが、特にステンシル計算において、CPUやGPUを凌駂数の高性能コンピューティング(HPC)性能を達成できることを示している。空間的および時間的ブロッキングを組み合わせることで、入力サイズやステンシルの次数に制限がない2次元および3次元ステンシルの、これまでで最も高い単一FPGA性能を達成し、ワークロード全体にわたる優れたパワー効率とスケーラビリティを実現した。

ABSTRACT

In this work we evaluate the potential of FPGAs for accelerating HPC workloads as a more power-efficient alternative to GPUs. Using High-Level Synthesis and a large set of optimization techniques, we show that FPGAs can achieve better performance than CPUs, and better power efficiency than both CPUs and GPUs for typical HPC workloads. Furthermore, we show that for the specific case of stencil computation, the unique architectural advantages of FPGAs allow them to surpass high-end CPU, Xeon Phi and GPU devices. Unlike previous work, our FPGA-based stencil accelerator combines spatial blocking with temporal blocking to achieve high performance without restricting input size. With support for high-order stencils, we achieve the highest single-FPGA performance for 2D and 3D stencil computation of any order, to this day.

研究の動機と目的

  • HPCワークロードにおけるGPUやCPUの代替として、FPGAがどのように省電力的であるかを評価すること。
  • 従来のFPGAアクセラレータが入力サイズやステンシル次数に制限を受けていた問題を克服すること。
  • OpenCLおよびハイレベル合成を用いて、ステンシル計算のための高性能でスケーラブルなFPGAベースアクセラレータを開発すること。
  • 最新のCPU、GPU、Xeon Phiデバイスと比較して、優れた性能とエネルギー効率を達成すること。
  • 入力サイズの制限なしに高次のステンシルをサポートすることで、HPC分野への応用範囲を広げること。

提案手法

  • OpenCLカーネルからFPGAハードウェアを生成するためのハイレベル合成(HLS)を採用し、迅速なプロトタイピングと移植性を実現した。
  • オンチップのブロックRAMとオフチップのDDRメモリを組み合わせたハイブリッドメモリアクセス戦略を実装し、データ局所性を最適化した。
  • 空間的ブロッキングを適用して計算ドメインをオンチップメモリに収まるタイルに分割し、オフチップメモリアクセスを削減した。
  • 時間的ブロッキングを統合して、同じタイル内で複数の演算にわたるデータ再利用を実現し、重複するメモリアクセスを最小限に抑えた。
  • データ並列性と高い算術強度を活用するパイプライン化された並列アーキテクチャを設計し、ステンシル計算に最適化した。
  • OpenCLカーネルを用いてアルゴリズムを表現し、データ移動とメモリ階層に対する明示的制御を可能にし、細かい最適化を実現した。

実験結果

リサーチクエスチョン

  • RQ1FPGAは、一般的なHPCワークロードにおいて、CPUやGPUを上回る性能と優れたパワー効率を達成できるか?
  • RQ2空間的および時間的ブロッキングを組み合わせることで、入力サイズに制限がないステンシル計算において、FPGAの性能がどのように向上するか?
  • RQ32次元および3次元のさまざまな次数のステンシル計算において、FPGAはハイエンドCPU、Xeon Phi、GPUをどれほど上回るか?
  • RQ4HPC分野におけるFPGAアクセラレーションにOpenCLとHLSを用いることで、性能とエネルギー効率にどの程度の向上が得られるか?
  • RQ51つのFPGAアクセラレータが、さまざまな問題サイズにおいて高次のステンシルを効率的に処理できるか?

主な発見

  • 本FPGAアクセラレータは、任意の次数の2次元および3次元ステンシル計算において、これまでに報告された最高の単一FPGA性能を達成した。
  • 2次元および3次元ステンシル計算において、FPGAはハイエンドCPU、Xeon Phi、GPUデバイスを性能面およびエネルギー効率面で上回った。
  • 空間的および時間的ブロッキングの組み合わせにより、入力サイズに制限がない高パフォーマンスを実現し、従来のFPGAアクセラレータの主な制限要因を克服した。
  • 優れたエネルギー効率を達成し、HPCワークロードにおいてGPUやCPUよりもより省電力的な代替手段としてのFPGAの可能性を示した。
  • OpenCLベースのHLSアプローチにより、複雑なステンシルカーネルにおいても迅速な開発と移植性を実現しながら、競争力のある性能を達成した。
  • アクセラレータは高次のステンシルを効果的にサポートしており、科学的計算ワークロードへの応用範囲を広げた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。