Skip to main content
QUICK REVIEW

[論文レビュー] Fully Integrated On-FPGA Molecular Dynamics Simulations

Chen Yang, Tong Geng|arXiv (Cornell University)|May 14, 2019
Parallel Computing and Optimization Techniques参考文献 31被引用数 8
ひとこと要約

本論文は、短距離および長距離力、結合相互作用、運動更新、粒子移動を含むすべての分子動力学(MD)計算を1つのFPGA上ですべて実行する、最初の完全統合型オンFPGA MDシミュレーションエンジンを提示する。これにより、外部メモリへのデータ転送が不要となり、23.5K粒子のDFHR系で1日あたり630 nsの性能を達成し、最先端のGPU実装を40%以上上回る性能を発揮する。

ABSTRACT

The implementation of Molecular Dynamics (MD) on FPGAs has received substantial attention. Previous work, however, has consisted of either proof-of-concept implementations of components, usually the range-limited force; full systems, but with much of the work shared by the host CPU; or prototype demonstrations, e.g., using OpenCL, that neither implement a whole system nor have competitive performance. In this paper, we present what we believe to be the first full-scale FPGA-based simulation engine, and show that its performance is competitive with a GPU (running Amber in an industrial production environment). The system features on-chip particle data storage and management, short- and long-range force evaluation, as well as bonded forces, motion update, and particle migration. Other contributions of this work include exploring numerous architectural trade-offs and analysis on various mappings schemes among particles/cells and the various on-chip compute units. The potential impact is that this system promises to be the basis for long timescale Molecular Dynamics with a commodity cluster.

研究の動機と目的

  • 計算をホストCPUに依存せずに、1つのFPGAに完全に統合された自己完結型MDシミュレーションエンジンの開発。
  • オンチップリソース(BRAMとコンピューティングユニット)に効率的に粒子、セル、力計算パイプラインをマッピングする課題の解決。
  • メモリ階層、パイプライン配布、ワークロードマッピング方式におけるアーキテクチャ的トレードオフを分析し、パフォーマンスを最適化。
  • 通信オーバーヘッドを最小限に抑え、オンチップデータ再利用を最大化することで、一般用途FPGAクラスタ上での長時間スケールMDシミュレーションを可能にする。
  • HDLスクリプトを用いたアプリケーション指向の自動設計生成により、パフォーマンス最適化された構成の迅速な探索を可能にする。

提案手法

  • Intel Stratix 10 FPGA上に、オンチップ粒子保存、範囲制限付き(RL)および長距離(LR)力評価、結合力計算、運動更新、粒子移動を含むエンドツーエンドのMDパイプラインを実装。
  • スコアボーディング機構を採用し、力評価と運動更新を並列実行することで、パイプラインの利用効率を向上。
  • 2種類のメモリアーキテクチャを設計:RL/LR力には分散型BRAM、結合力にはグローバルメモリを採用し、帯域幅とリソース使用量を最適化。
  • 即時の隣接リストフィルタリングを用いて、重複する粒子ペア計算を削減し、効率性を向上。
  • 入力データセットのサイズとセル構成に基づき、最適なパイプライン数、リソース使用量、パフォーマンスを推定するためのソフトウェアスクリプトを開発。
  • 3種類の異なる分布方式を用いて粒子とセルをコンピューティングパイプラインにマッピングし、負荷分散とメモリアクセスのトレードオフを評価。

実験結果

リサーチクエスチョン

  • RQ1CPUの外部依存なしに、1つのFPGA上で完全に統合され、自己完結型のMDシミュレーションを実装可能か?
  • RQ2パフォーマンスを最大化するために、粒子/セルとオンチップコンピューティングユニット(パイプライン)およびメモリ(BRAM)との最適なマッピングは何か?
  • RQ3分散型メモリとグローバルメモリの違い、およびパイプライン配布戦略がスループットとリソース利用に与える影響は何か?
  • RQ4FPGAの再構成可能特性を、異なるMDシステムサイズや密度に合わせて設計をカスタマイズするためにどの程度活用できるか?
  • RQ5このようなFPGAベースMDエンジンは、実環境の最新GPUアクセラレータと同等のパフォーマンスを達成できるか?

主な発見

  • 提案されたFPGAベースMDエンジンは、23.5K粒子のジヒドロホルエートレダクターゼ(DFHR)系で1日あたり630 nsのシミュレーションスループットを達成し、最先端のGPU実装を最低40%以上上回る性能を発揮した。
  • 設計6(分散メモリとワークロード分布3)が、DFHRデータセットで最高のパフォーマンス(630.25 ns/day)を発揮し、特に高密度系において顕著に効果的であった。
  • 初期設計ではメモリ帯域幅が主なボトルネックであったが、設計2および4で最適化されたメモリアクセスにより、イテレーション時間が64,411 μsから313 μsにまで短縮された。
  • マッピング可能なパイプライン数は、BRAMリソースの上限に達するまで、データセットサイズにほとんど依存せず、ただしパフォーマンスはデータ密度とマッピング方式に大きく依存する。
  • データセットの特性に応じてパフォーマンスが変動する:例えば、1セルあたり80粒子の希釈系ではワークロード分布3が最も効果的であるが、1セルあたり400粒子の高密度系では、複雑な分布による利点は限定的である。
  • 再構成可能設計に加え、自動HDLスクリプトによる支援により、異なるMDシステムサイズやカットオフ半径に最適な構成の迅速な探索が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。