[論文レビュー] The Distributed Network Processor: a novel off-chip and on-chip interconnection network architecture
本稿では、マルチタイルMPSoCおよびHPCシステムにおけるオンチップおよびオフチップ通信のための、構成可能でスケーラブルかつ低面積のインタコネクションネットワークアーキテクチャ、分散型ネットワークプロセッサ(DNP)を提示する。パラメトリックでワームホールルーティング、デッドロックフリーなネットワークを用い、静的ルーティングにより、異種プラットフォーム間で一様なRDMAスタイルの通信を実現する。500MHzでオンチップ遅延130サイクル、オフチップ遅延250サイクルを達成し、45nmプロセスにおける面積推定値は1.30–1.76 mm²である。
One of the most demanding challenges for the designers of parallel computing architectures is to deliver an efficient network infrastructure providing low latency, high bandwidth communications while preserving scalability. Besides off-chip communications between processors, recent multi-tile (i.e. multi-core) architectures face the challenge for an efficient on-chip interconnection network between processor's tiles. In this paper, we present a configurable and scalable architecture, based on our Distributed Network Processor (DNP) IP Library, targeting systems ranging from single MPSoCs to massive HPC platforms. The DNP provides inter-tile services for both on-chip and off-chip communications with a uniform RDMA style API, over a multi-dimensional direct network with a (possibly) hybrid topology.
研究の動機と目的
- マルチタイルMPSoCおよびHPCシステムにおけるオンチップおよびオフチップ通信のスケーラビリティと効率性の課題に対処すること。
- オンチップおよびオフチップの両方の相互接続を1つのAPIでサポートする、統一的で低遅延かつ高帯域幅の通信インfraストラクチャを提供すること。
- メモリ管理ユニット(MMU)なし環境でも特に効果を発揮する、最小限のシリコン面積と消費電力を実現する、合成可能で構成可能なハードウェアIPブロックを設計すること。
- 単一のMPSoCから大規模HPCクラスタまで、システムの階層構造にわたるシームレスな統合を可能にする、一様な通信モデルを提供すること。
- プログラマブルルーティングおよびフェイルセーフルーティング機構を用いた、将来の拡張性を支援すること。
提案手法
- DNPは、インナータイル(L)、オンチップ(N)、オフチップ(M)のポート数をパラメトリックに設定可能な、構成可能なIPライブラリとして実装され、柔軟なシステム統合を可能にする。
- 静的ルーティングを用いた完全スイッチド、ワームホールルーティング、デッドロックフリーなパケットベース通信アーキテクチャにより、低遅延かつ高スループットのデータ転送を実現する。
- オンチップおよびオフチップのタイル間で一様なRDMAスタイルのAPIをサポートし、ハードウェアの差異を抽象化することで、システム全体の通信プリミティブを提供する。
- 仮想メモリサポートを排除することで、メモリアドレス変換(MMU)なし環境向けに最適化されており、面積と消費電力を削減する。
- 45nmプロセス、500MHzで配置・配線試験を実施。面積と消費電力の推定にはメモリマクロの代わりにレジスタを用い、最終設計への外挿を実施した。
- オフチップインターフェースは16:1のシリアル化比を採用し、帯域幅は1サイクルあたり4ビット、遅延は主にシリアル化および物理層の遅延に起因する。
実験結果
リサーチクエスチョン
- RQ1異種マルチタイルシステムにおいて、オンチップおよびオフチップの相互接続に、1つの一様な通信インfraストラクチャを効率的に展開する方法は何か?
- RQ2低面積・低消費電力・MMUなし設計における、完全スイッチド・ワームホールルーティング・デッドロックフリーインタコネクタの実現可能な遅延と帯域幅はどの程度か?
- RQ3DNPのパラメトリックで構成可能なアーキテクチャは、単一のMPSoCから大規模HPCクラスタまで、多様なシステムスケールへの迅速な探索と展開をどのように可能にするか?
- RQ4DNPの統合に伴う面積および消費電力のオーバーヘッドは何か?また、ポート数およびトポロジーに応じてどのようにスケーリングされるか?
- RQ5DNPは、大規模HPCプラットフォームにおける将来の拡張(例えば、プログラマブルルーティングおよびフェイルセーフルーティング)をサポートできるか?
主な発見
- DNPは、オンチップで1ホップ遅延約130サイクル(500MHzで260ns)、オフチップで約250サイクル(500ns)を達成しており、オフチップ遅延は主にシリアル化に起因する。
- オフチップネットワークは、1方向あたり1サイクルあたり4ビットの帯域幅を提供し、16:1のシリアル化比を採用。オフチップインターフェースを経由する追加のホップは、効率的なワームホールルーティングによりわずか100サイクルの遅延増加にとどまる。
- 45nmプロセスでの配置・配線試験により、DNPの面積推定値はMTNoCで1.30 mm²、MT2Dで1.76 mm²となり、消費電力はそれぞれ160mWおよび180mWであった。これはタイル全体の消費電力の約1/4に相当する。
- 面積推定値は保守的であり、メモリマクロの代わりにレジスタを用いたため、最終設計では面積が約50%削減される見込みである。
- DNPは、システムの階層構造にわたるスケーラブルで一様な通信を実現し、オンチップおよびオフチップ通信の両方で同じRDMA APIを使用可能にすることで、システムレベルのプログラミングを簡素化する。
- 今後の課題として、ハードコードされたルーティングをマイクロプロセッサに置き換えることでプログラマビリティを向上させ、大規模HPC展開に向けたフェイルセーフルーティング機構の統合を計画している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。