Skip to main content
QUICK REVIEW

[論文レビュー] The BaseJump Manycore Accelerator Network

Shaolin Xie, Michael Taylor|arXiv (Cornell University)|Aug 2, 2018
Interconnection Networks and Systems参考文献 2被引用数 4
ひとこと要約

BaseJump Manycore Accelerator Network は、RISC-V互換の多数コアシステム向けに設計されたオープンソースでメッシュ構造のオンチップネットワークであり、分割されたグローバルアドレス空間モデルを用いて、最小限のハードウェアで効率的なリモートメモリ操作を実現する。次元順ルーティングとクレジットベースのフロー制御を採用し、スキャター/ギャザーワークロードにおける高いパフォーマンスとスケーラブルな通信を実現する。

ABSTRACT

The BaseJump Manycore Accelerator-Network is an open source mesh-based On-Chip-Network which is designed leveraging the Bespoke Silicon Group's 20+ years of experience in designing manycore architectures. It has been used in the 16nm 511-core RISC-V compatible Celerity chip Davidson et al. (2018), forming the basis of both a 1 GHz 496-core RISC-V manycore and a 10-core always-on low voltage complex. It was also used in the 180nm BSG Ten chip, which featured ten cores and a mesh that extends over off-chip links to an FPGA. To facilitate use by the open source community of the BaseJump Manycore network, we explain the ideas, protocols, interfaces and potential uses of the mesh network. We also show an example with source code that demonstrates how to integrate user designs into the mesh network.

研究の動機と目的

  • 最小限の面積とエネルギー消費で、スケーラブルなオープンソースのオンチップネットワークを、多数コアアクセラレータに提供すること。
  • 分割されたグローバルアドレス空間モデルにおいて、ランダムなスキャターおよびギャザー操作のような効率的なリモートメモリアクセスパターンをサポートすること。
  • RISC-VコアからDSPやeFPGAに至る多様なアクセラレータを、統合されたメッシュベースの通信ファブリックにシームレスに統合できること。
  • シンプルな統合モードと高度な統合モードを提供すること:基本的なロード/ストア操作向けの標準エンドポイントと、ストリーミングRPC様式のワークロードに最適化された低レベルのネットワーク認識設計。
  • 次元順ルーティングとバイセクション帯域幅の制限を用いて、均一なランダム、トランスポーズ、ニアレストネイバーのトラフィックパターン下でのネットワークパフォーマンスを分析・定量すること。

提案手法

  • 面積とエネルギー消費を低減するため、次元順ルーティングと最小限のバッファを備えた2次元メッシュトポロジーを採用する。
  • 1ワード幅の32ビットパケットフォーマットを用い、操作タイプ(ロード、ストア、スワップ)、送信元/受信先座標、データペイロードのヘッダーフィールドを含む。
  • ネットワークの混雑を管理し、リクエストパケットとリ ply パケットの信頼性ある送信を保証するため、クレジットベースのフロー制御を実装する。
  • (X, Y, ローカルアドレス)アドレッシングを用いた分割グローバルアドレス空間モデルにより、タイル間でのロード、ストア、および比較・スワップを可能にする。
  • 単純なリモートメモリアクセスを実行するアクセラレータがネットワークの複雑さを抽象化できる、標準エンドポイントモジュールを提供する。
  • 直接ネットワークインターフェースを設計することで、ストリーミングワークロードを可能にし、アクセラレータが受信リクエストをパイプライン化されたRPCとしてストリーミング処理できるようにする。

実験結果

リサーチクエスチョン

  • RQ1多数コアシステムにおける高パフォーマンスなリモートメモリ操作をサポートする低面積・低エネルギーのオンチップネットワークをどのように設計できるか?
  • RQ2均一なランダムトラフィック下での最小限のメッシュネットワークの性能限界は何か?また、ネットワークサイズの増大に伴いどのようにスケーリングするか?
  • RQ3さまざまな通信パターン下で、次元順ルーティング(DOR)は、バリエントやROMMなどの適応的アルゴリズムと比較して平均パケット遅延においてどの程度の差異を示すか?
  • RQ4計算モデルが異なるアクセラレータ(特にストリーミングやアトミック操作を必要とするもの)を共有ネットワークファブリックに効率的に統合するためのメカニズムは何か?
  • RQ5メッシュトポロジー下で、バイセクション帯域幅と提供されたトラフィックメトリクスを用いて、ネットワークパフォーマンスをどの程度まで予測可能か?

主な発見

  • 16×16メッシュでは、バイセクション帯域幅が16リンクであり、理論的最大値が1リンクあたり1サイクルに4メッセージであるため、均一なランダムトラフィック下で4サイクルごとに新しいメッセージをインジェクションできる。
  • 均一なランダムトラフィック下で、16×16メッシュの平均ラウンドトリップ遅延は約48サイクルであり、すべてのコアがバイセクションを横断してメッセージを送信する場合でも、相対的な未利用度はわずか3倍にとどまる。
  • 次元順ルーティング(DOR)はトランスポーズトラフィックパターンでは性能が著しく劣るが、ニアレストネイバー通信では非常に効率的であることが、比較シミュレーションで示された。
  • 最小限のブロッキングハードウェアと1サイクルあたり1ワードのリモートストアスループットのおかげで、ランダムスキャター操作において高いスループットを達成している。
  • リモートロードおよび比較・スワップ操作は、ラウンドトリップ通信に起因して長時間の遅延を示すが、データ局所性の向上や複数タイルにわたる並列化によって緩和可能である。
  • ネットワークのパフォーマンスはバイセクション帯域幅によって制限される。16×16メッシュでは、バイセクションを横断して1サイクルあたり最大32件のリモート操作を維持できるが、これは高同時並列ワークロードの実行効率を制限する要因となる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。