Skip to main content
QUICK REVIEW

[論文レビュー] An Open-Source Platform for High-Performance Non-Coherent On-Chip Communication

Andreas Kurth, Wolfgang Rönninger|arXiv (Cornell University)|Sep 11, 2020
Interconnection Networks and Systems参考文献 30被引用数 33
ひとこと要約

この論文は、業界標準のAMBA AXI5プロトコルに基づき、オープンソースでモジュラーかつトポロジーに依存しないオンチップ通信プラットフォームを提示している。このプラットフォームは、異種の多数コアおよびアクセラレータ豊富なSoCにおける高パフォーマンスで非一貫性のある通信を可能にする。プラットフォームは最大1024ビットのデータ幅と2.5 GHz動作をサポートし、22 nmプロセス技術で実装された1024コアのMLトレーニングアクセラレータにおいて、たった24 nsのラウンドトリップ遅延で32 TB/sの断面帯域幅を達成している。

ABSTRACT

On-chip communication infrastructure is a central component of modern systems-on-chip (SoCs), and it continues to gain importance as the number of cores, the heterogeneity of components, and the on-chip and off-chip bandwidth continue to grow. Decades of research on on-chip networks enabled cache-coherent shared-memory multiprocessors. However, communication fabrics that meet the needs of heterogeneous many-cores and accelerator-rich SoCs, which are not, or only partially, coherent, are a much less mature research area. In this work, we present a modular, topology-agnostic, high-performance on-chip communication platform. The platform includes components to build and link subnetworks with customizable bandwidth and concurrency properties and adheres to a state-of-the-art, industry-standard protocol. We discuss microarchitectural trade-offs and timing/area characteristics of our modules and show that they can be composed to build high-bandwidth (e.g., 2.5 GHz and 1024 bit data width) end-to-end on-chip communication fabrics (not only network switches but also DMA engines and memory controllers) with high degrees of concurrency. We design and implement a state-of-the-art ML training accelerator, where our communication fabric scales to 1024 cores on a die, providing 32 TB/s cross-sectional bandwidth at only 24 ns round-trip latency between any two cores.

研究の動機と目的

  • 異種の多数コアおよびアクセラレータ豊富なSoCにおける非一貫性オンチップ通信のためのオープンで拡張可能かつ標準化されたプラットフォームの欠如に対処すること。
  • 高帯域幅、高並列性、および多様なIPブロック(例:DMAエンジン、メモリコントローラ)のシームレスな統合を可能にする、モジュラーでパrametrizableかつトポロジーに依存しないプラットフォームを提供すること。
  • 検証可能なタイミング、面積、マイクロアーキテクチャ的トレードオフを備えた、エンドツーエンドの高パフォーマンスオンチップファブリックの設計を可能にすること。
  • 完全なRTLのオープンソース化(許可性の高いライセンス下)を通じて、研究開発および産業分野の発展を支援すること。これにはブリッジ、コンバータ、システムレベルのコンponentsが含まれる。

提案手法

  • プラットフォームはAMBA AXI5プロトコルに基づき、有効でリードィーのフロー制御とトランザクション順序ルール(O1–O3)を用いて正しさを保証し、複数の未解決トランザクションをサポートする。
  • コアコンポーネントにはネットワーク(デ)マルチプレクサ、ID幅コンバータ、データ幅コンバータ、およびDMAエンジンやメモリコントローラなどの専用モジュールが含まれる。これらは合成可能なSystemVerilogで実装されている。
  • 設計はモularityと責任の分離を重視しており、ルーティング、バッファリング、フロー制御が分離されているため、柔軟なトポロジーと独立した最適化が可能である。
  • カスタマイズ可能なデータ幅(最大1024ビット)、並列処理(最大256件の同時トランザクション)をサポートし、業界標準のAXI5と完全に互換性がある。
  • 22 nmプロセス技術で実装された1024コアの機械学習トレーニングアクセラレータに、すべてのコンponentsを統合することで、エンドツーエンドの通信ファブリックを実証した。
  • トップオグラフィカルな合成を用いて性能および面積の特性評価が行われ、異なる構成におけるタイミング、面積、トレードオフの詳細な分析が可能になった。

実験結果

リサーチクエスチョン

  • RQ1業界標準プロトコルを用いて、完全にオープンソースでモジュラーかつトポロジーに依存しないオンチップ通信プラットフォームを構築し、異種SoCにおける高帯域幅・高並列通信を実現できるか?
  • RQ2ネットワークコンポーネント(例:マルチプレクサ、コンバータ)におけるマイクロアーキテクチャ的選択が、実際の設計におけるパフォーマンス、面積、タイミングにどのように影響するか?
  • RQ3このようなプラットフォームが、大規模な多数コアアクセラレータにおける極めて高い帯域幅と低遅延を実現するために、どの程度スケーラブルか?
  • RQ4プラットフォームのオープンソース性が、特にアクセラレータと通信ファブリックを共同設計する文脈で、オンチップネットワーク設計分野における新しい研究開発をどの程度促進できるか?
  • RQ5このプラットフォームを用いて、商業的製品と同等またはそれを上回るパフォーマンスと柔軟性を備えたプロダクショングレードの高パフォーマンス通信ファブリックを実装できるか?

主な発見

  • プラットフォームは22 nmプロセス技術で実装された1024コアの機械学習トレーニングアクセラレータを正常に実装し、任意の2コア間で32 TB/sの断面帯域幅を達成した。
  • 1024コア構成において、オンチップ通信ファブリックは任意の2コア間でたった24 nsのラウンドトリップ遅延を達成した。
  • プラットフォームは最大1024ビットのデータ幅と2.5 GHz動作をサポートし、ファブリック全体で高スルーレートのデータ転送を可能にした。
  • 最大256件の独立したトランザクションをサポートする高並列性を実現し、広いデータパスの効率的利用が可能になった。
  • オープンソース化されたRTLコードにより、完全な透明性、検証、カスタマイズが可能となり、特許権のないIPの範囲を超えた研究開発および産業分野への展開を支援した。
  • モジュラーなコンポーネント(例:マルチプレクサ、コンバータ)がスケーラブルかつ合成可能であることが示され、プロトコルの複雑さを伴わずに柔軟なトポロジーとシステムレベルの統合が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。