Skip to main content
QUICK REVIEW

[論文レビュー] Challenges and Opportunities to Enable Large-Scale Computing via Heterogeneous Chiplets

Zhuoping Yang, Shixin Ji|arXiv (Cornell University)|Nov 28, 2023
Modular Robots and Swarm Intelligence被引用数 6
ひとこと要約

この論文は、特に生成的AIおよび大規模言語モデルを含む大規模AIワークロードを、異種チップレットアーキテクチャによって実現する際の課題と機会を調査する。インターコネクト、セキュリティ、プログラミング抽象化の問題に対処するため、統合されたソフトウェアスタックとハードウェア・コデザインフレームワークを提案し、マルチベンダーのチップレットシステムにおけるパフォーマンス、コスト効率、スケーラビリティに重点を置く。

ABSTRACT

Fast-evolving artificial intelligence (AI) algorithms such as large language models have been driving the ever-increasing computing demands in today's data centers. Heterogeneous computing with domain-specific architectures (DSAs) brings many opportunities when scaling up and scaling out the computing system. In particular, heterogeneous chiplet architecture is favored to keep scaling up and scaling out the system as well as to reduce the design complexity and the cost stemming from the traditional monolithic chip design. However, how to interconnect computing resources and orchestrate heterogeneous chiplets is the key to success. In this paper, we first discuss the diversity and evolving demands of different AI workloads. We discuss how chiplet brings better cost efficiency and shorter time to market. Then we discuss the challenges in establishing chiplet interface standards, packaging, and security issues. We further discuss the software programming challenges in chiplet systems.

研究の動機と目的

  • 大規模言語モデルや生成的AIに伴うデータセンタでの高パフォーマンスでエネルギー効率の良いコンピューティングの需要増加に対応する。
  • モノリシックASICや従来のアクセラレータの制限を克服するため、複数ベンダーにまたがるチップレットベースの異種統合を活用する。
  • チップレットシステムにおけるハードウェアおよびソフトウェアの主な課題、特にインターコネクト規格、パッケージング、セキュリティ、プログラミング抽象化を特定・解決する。
  • 異種チップレット間でポータブルで効率的かつスケーラブルなアプリケーションデプロイメントを可能にする統合されたソフトウェアインfraを提案する。
  • 標準化されたインターフェースを備えたモジュラーで再利用可能なチップレット設計により、開発期間の短縮とコスト効率の向上を実現する。

提案手法

  • BERT や GPT などのモデルにおけるデータ移動と計算要求を特徴付けるために、算術強度と計算対通信(CTC)比を用いてAIワークロードを分析する。
  • サイドチャネル攻撃および故障インジェクション攻撃の保護を目的として、センサーやPUFを内蔵したHSM(ハードウェアセキュリティモジュール)チップレットを提案する。
  • 暗号化モジュールを用いて、暗号化され認証済みの通信をチップレット間で実現するためのCSIP(チップ対チップセキュアインターコネクトプロトコル)を導入する。
  • SYCL、oneAPI、MLIR、ScaleHLS、HeteroCL といったソフトウェアスタックの選択肢を評価し、異種チップレット間で統一的かつポータブルなプログラミングを可能にする。
  • ワークロードマッピングとシステム全体のパフォーマンス最適化を図るため、通信を考慮したマッピングとコデザインフレームワーク(例:H2H、CHARM)を提案する。
  • 非専門家開発者が高パフォーマンスなFPGAおよびアクセラレータコードを実現できるようにするため、チップレットシステムに特化した自動設計探索(DSE)ツールの活用を提言する。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルの推論や学習といった、多様で変化し続けるAIワークロードの要件を満たすために、異種チップレットを効果的にオーケストレーションする方法は何か?
  • RQ2複数ベンダーのチップレットを接続するにあたり、主なハードウェアレベルの課題は何か? そして、標準化されたインターフェースと高度なパッケージング技術によってどのように解決できるか?
  • RQ3特にマルチテナントデータセンタ環境において、物理的アクセスリスクを伴うチップレットシステムのセキュリティをどのように確保できるか?
  • RQ4異種チップレット間でポータブルで高パフォーマンスなコードを実現するために、最も効果的なソフトウェア抽象化とプログラミングモデルは何か?
  • RQ5自動設計探索およびコデザインフレームワークは、チップレットベースのシステムにおけるパフォーマンス向上と開発の複雑さ低減にどのように寄与できるか?

主な発見

  • チップレットベースのシステムは、モノリシックASICの設計サイクルを年単位から数か月に短縮し、コストを数百万ドルから数千ドルまで削減することで、市場投入までの期間とコスト効率を顕著に改善する。
  • GPT-2の算術強度はわずか2であるのに対し、BERT-Largeは266であるため、通信と計算の要求が著しく異なることが示され、ワークロードに応じたハードウェア設計が不可欠である。
  • CTC比はモデルや層ごとに顕著に異なる。行列乗算は計算集約的であり、Softmax演算はデータ移動集約的であるため、メモリと帯域幅の最適化を個別に実施する必要がある。
  • 組み込みセンサーやPUFを備えたHSMチップレットは、プローブ攻撃や故障インジェクション攻撃を検出可能であり、ゼロデイ脅威への対応を可能にするランタイムセキュリティポリシーの更新も可能である。
  • CSIPはチップレット間で認証済みで暗号化された通信を可能にするが、効果を発揮するためには信頼できるベンダーと暗号化ハードウェアを備える必要がある。
  • oneAPI や MLIR(例:ScaleHLS、HeteroCL)といった統合プログラミングフレームワークは、異種チップレット間でポータブルで高パフォーマンスなコードを実現する上で有望であるが、完全な相互運用性は未解決の課題のままである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。