Skip to main content
QUICK REVIEW

[論文レビュー] Transaction-level Model Simulator for Communication-Limited Accelerators

Sunwoo Kim, Jooho Wang|arXiv (Cornell University)|Jul 29, 2020
Advanced Memory and Neural Computing参考文献 24被引用数 9
ひとこと要約

本稿では、DRAM遅延およびバスプロトコルオーバーヘッドを考慮して通信帯域幅をモデル化する、CNNアクセラレータ向けのpre-RTLサイクルアキュレートなSystemC TLMベースのシミュレータであるAccTLMSimを提案する。本手法は、従来のアプローチを凌駕する精度と速度を備えた新たな性能推定モデルを用いることで、数分のうちに数百万ものアーキテクチャ的選択肢を高速かつ正確に探索可能にする。

ABSTRACT

Rapid design space exploration in early design stage is critical to algorithm-architecture co-design for accelerators. In this work, a pre-RTL cycle-accurate accelerator simulator based on SystemC transaction-level modeling (TLM), AccTLMSim, is proposed for convolutional neural network (CNN) accelerators. The accelerator simulator keeps track of each bus transaction between accelerator and DRAM, taking into account the communication bandwidth. The simulation results are validated against the implementation results on the Xilinx Zynq. Using the proposed simulator, it is shown that the communication bandwidth is severely affected by DRAM latency and bus protocol overhead. In addition, the loop tiling is optimized to maximize the performance under the constraint of on-chip SRAM size. Furthermore, a new performance estimation model is proposed to speed up the design space exploration. Thanks to the proposed simulator and performance estimation model, it is possible to explore a design space of millions of architectural options within a few tens of minutes.

研究の動機と目的

  • CNNアクセラレータにおける通信ボトル neck を正確にモデル化するpre-RTLシミュレータの不足に対処すること。
  • 従来のシミュレータが静的な通信帯域幅を仮定しているのに対し、DRAM遅延およびバスプロトコルオーバーヘッドに起因する動的影響を無視するという限界を克服すること。
  • オンチップSRAM制約下での通信制限を受けやすいCNNアクセラレータのための、効率的かつ高精度な設計空間探索を可能にすること。
  • サイクルアキュレートなシミュレーションと比較して高い精度を維持しながら探索を加速する性能推定モデルの開発。
  • 複数の畳み込み層にわたる制約なしのループタイリング戦略(タイルサイズとアンロール要因の最適化)を最適化し、制約下でのパフォーマンスを最大化すること。

提案手法

  • アクセラレータとDRAM間のすべてのバストランザクションをサイクルアキュレートに追跡するSystemCベースのトランザクションレベルモデル(AccTLMSim)を設計。
  • シミュレーションに現実的なDRAM遅延およびAXIバスプロトコルオーバーヘッドを組み込み、動的通信帯域幅をモデル化。
  • 正確性を保証するため、Xilinx Zynq FPGA実装との比較によるシミュレータの妥当性を検証。
  • シミュレーションデータから得た経験的スケーリング要因に基づく新しい性能推定モデルを提案し、静的仮定を置き換える。
  • 推定モデルをシミュレータに統合し、全シミュレーションの前に設計空間を絞り込む(例:上位0.1%)ことで、探索時間を著しく削減。
  • 複数の畳み込み層にわたる制約なしのループタイリングをサポートするようにフレームワークを拡張し、各層ごとのタイルサイズおよびアンロール要因の最適化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1DRAM遅延およびバスプロトコルオーバーヘッドは、CNNアクセラレータにおける有効な通信帯域幅にどのように影響を与えるか?
  • RQ2RTL実装がなくても、サイクルアキュレートなTLMベースのシミュレータは通信制限パフォーマンスを正確にモデル化できるか?
  • RQ3提案された性能推定モデルは、従来のモデルと比較して、設計空間探索における精度と速度の両面で優れているか?
  • RQ4複数の畳み込み層にわたる制約なしのループタイリングは、制約ありのタイリングと比較して、どの程度のパフォーマンス向上をもたらすか?
  • RQ5提案された推定モデルは、大規模な設計空間探索において、正確性を保持したまま探索時間をどの程度短縮できるか?

主な発見

  • CNNアクセラレータにおける通信帯域幅は、ピーク帯域幅だけでなく、DRAM遅延およびバスプロトコルオーバーヘッドに起因する動的要因によって制限される。
  • 提案されたシミュレータは、Xilinx Zynq FPGAの実装結果と照合された結果から、実世界のパフォーマンスを正確に反映している。
  • 新規の性能推定モデルにより、設計空間探索時間は数個のオーダー短縮されながらも、高い精度を維持しており、従来のモデルでさえ上位1%のフィルタリングでもこれを凌駆する。
  • 複数の畳み込み層にわたる制約なしのループタイリングにより、タイルサイズの各層ごとの最適化が可能となり、制約ありタイリングと比較して最大25.5%のパフォーマンス向上が達成された。
  • 提案されたモデルにより、数分のうちに数百万ものアーキテクチャ的選択肢を探索可能となり、大規模最適化が現実可能となった。
  • 従来のモデルで経験的に選ばれたスケーリング要因は、特にSRAMサイズが15kピxls/重みを超えると顕著なパフォーマンス劣化を引き起こすことが判明し、正確なモデル化の重要性が強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。