Skip to main content
QUICK REVIEW

[論文レビュー] A Highly Configurable Hardware/Software Stack for DNN Inference Acceleration

Suvadeep Banerjee, Steve Burns|arXiv (Cornell University)|Nov 29, 2021
Parallel Computing and Optimization Techniques参考文献 35被引用数 6
ひとこと要約

本論文は、TV M/VTAスタックにパイプライン化されたALUおよびGEMMユニット、パrameterizedメモリ幅(8–64バイト/サイクル)、および新規命令を追加することで、DNN推論加速のための高configurableなハードウェア/ソフトウェアスタックを提示する。12倍の面積増加を伴うが、最大11.5倍のサイクル数低減を達成し、ResNetおよびMobileNetのエンド・ツー・エンド対応を可能にした。アジャイルで機能単位の段階的アプローチにより、数十の構成における面積-パフォーマンストレードオフの迅速な探索が可能となった。

ABSTRACT

This work focuses on an efficient Agile design methodology for domain-specific accelerators. We employ feature-by-feature enhancement of a vertical development stack and apply it to the TVM/VTA inference accelerator. We have enhanced the VTA design space and enabled end-to-end support for additional workloads. This has been accomplished by augmenting the VTA micro-architecture and instruction set architecture (ISA), as well as by enhancing the TVM compilation stack to support a wide range of VTA configs. The VTA tsim implementation (CHISEL-based) has been enhanced with fully pipelined versions of the ALU/GEMM execution units. In tsim, memory width can now range between 8-64 bytes. Field widths have been made more flexible to support larger scratchpads. New instructions have been added: element-wise 8-bit multiplication to support depthwise convolution, and load with a choice of pad values to support max pooling. Support for more layers and better double buffering has also been added. Fully pipelining ALU/GEMM helps significantly: 4.9x fewer cycles with minimal area change to run ResNet-18 under the default config. Configs featuring a further 11.5x decrease in cycle count at a cost of 12x greater area can be instantiated. Many points on the area-performance pareto curve are shown, showcasing the balance of execution unit sizing, memory interface width, and scratchpad sizing. Finally, VTA is now able to run Mobilenet 1.0 and all layers for ResNets, including the previously disabled pooling and fully connected layers. The TVM/VTA architecture has always featured end-to-end workload evaluation on RTL in minutes. With our modifications, it now offers a much greater number of feasible configurations with a wide range of cost vs. performance. All capabilities mentioned are available in opensource forks while a subset of these capabilities have already been upstreamed.

研究の動機と目的

  • ドメイン特化アクセラレータ開発における非再発費(NRE)コストを削減するため、迅速かつconfigurableなハードウェア/ソフトウェア共同設計を可能にする。
  • VTAアクセラレータスタックを、より高いパフォーマンス、configurability、およびResNetやMobileNetのような複雑なDNNワークロードに対するエンド・ツー・エンド対応を向上させる。
  • 継続的統合と迅速なエンド・ツー・エンド検証を可能にする、アジャイルで段階的なハードウェアとソフトウェアの共同設計手法を開発する。
  • RTL、シミュレーション、FPGAプラットフォーム間での正しさを維持したまま、VTA構成の設計空間を拡張し、面積-パフォーマンストレードオフを探索する。
  • 上流への寄与と再利用可能なフローを活用して、効率的かつオープンソースのDNN推論アクセラレータのハードウェア/ソフトウェア共同設計を実現する。

提案手法

  • 最小限のVTA実装から始まり、段階的にTV M/VTAスタックを強化するアジャイルで機能単位の開発手法を採用した。
  • サイクル数を顕著に削減する完全にパイプライン化されたALUおよびGEMMユニットをVTAマイクロアーキテクチャに追加した。
  • メモリインターフェース幅(8–64バイト/サイクル)およびISA内のフィールド幅をパrameterized化し、多様な構成とより大きなスクラッチパッドをサポートした。
  • 8ビット要素単位乗算、最大プーリング用のパッド選択ロード、および共通のResNetパターンを加速するクリップ命令を新規に追加した。
  • TVMコンパイラスタックを拡張し、最適化されたuop生成、ダブルバッファリングのサポート、およびプーリング層や全結合層を含む新規レイヤーの処理を可能にした。
  • fsim(動作モデル)、tsim(VerilatorベースのRTLシミュレーション)、FPGAシミュレーションを含む継続的統合パイプラインを実装し、すべての段階で正しさを保証した。

実験結果

リサーチクエスチョン

  • RQ1アジャイルで段階的なアプローチは、ドメイン特化アクセラレータ開発におけるNREコストをどのように低減できるか?
  • RQ2構成可能なアクセラレータ上で、ResNet や MobileNet といった複雑なDNNのエンド・ツー・エンド対応を実現するには、どのようなハードウェアおよびソフトウェアの強化が必要か?
  • RQ3パイプライン化とパrameterizationは、最小限の面積増加でどれほどパフォーマンスを向上できるか?
  • RQ4統一されたハードウェア/ソフトウェア共同設計フローは、数十の構成における面積-パフォーマンストレードオフの迅速な探索をどのように可能にするか?
  • RQ5シミュレーションと継続的統合は、反復的なハードウェアおよびコンパイラの強化過程で正しさを維持するために、どのような役割を果たすか?

主な発見

  • 完全にパイプライン化されたALUおよびGEMMユニットにより、デフォルト構成下でResNet-18のサイクル数が約4.9倍削減された。
  • 構成パrameterのチューニングにより、さらに約11.5倍のサイクル数削減が達成されたが、面積は約12倍増加した。これにより、広範なパフォーマンス-面積トレードオフの空間が実現された。
  • 面積-パフォーマンスパレート曲線上に数十の中間構成が露出され、実行ユニットサイズ、メモリ幅、スクラッチパッドサイズの系統的な探索が可能になった。
  • 強化されたスタックは、プーリング層や全結合層を含む、ResNetおよびMobileNet 1.0のすべてのレイヤーをサポートするようになった。
  • RTL上でエンド・ツー・エンドワークロードの評価が今や数分で完了するようになり、共同設計およびDNNアーキテクチャの探索に迅速なフィードバックが可能になった。
  • 深刻なメモリタイミングバグは、FPGAプラットフォームでのみ発見された。これは、高速なRTLシミュレーションに加え、FPGAレベルの統合テストの価値を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。