[論文レビュー] A Full-stack Accelerator Search Technique for Vision Applications.
本稿では、ビジョンワークロード向けにデータパス、スケジューリング、コンパイラ変換(例:演算統合、テンソルパディング)を統合最適化するフルスタック型ハードウェア・ソフトウェア共同設計フレームワークであるFASTを提案する。EfficientNet、ResNet50v2、OCRで評価した結果、単一モデルに最適化した場合、TPU-v3と比較して最高で6.1倍のPerf/TDPを達成し、ワークロードサブセット全体で平均2.85倍の向上を示した。また、1つの設計で複数のモデルに対して2.35倍の高速化を達成した。
The rapidly-changing ML model landscape presents a unique opportunity for building hardware accelerators optimized for specific datacenter-scale workloads. We propose Full-stack Accelerator Search Technique (FAST), a hardware accelerator search framework that defines a broad optimization environment covering key design decisions within the hardware-software stack, including hardware datapath, software scheduling, and compiler passes such as operation fusion and tensor padding. Although FAST can be used on any number and type of deep learning workload, in this paper we focus on optimizing for a single or small set of vision models, resulting in significantly faster and more power-efficient designs relative to a general purpose ML accelerator. When evaluated on EfficientNet, ResNet50v2, and OCR inference performance relative to a TPU-v3, designs generated by FAST optimized for single workloads can improve Perf/TDP (peak power) by over 6x in the best case and 4x on average. On a limited workload subset, FAST improves Perf/TDP 2.85x on average, with a reduction to 2.35x for a single design optimized over the set of workloads. In addition, we demonstrate a potential 1.8x speedup opportunity for TPU-v3 with improved scheduling.
研究の動機と目的
- データセンタースケールのビジョンワークロードに特化した専用アクセラレータの増大するニーズに対応すること。
- ビジョンモデル向けにパフォーマンスとエネルギー効率に劣る一般用途のMLアクセラレータの限界を克服すること。
- ハードウェアデータパス、ソフトウェアスケジューリング、コンパイラ変換にわたる広範な最適化空間を探索すること。
- ビジョン推論向けにフルスタック共同最適化により顕著なパフォーマンスおよびエネルギー効率の向上を実証すること。
- 改善されたスケジューリングが、TPU-v3のような既存アクセラレータに与える影響を検証すること。
提案手法
- FASTは、ハードウェアデータパス設計、ソフトウェアレベルのスケジューリング、および演算統合やテンソルパディングなどのコンパイラ最適化を含む包括的な探索空間を定義する。
- ハードウェアとソフトウェアの各コンponent間で統合された設計空間を自動的に探索し、最適な構成を同定する。
- パフォーマンスおよび消費電力モデルを用いて、高いPerf/TDP(パフォーマンス/ワット)を達成するアクセラレータ設計を指向する。
- ワークロード固有の目的に従い、EfficientNet や ResNet50v2 のような単一または少数のビジョンモデルに焦点を当てる。
- 実際のデータセンターサイズの制約のもとで、推論遅延やエネルギー効率といった複数のメトリクスを用いて設計を評価する。
- 固定されたハードウェアでも、改善されたスケジューリングのみでTPU-v3が最大1.8倍の高速化を達成できることを示している。
実験結果
リサーチクエスチョン
- RQ1フルスタック共同最適化アプローチにより、ビジョン推論ワークロードのパフォーマンスおよびエネルギー効率を顕著に向上させることができるか?
- RQ2ハードウェアデータパス、スケジューリング、コンパイラパスを統合最適化することで、どの程度のパフォーマンス向上が達成できるか?
- RQ3ワークロード固有の最適化と一般用途アクセラレータ設計の間には、どのような差が生じるか?
- RQ4改善されたスケジューリングのみで、TPU-v3のような既存アクセラレータでも測定可能な高速化が達成できるか?
- RQ51つの最適化設計が、複数のビジョンワークロードにわたってどのように性能を発揮するか?
主な発見
- 単一モデル最適化において、FASTが生成した設計はTPU-v3と比較して最高で6.1倍のPerf/TDPを達成し、テスト対象のモデル全体で平均4倍の向上を示した。
- 限定されたワークロードサブセットにおいて、FASTはPerf/TDPを平均2.85倍向上させ、1つの設計がセット内のすべてのワークロードで平均2.35倍の高速化を達成した。
- フレームワークは、演算統合やテンソルパディングなどのコンパイラレベル最適化がパフォーマンス向上に顕著に寄与することを示した。
- ハードウェアを固定した状態でも、改善されたスケジューリングのみでTPU-v3がビジョンワークロードで最大1.8倍の高速化を達成できた。
- 結果から、フルスタック共同最適化は、ピークパフォーマンスおよびエネルギー効率の両面で一般用途アクセラレータ設計を上回ることが確認された。
- 最も優れたパフォーマンスを示したFAST最適化設計は、優れたパフォーマンス/ワット比を達成しており、顕著なエネルギー効率の向上を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。