Skip to main content
QUICK REVIEW

[論文レビュー] CoSA: Scheduling by Constrained Optimization for Spatial Accelerators

Qijing Huang, Minwoo Kang|arXiv (Cornell University)|May 5, 2021
Advanced Neural Network Applications参考文献 65被引用数 5
ひとこと要約

CoSA は、混合整数プログラミング問題として DNN エンジンスケジューリングを定式化する制約付き最適化フレームワークであり、一度の決定的最適化でタイリング、ループ順序、空間マッピングを同時に最適化する。反復的探索を排除することで、最先端のスケジューラーより最大 2.5× の高速化と 90× の時間短縮を達成し、アルゴリズム的・アーキテクチャ的規則性を活用した高性能でワンショットのスケジューリングを実現する。

ABSTRACT

Recent advances in Deep Neural Networks (DNNs) have led to active development of specialized DNN accelerators, many of which feature a large number of processing elements laid out spatially, together with a multi-level memory hierarchy and flexible interconnect. While DNN accelerators can take advantage of data reuse and achieve high peak throughput, they also expose a large number of runtime parameters to the programmers who need to explicitly manage how computation is scheduled both spatially and temporally. In fact, different scheduling choices can lead to wide variations in performance and efficiency, motivating the need for a fast and efficient search strategy to navigate the vast scheduling space. To address this challenge, we present CoSA, a constrained-optimization-based approach for scheduling DNN accelerators. As opposed to existing approaches that either rely on designers' heuristics or iterative methods to navigate the search space, CoSA expresses scheduling decisions as a constrained-optimization problem that can be deterministically solved using mathematical optimization techniques. Specifically, CoSA leverages the regularities in DNN operators and hardware to formulate the DNN scheduling space into a mixed-integer programming (MIP) problem with algorithmic and architectural constraints, which can be solved to automatically generate a highly efficient schedule in one shot. We demonstrate that CoSA-generated schedules significantly outperform state-of-the-art approaches by a geometric mean of up to 2.5x across a wide range of DNN networks while improving the time-to-solution by 90x.

研究の動機と目的

  • 空間的 DNN エンジンにおける膨大で高次元なスケジューリング空間を、ブルートフォース法や反復的フィードバック駆動法では対処できない課題に直面する。
  • 反復的探索や大規模シミュレーションの必要性を排除するため、スケジューリングを決定的で制約付き最適化問題として定式化する。
  • ハードウェアおよびアルゴリズム的制約に基づいた統一的な数学的定式化を用いて、タイリング、ループ順序の並び替え、空間マッピングを同時に最適化する。
  • GPU やカスタム空間的エナジンアーキテクチャを含む、多様な DNN ワークロードとアーキテクチャにおいて、パフォーマンスとエネルギー効率を向上させる。
  • 再トレーニングや広範なシミュレーションを必要とせず、新規または進化するハードウェアに対しても迅速かつスケーラブルかつポータブルなスケジューリングを可能にする。

提案手法

  • CoSA は、DNN レイヤーの次元とメモリ階層、ネットワークオンチップ(NoC)トポロジーなどのハードウェアパラメータに基づいた制約を有する混合整数プログラミング(MIP)問題として DNN スケジューリングを定式化する。
  • メモリ階層におけるタイルサイズ、データ再利用のためのループ順序、処理要素への計算マッピングを MIP 定式化の意思決定変数としてモデル化する。
  • 共有メモリ制限、レジスタ使用量、GPU 上のスレッドブロックサイズ制限などのアーキテクチャ的制約を組み込み、有効なスケジュールのみを生成する。
  • オンチップメモリおよび NoC を横切るデータ移動コストを明示的にモデル化する通信指向の目的関数を採用し、通信オーバーヘッドを低減する。
  • 目的関数は計算利用率、メモリ再利用、通信コストを組み合わせており、トレードオフをバランスさせるためにマイクロベンチマークで重みを調整する。
  • MIP 問題は標準的な数学的最適化ソルバを用いてワンショットで解き、反復的探索や強化学習を回避する。

実験結果

リサーチクエスチョン

  • RQ1DNN エンジンスケジューリングを、反復的探索や高コストなトレーニングを回避する、一括で決定的な制約付き最適化問題として定式化できるか?
  • RQ2統一された MIP 定式化は、多様な DNN ワークロードにおいて、タイリング、ループ順序の並び替え、空間マッピングを同時に最適化するのにどの程度有効か?
  • RQ3異なるハードウェアプラットフォームにおいて、CoSA はパフォーマンス、エネルギー効率、時間対解決の観点で最先端のスケジューラーよりもどれほど優れているか?
  • RQ4再トレーニングやシミュレーションを必要とせず、CoSA は新規または進化するアーキテクチャにどの程度一般化できるか?
  • RQ5CoSA における通信に配慮した目的関数は、ネットワークトラフィックコストを無視するモデルと比較して、より優れたパフォーマンスをもたらすか?

主な発見

  • CoSA が生成するスケジュールは、複数の DNN ネットワークにおいて、Timeloop Hybrid やランダムサーチといった最先端のスケジューラーよりも幾何平均で最大 2.5× の高速化を達成する。
  • CoSA の時間対解決時間は反復的メソッドと比較して 90× 速く、平均して 1 レイヤーあたり 0.02 秒のワンショット解決時間である。
  • NoC シミュレータ上では、最良のランダムサーチ解法よりも最大 3.3× の高速化、Timeloop Hybrid よりも 2.5× の高速化を達成し、特に通信コストの高い畳み込み層で顕著な性能を示す。
  • K80 GPU 上では、XGBoost チューナーを搭載した TVM よりも幾何平均で 1.10× の高速化を達成し、時間対解決時間は 2,500× 短縮された(1 レイヤーあたり 0.02 秒 vs. 50 秒)。
  • ベースラインスケジューラーと比較してエネルギー効率を 22% 向上させ、計算および通信オーバーヘッドの両方を低減する有効性を示している。
  • ResNet-50 や DeepBench、全結合層を含む多様なワークロードにおいて、CoSA は一貫して高品質なスケジュールを生成し、メモリ制限の強いレイヤーでもパフォーマンス劣化を示さない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。