[論文レビュー] Learned Hardware/Software Co-Design of Neural Accelerators
本稿では、ニューラルアクセラレータの共同ハードウェア/ソフトウェア共同設計のための制約付きベイズ最適化フレームワークを提案する。エネルギー遅延積(EDP)を最小化するため、広大で準離散的なハードウェアアーキテクチャとソフトウェアマッピングの設計空間を自動的に探索する。ResNet や DQN を含む複数のモデルにおいて、手動で最適化された最先端システムと比較して、エネルギー遅延積が 18% から 40% まで改善された。
The use of deep learning has grown at an exponential rate, giving rise to numerous specialized hardware and software systems for deep learning. Because the design space of deep learning software stacks and hardware accelerators is diverse and vast, prior work considers software optimizations separately from hardware architectures, effectively reducing the search space. Unfortunately, this bifurcated approach means that many profitable design points are never explored. This paper instead casts the problem as hardware/software co-design, with the goal of automatically identifying desirable points in the joint design space. The key to our solution is a new constrained Bayesian optimization framework that avoids invalid solutions by exploiting the highly constrained features of this design space, which are semi-continuous/semi-discrete. We evaluate our optimization framework by applying it to a variety of neural models, improving the energy-delay product by 18% (ResNet) and 40% (DQN) over hand-tuned state-of-the-art systems, as well as demonstrating strong results on other neural network architectures, such as MLPs and Transformers.
研究の動機と目的
- 伝統的なハードウェアとソフトウェアの分離最適化では、有益な共同設計ポイントを十分に探索できないという限界を解消すること。
- DNNアクセラレータのハードウェアおよびソフトウェア設定の高制約的で準連続/準離散的な設計空間を、自動的かつ体系的に探索可能にする。
- エネルギー遅延積(EDP)の低減を図るため、スケーラブルで原理的根拠のある最適化フレームワークを構築し、ハードウェアアクセラレータとソフトウェアマッピングを共同で最適化すること。
- 学習型共同設計が、多様なニューラルネットワークモデルにおいて、新しい高性能なアーキテクチャを発見し、ヒューリスティックベースの最適化手法を上回ることを示すこと。
提案手法
- プロセッサエレメント(PE)アレイのレイアウト、バッファサイズ、ループタイリング、データフローのパターンを含む、パラメータ化された設定を用いてハードウェアおよびソフトウェアの設計空間を形式化する。
- ネスト型で二段階のベイズ最適化フレームワークを導入:外側のループがハードウェアアーキテクチャを最適化し、内側のループが特定のアーキテクチャに対してソフトウェアマッピングを最適化する。
- サロゲートモデルと獲得関数(例:LCB)を用いた制約付きベイズ最適化を採用し、不適切な解を回避しながら設計空間を効率的に探索する。
- 面積、エネルギー予算、評価までの不明な妥当性といったハード制約を組み込んだ制約付き定式化を採用することで、無効な設計点の割合を 90% 以上削減した。
- 機械学習を活用して性能(例:遅延、エネルギー)をモデル化し、高性能で妥当な設定へと探索を誘導する。
- CNN、MLP、Transformer を含むさまざまなDNNアーキテクチャに拡張可能でモジュラーなアプローチを実現する。
実験結果
リサーチクエスチョン
- RQ1統合的かつ自動化されたハードウェア/ソフトウェア共同設計フレームワークは、従来のハードウェアとソフトウェアの分離最適化を上回ることができるか?
- RQ2ベイズ最適化は、ニューラルアクセラレータ設定の準離散的で高制約的な設計空間に対応してどのように拡張できるか?
- RQ3エンド・ツー・エンドの共同設計により、手動最適化された最先端システムと比較して、エネルギー遅延積にどの程度の改善が得られるか?
- RQ4提案されたフレームワークは、効率性を向上させる非直感的で新しいハードウェアおよびソフトウェア設定を発見できるか?
- RQ5ResNet や DQN、MLP、Transformer などの多様なニューラルネットワークアーキテクチャにわたって、共同設計アプローチはどれほど頑健か?
主な発見
- 提案された制約付きベイズ最適化フレームワークは、DQN において手動最適化された最先端システムと比較してエネルギー遅延積が 40.2% 向上し、ResNet では 18% 向上した。
- フレームワークにより、無効な設計点の探索数が 90% 以上削減され、高制約的な設計空間内での探索効率が著しく向上した。
- 学習型共同設計アプローチにより、最適化されたPEアレイ形状やバッファ利用戦略といった、既存の設計(例:Eyeriss)を上回る新しいハードウェア構成が発見された。
- 学習で得られたハードウェア構成をヒューリスティックなソフトウェア最適化ツール(例:Timeloop)と組み合わせた場合、ツールが単独で発見できる結果よりも優れた性能が得られ、アーキテクチャにわたる頑健性が示された。
- MLP や Transformer といった多様なモデルでも優れた性能を発揮したため、この手法がCNNに限らず汎用的であることが確認された。
- サロゲートモデルと LCB などの獲得関数の使用により、高コストなシミュレーションを伴う設計空間でも、効率的かつスケーラブルに探索が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。