[論文レビュー] Auto-NBA: Efficient and Effective Search Over the Joint Space of Networks, Bitwidths, and Accelerators
Auto-NBA は、ニューラルネットワーク、ビット幅、アクセラレータの差分可能で統合的な探索フレームワークを提案し、精度と効率を最大化する。非一様サンプリングと差分可能アクセラレータ探索エンジンを導入することで、メモリ爆発、離散的アクセラレータ設計、および相互依存問題を克服し、従来の共同探索手法と比較して20.9%の低遅延と0.96%の高い精度を達成する。
While maximizing deep neural networks' (DNNs') acceleration efficiency requires a joint search/design of three different yet highly coupled aspects, including the networks, bitwidths, and accelerators, the challenges associated with such a joint search have not yet been fully understood and addressed. The key challenges include (1) the dilemma of whether to explode the memory consumption due to the huge joint space or achieve sub-optimal designs, (2) the discrete nature of the accelerator design space that is coupled yet different from that of the networks and bitwidths, and (3) the chicken and egg problem associated with network-accelerator co-search, i.e., co-search requires operation-wise hardware cost, which is lacking during search as the optimal accelerator depending on the whole network is still unknown during search. To tackle these daunting challenges towards optimal and fast development of DNN accelerators, we propose a framework dubbed Auto-NBA to enable jointly searching for the Networks, Bitwidths, and Accelerators, by efficiently localizing the optimal design within the huge joint design space for each target dataset and acceleration specification. Our Auto-NBA integrates a heterogeneous sampling strategy to achieve unbiased search with constant memory consumption, and a novel joint-search pipeline equipped with a generic differentiable accelerator search engine. Extensive experiments and ablation studies validate that both Auto-NBA generated networks and accelerators consistently outperform state-of-the-art designs (including co-search/exploration techniques, hardware-aware NAS methods, and DNN accelerators), in terms of search time, task accuracy, and accelerator efficiency. Our codes are available at: https://github.com/RICE-EIC/Auto-NBA.
研究の動機と目的
- ニューラルネットワーク、ビット幅、アクセラレータの間の共同最適化の欠如に起因する、密接に結合されたが従来は別々に扱われてきた要因を解決すること。
- 探索中に異なるビット幅を逐次訓練することで生じるメモリ爆発と偏った精度ランク付けを回避すること。
- ネットワーク-アクセラレータ共同探索における「鶏とたまご」問題を、探索中にオペレーション単位のハードウェアコスト推定を可能にすることで解決すること。
- 大規模な共同設計空間を効率的に探索できるスケーラブルで差分可能なフレームワークの開発。
- 精度、遅延、探索効率の点で、既存の共同探索、ハードウェアに配慮したNAS、DNNアクセラレータ設計を上回ること。
提案手法
- 異なるビット幅選択と重みの同時更新を可能にする非一様サンプリング戦略を導入し、逐次学習を回避し、精度ランク付けの偏りを防ぐ。
- アクセラレータマイクロアーキテクチャ(例:メモリ階層、ループタイリング、プロセッシングアレイサイズ)を連続変数としてモデル化し、勾配ベース最適化が可能な差分可能アクセラレータ探索エンジンを採用。
- ネットワークアーキテクチャ、ビット幅、アクセラレータ設定をエンドツーエンド差分可能に共同最適化する共同探索パイプラインを採用。
- 大規模な設計空間における共同探索で発生するメモリ爆発を防ぐために、定常メモリ使用量のサンプリング方式を適用。
- 探索中に理論的ハードウェアコスト推定を活用することで、ネットワーク探索時に未知の最適アクセラレータの「鶏とたまご」問題を解決。
- DSP や面積制約などのハードウェア制約下で精度と推論速度のバランスを取るために、パレートフロンティアベースの評価を採用。
実験結果
リサーチクエスチョン
- RQ1差分可能で統合的な探索フレームワークは、禁止的なメモリコストや時間コストを伴わずに、ニューラルネットワーク、ビット幅、アクセラレータを同時に最適化できるか?
- RQ2アクセラレータ設計の離散的かつ非差分可能特性を、差分可能探索パイプラインに統合する方法は何か?
- RQ3非一様サンプリングは、共同探索における精度ランク付けとメモリ効率の点で、逐次的または均一サンプリングを上回るか?
- RQ4ネットワーク、ビット幅、アクセラレータの共同最適化は、逐次的または部分的最適化と比較して、ハードウェア効率とモデル精度をどの程度向上させるか?
- RQ5提案されたフレームワークは、実世界のFPGAおよびASIC実装において、最先端の共同探索およびハードウェアに配慮したNAS手法を上回る性能を達成できるか?
主な発見
- Auto-NBA は、同等の面積消費量下で CIFAR-100 において NHAS 共同探索ベースラインと比較し、0.96%高い精度と20.9%低い遅延を達成し、優れた効率性と精度を示した。
- 非一様サンプリング戦略により、偏りのないビット幅ランク付けと定常メモリ使用量が実現され、逐次学習や均一サンプリング手法を上回った。
- Auto-NBA は、逐次最適化ベースラインを一貫して上回り、1.95%高い精度と1.75倍の高い FPS を達成した。これは、理論的効率と実際のハードウェア効率の間の相関が弱いことを示している。
- 探索されたネットワークは、FPGA上で幅広い浅いアーキテクチャを好む傾向があり、これにより特徴量/チャネル単位の並列処理がより効果的に活用され、スループットが向上する。
- 探索されたアクセラレータは、ネットワークをパイプライン化されたチャンクに分割し、初期層では空間次元をタイリングし、深層部ではチャネル次元をタイリングすることで、並列性とリソース利用率を最大化する。
- Auto-NBA は、DSP や面積制約のさまざまな範囲でスケーラブルなパフォーマンスを発揮し、異なるハードウェア仕様に強い柔軟性と適応性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。