[論文レビュー] Standing on the Shoulders of Giants: Hardware and Neural Architecture Co-Search with Hot Start
HotNASは、事前学習済みモデル(『ホットスタート』)から開始するハードウェアおよびニューラルアーキテクチャ共同探索フレームワークを提案する。これにより、探索時間を数百GPU時間から3GPU時間未塔に短縮する。モデル圧縮をハードウェアに配慮したニューラルアーキテクチャ探索と統合した共同設計パイプラインにより、Xilinx FPGAs上で5msの遅延制約のもとでImageNetで最高1位の精度が5.79%、最高5位の精度が3.97%向上した。
Hardware and neural architecture co-search that automatically generates Artificial Intelligence (AI) solutions from a given dataset is promising to promote AI democratization; however, the amount of time that is required by current co-search frameworks is in the order of hundreds of GPU hours for one target hardware. This inhibits the use of such frameworks on commodity hardware. The root cause of the low efficiency in existing co-search frameworks is the fact that they start from a "cold" state (i.e., search from scratch). In this paper, we propose a novel framework, namely HotNAS, that starts from a "hot" state based on a set of existing pre-trained models (a.k.a. model zoo) to avoid lengthy training time. As such, the search time can be reduced from 200 GPU hours to less than 3 GPU hours. In HotNAS, in addition to hardware design space and neural architecture search space, we further integrate a compression space to conduct model compressing during the co-search, which creates new opportunities to reduce latency but also brings challenges. One of the key challenges is that all of the above search spaces are coupled with each other, e.g., compression may not work without hardware design support. To tackle this issue, HotNAS builds a chain of tools to design hardware to support compression, based on which a global optimizer is developed to automatically co-search all the involved search spaces. Experiments on ImageNet dataset and Xilinx FPGA show that, within the timing constraint of 5ms, neural architectures generated by HotNAS can achieve up to 5.79% Top-1 and 3.97% Top-5 accuracy gain, compared with the existing ones.
研究の動機と目的
- ターゲットハードウェアごとに数百GPU時間必要とされる、現在のハードウェアおよびニューラルアーキテクチャ共同探索フレームワークの非効率性を解消すること。
- モデルズーから入手可能な既存の事前学習済みモデルを活用することで、冷スタート探索のボトルネックを克服し、収束を加速すること。
- 遅延を低減しながら精度を維持するため、モデル圧縮を共同探索空間に統合すること。
- ハードウェア設計、ニューラルアーキテクチャ、圧縮空間の間でグローバルに最適化された、結合された探索パイプラインを開発すること。
- リアルタイムエッジアプリケーションの厳密なタイミング制約を満たす、高速で高精度かつハードウェアに配慮したモデル生成を可能にすること。
提案手法
- 手動設計、NASで同定された、または転移学習されたモデルを含む、既存のモデルズーから『ホットスタート』を開始する。
- iDetectを用いて、候補モデルのハードウェア性能ボトルネック(例:メモリ帯域幅、計算利用率)を特定する。
- iDetectの結果に基づき、iSpace探索空間を構築する。ここには、ニューラルアーキテクチャの変種(例:深さ、幅、カーネルサイズ)、ハードウェアのループタイル化、圧縮技術(例:プルーニング)が含まれる。
- 報酬関数を精度と遅延(ハイパーパramータ α で制御)に重み付けした強化学習ベースの最適化手法 iSearch を用い、すべての探索空間を共同最適化する。
- iDesign を用いて、候補設計の遅延とリソース使用量を予測する性能モデルを構築し、完全な合成を経ずに高速な評価を可能にする。
- 2段階のファインチューニングプロセスを適用する:速やかな探索のための小バッチサイズ(β=10)を用いた高速探索フェーズ、その後に最終的な精度検証のためのフル精度ファインチューニング(β=195)を実施する。
実験結果
リサーチクエスチョン
- RQ1事前学習済みモデルを用いた『ホット』状態から探索を開始することで、ハードウェアおよびニューラルアーキテクチャ共同探索に要する時間が著しく短縮されるか?
- RQ2共同探索空間にモデル圧縮を統合することで、遅延、精度、ハードウェア効率のトレードオフにどのような影響を与えるか?
- RQ3ハードウェア設計、ニューラルアーキテクチャ、圧縮空間を効果的に共同最適化できる程度はどの程度か?
- RQ4提案フレームワークは、数百GPU時間から3時間未塔に短縮された探索時間で、最先端の精度を達成できるか?
- RQ5報酬関数のハイパーパramータ α の選択が、最終設計における精度と遅延のバランスにどのように影響するか?
主な発見
- HotNASは、プロキシデータセットを用いず、ImageNetでは探索時間を約200GPU時間(冷スタート)から3GPU時間未塔に短縮した。CIFAR-10では20分未塔に短縮した。
- Xilinx ZCU 102 FPGAで5msの遅延制約のもとで、ImageNetでは最先端のモデル比で最高1位の精度が5.79%、最高5位の精度が3.97%向上した。
- CIFAR-10では、MobileNetで最大0.10%の精度向上、BitNetで最大48.26%の遅延低減を達成し、高速探索モードで20分の探索時間で実現した。
- 高速探索モード(β=10)は、DenseNetの1エポック探索比で0.11%高い精度を達成しながら、探索時間を20分未塔に短縮した。
- 報酬関数のα=0.7(精度中心)では約160エピソードで収束し、2msの遅延閾値に近いモデルが得られた。一方、α=0.3(遅延中心)では約120エピソードでより速く収束し、遅延が低くなった。
- 遅延制約に違反した場合、トレーニングを早期に終了することで探索を加速する。これにより、非実行可能な設計のフィルタリングにおいて、フレームワークの効率性が実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。