[論文レビュー] Apollo: Transferable Architecture Exploration
Apollo は、多様な制約下でもサンプル効率が高く、再利用可能なニューラルネットワークアクセラレータの設計を可能にする、ブラックボックス最適化を用いた移譲可能なアーキテクチャ探索フレームワークである。Apollo は、探索空間の約 0.0004% にとどまる中で最大 24.6% の高速化を達成し、異なる設計制約間での転移学習により最適化効率を最大 25% 向上させている。
The looming end of Moore's Law and ascending use of deep learning drives the design of custom accelerators that are optimized for specific neural architectures. Architecture exploration for such accelerators forms a challenging constrained optimization problem over a complex, high-dimensional, and structured input space with a costly to evaluate objective function. Existing approaches for accelerator design are sample-inefficient and do not transfer knowledge between related optimizations tasks with different design constraints, such as area and/or latency budget, or neural architecture configurations. In this work, we propose a transferable architecture exploration framework, dubbed Apollo, that leverages recent advances in black-box function optimization for sample-efficient accelerator design. We use this framework to optimize accelerator configurations of a diverse set of neural architectures with alternative design constraints. We show that our framework finds high reward design configurations (up to 24.6% speedup) more sample-efficiently than a baseline black-box optimization approach. We further show that by transferring knowledge between target architectures with different design constraints, Apollo is able to find optimal configurations faster and often with better objective value (up to 25% improvements). This encouraging outcome portrays a promising path forward to facilitate generating higher quality accelerators.
研究の動機と目的
- 高コストで高次元的かつ制約のある探索空間における、サンプル非効率的で再利用不可能なアクセラレータアーキテクチャ探索の課題に対処すること。
- ニューラルネットワークアクセラレータ設計のための多様な最適化戦略をサポートする汎用フレームワークの開発。
- 異なる設計制約(例:面積、レイテンシ)を持つアーキテクチャ探索タスク間での転移学習を可能にし、サンプル効率と最適化品質を向上させること。
- 再利用可能な最適化が、高価なハードウェア評価回数を減らしつつ、独立した最適化よりも優れたパフォーマンスを達成できることを実証すること。
- スケジューリングやマッピングを含む、コンピューティングスタック全体にわたるアクセラレータの共同最適化の基盤を、再利用可能な設計探索を通じて構築すること。
提案手法
- 面積およびレイテンシの制約の下でレイテンシまたは実行時間を最小化する制約付きブラックボックス最適化問題として、アクセラレータアーキテクチャ探索を定式化する。
- ランダムサーチ、ベイズ最適化、遺伝的アルゴリズム、アンサンブル手法を含む複数の最適化戦略をサポートする、カスタマイズ可能なエンドツーエンドのフレームワーク Apollo を実装する。
- 2次元のプロセッシング要素アレイ、複数のコンピューティングレーン、専用レジスタファイルを備えた高パラメータ化された自社開発エッジアクセラレータを用いて、探索空間を定義する。
- 異なる制約を持つ以前に解決済みのタスクからの知識を用いて、新しいタスクの最適化を初期化することで、転移学習を適用し、収束を高速化する。
- 高次元的で構造的かつ評価コストの高い設計空間における探索を、サーヴィレートモデリングと確率的推論を用いて誘導する。
- ハードウェアシミュレーションを目的関数評価関数として採用し、試行生成段階で妥当性チェックを通じて制約を強制する。
実験結果
リサーチクエスチョン
- RQ1ブラックボックス最適化戦略は、高性能なアクセラレータ構成を発見するために必要なハードウェア評価回数を著しく削減できるか?
- RQ2異なる設計制約(例:面積またはレイテンシ予算)を持つアーキテクチャ探索タスク間での転移学習は、最適化効率と解の品質にどのような影響を与えるか?
- RQ3ランダムサーチ、ベイズ最適化、遺伝的アルゴリズム、アンサンブル手法のうち、どれがアクセラレータ設計においてサンプル効率とパフォーマンスのバランスを最も良く満たすか?
- RQ4転移学習は、多様なニューラルワークロードと制約下で最適な構成を発見するために必要な評価回数をどの程度削減できるか?
- RQ5異なるニューラルアーキテクチャ(例:MobileNet、オブジェクト検出、セグメンテーション、OCR モデル)は、再利用可能なアーキテクチャ探索の有効性にどのような影響を与えるか?
主な発見
- Apollo は、合計探索空間の約 0.0004% に相当するわずか 2,000 回程度のハードウェア評価で、アクセラレータパフォーマンスを最大 24.6% 向上させた。
- 遺伝的および集団ベースのブラックボックス最適化戦略は、ベースラインのランダムサーチを上回り、最小限の評価回数で最高の報酬を達成した。
- 異なる設計制約を持つアーキテクチャ探索タスク間での転移学習により、独立した最適化と比較して最適化の成果が最大 25% 向上した。
- 転移学習により必要なハードウェア評価回数が削減され、特に厳しい制約下では最適な構成への収束が加速した。
- このフレームワークは、多様で複雑なアクセラレータ構成の有効な探索を可能にし、遺伝的アルゴリズムはより多様でかつ見過ごされがちな設計を生成した。
- Apollo は、関連する最適化タスク間での知識移転が、高価な評価環境下での実世界の設計サイクル時間の短縮とアクセラレータ品質の向上に極めて有効であることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。