[論文レビュー] Discovering Multi-Hardware Mobile Models via Architecture Search
本論文では、CPU、GPU、DSP、EdgeTPUの複数のアクセラレータを最適化する1つのモデルを開発することを目的としたマルチハードウェアニューラルアーキテクチャサーチを提案する。これにより、デプロイおよびエンジニアリングのオーバーヘッドが削減される。マルチハードウェアメトリクスと互換性のあるサーチスペースを導入することで、一度のサーチで全ハードウェアで最先端の精度-遅延トレードオフを達成するモデルが発見され、平均および最悪ケースの遅延において単一ハードウェアモデルを上回り、サーチコストは5分の1に削減される。
Hardware-aware neural architecture designs have been predominantly focusing on optimizing model performance on single hardware and model development complexity, where another important factor, model deployment complexity, has been largely ignored. In this paper, we argue that, for applications that may be deployed on multiple hardware, having different single-hardware models across the deployed hardware makes it hard to guarantee consistent outputs across hardware and duplicates engineering work for debugging and fixing. To minimize such deployment cost, we propose an alternative solution, multi-hardware models, where a single architecture is developed for multiple hardware. With thoughtful search space design and incorporating the proposed multi-hardware metrics in neural architecture search, we discover multi-hardware models that give state-of-the-art (SoTA) performance across multiple hardware in both average and worse case scenarios. For performance on individual hardware, the single multi-hardware model yields similar or better results than SoTA performance on accelerators like GPU, DSP and EdgeTPU which was achieved by different models, while having similar performance with MobilenetV3 Large Minimalistic model on mobile CPU.
研究の動機と目的
- 複数のアクセラレータ向けに個別に最適化された単一ハードウェアモデルを維持する高いデプロイおよびエンジニアリングコストに対処すること。
- 多様なハードウェアプラットフォームをターゲットとするアプリケーションにおけるモデルデプロイの複雑さを軽減すること。
- 複数のハードウェアを同時に最適化する統合型ニューラルアーキテクチャサーチフレームワークを開発すること。
- 異種エッジデバイス間でのパフォーマンスとポータビリティのトレードオフを最小限に抑えること。
提案手法
- すべてのターゲットアクセラレータ(CPU float、CPU uint8、GPU、DSP、EdgeTPU)と互換性を持つマルチハードウェアサーチスペースを設計し、共有アーキテクチャサーチを可能にする。
- 複数のハードウェアプラットフォームにおけるモデル効率を評価するため、正規化された平均遅延および最悪ケース遅延メトリクスを導入する。
- 既存のNAS報酬関数を改変し、精度とマルチハードウェア遅延パフォーマンスの両方を組み込む。
- 共有サーチスペースと共同最適化を用いて、全ターゲットハードウェアで良好に動作する1つのモデルを発見する。
- 任意のNASアルゴリズムと互換性を持つ補完的なサーチ手法を適用し、多様なハードウェア構成にスケーリング可能にする。
- 各ターゲットデバイスでの実世界の効率性を保証するため、サーチ中にハードウェアに依存する遅延測定を活用する。
実験結果
リサーチクエスチョン
- RQ1特定の効率性を犠牲にせずに、複数の異種モバイルアクセラレータで競争力のあるパフォーマンスを達成できる1つのニューラルアーキテクチャが可能か?
- RQ2マルチハードウェアNASは、単一ハードウェアNASと比較して、精度、遅延、サーチコストの観点でどのように異なるか?
- RQ3マルチハードウェアモデルは、単一ハードウェアモデルと比較してどのような設計選択を示すか?
- RQ4マルチハードウェアメトリクス(平均および最悪ケース遅延)は、多様なハードウェアにおける実世界のパフォーマンスとどのように相関するか?
- RQ5マルチハードウェアモデルは、サーチに含まれない未ターゲットのハードウェアにも一般化可能か?
主な発見
- マルチハードウェアモデル(Multi-AVG)は、CPU float、CPU uint8、GPU、DSP、EdgeTPUの5つのハードウェアプラットフォームで、平均および最悪ケース遅延において、最先端の精度-遅延トレードオフを達成した。
- Multi-AVGは75.8%のImageNet top-1精度を達成し、正規化平均遅延が1.06、最悪ケース遅延が1.25であり、平均および最悪ケースの両方のメトリクスで単一ハードウェアモデルを上回った。
- マルチハードウェアサーチプロセスにより、5回の単一ハードウェアサーチを別々に実行する場合と比較して、合計のサーチコストが5分の1に削減された。
- 発見されたマルチハードウェアモデルは、未ターゲットのハードウェアに対しても良好に一般化し、未確認のアクセラレータでも強力なパフォーマンスを示した。
- マルチハードウェアモデルは、後方の層を重くする傾向があり、特定のハードウェアでのみ有益なSEやh-swishなどの演算を避ける傾向にあり、クロスプラットフォーム効率に焦点を当てていることが示された。
- Multi-AVGモデルは、GPU、DSP、EdgeTPUにおいて、タスク固有の単一ハードウェアモデルと同等またはそれ以上のパフォーマンスを達成しており、モバイルCPUにおけるMobileNetV3 Large Minimalisticと同等のパフォーマンスを維持した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。