Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic-OFA: Runtime DNN Architecture Switching for Performance Scaling on Heterogeneous Embedded Platforms

Wei Lou, Xun Lei|arXiv (Cornell University)|May 8, 2021
Advanced Neural Network Applications参考文献 24被引用数 4
ひとこと要約

Dynamic-OFA は、事前学習済みの Once-for-All (OFA) スーパーネットワークを活用して、再訓練を伴わずに実行時において最適なサブネットワークを動的に選択することで、異種の組み込みプラットフォーム上でリアルタイムの DNN アーキテクチャ切り替えを実現する。これにより、類似した精度で CPU で最大 3.5 倍、GPU で最大 2.4 倍の高速な推論が達成され、Jetson Xavier NX においては、類似した遅延で CPU で 3.8%、GPU で 5.1% の高い精度が得られる。

ABSTRACT

Mobile and embedded platforms are increasingly required to efficiently execute computationally demanding DNNs across heterogeneous processing elements. At runtime, the available hardware resources to DNNs can vary considerably due to other concurrently running applications. The performance requirements of the applications could also change under different scenarios. To achieve the desired performance, dynamic DNNs have been proposed in which the number of channels/layers can be scaled in real time to meet different requirements under varying resource constraints. However, the training process of such dynamic DNNs can be costly, since platform-aware models of different deployment scenarios must be retrained to become dynamic. This paper proposes Dynamic-OFA, a novel dynamic DNN approach for state-of-the-art platform-aware NAS models (i.e. Once-for-all network (OFA)). Dynamic-OFA pre-samples a family of sub-networks from a static OFA backbone model, and contains a runtime manager to choose different sub-networks under different runtime environments. As such, Dynamic-OFA does not need the traditional dynamic DNN training pipeline. Compared to the state-of-the-art, our experimental results using ImageNet on a Jetson Xavier NX show that the approach is up to 3.5x (CPU), 2.4x (GPU) faster for similar ImageNet Top-1 accuracy, or 3.8% (CPU), 5.1% (GPU) higher accuracy at similar latency.

研究の動機と目的

  • ハードウェアリソースとアプリケーションワークロードの変動による DNN 推論における動的な性能劣化の課題に対処すること。
  • 従来の動的 DNN が各デプロイメント環境ごとに再訓練を必要とする高コストの問題を克服すること。
  • 1 つの共有バックボーンモデルを用いて、CPU、GPU、NPU などの多様なコンピューティングユニットにおける効率的な実行時適応を可能にすること。
  • 現在のハードウェア利用状況とアプリケーション制約に基づいて最適なサブネットワークを選択することで、リアルタイムにおける精度-遅延トレードオフを改善すること。
  • 事前にサブネットワークをサンプリングおよび評価することで、再訓練を完全に回避すること。

提案手法

  • 幅、深さ、フィルターサイズ、入力解像度の変更を含む、事前学習済み Once-for-All (OFA) スーパーネットワークからサブネットワークのファミリーを事前サンプリングする。
  • CPU および GPU で全サブネットワークをオフラインで評価し、精度-遅延トレードオフのパレート最適なルックアップテーブルを構築する。
  • 高速な推論とサブネットワーク切り替えを可能にするために、事前に計算されたバッチ正規化統計を保存する。
  • 実行時マネージャー (RTM) をデプロイし、50 回分の推論をカバーするスライディングウインドウを用いて、リアルタイムの遅延と精度制約を監視する。
  • 利用可能なハードウェアリソースとアプリケーション要件に基づき、実行時にサブネットワークを動的に切り替える。切り替えのオーバーヘッドを最小限に抑える。
  • 同じ GPU 上に複数の Dynamic-OFA モデルが共存する場合、個々の遅延制約を満たすためにサブネットワークを共同で適応可能にする。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み OFA スーパーネットワークを活用することで、追加の訓練なしに動的 DNN アーキテクチャ切り替えを実現できるか?
  • RQ2Dynamic-OFA は、異種 SoC における変動するハードウェアリソースの可用性に適応しながら、高い精度を維持できるか?
  • RQ3CPU および GPU ワークロードにおいて、SOTA の動的 DNN よりも優れた精度-遅延トレードオフを達成できるか?
  • RQ4複数の DNN や並列ワークロードが同じ GPU を共有する状況で、Dynamic-OFA は性能制約をどのように管理するか?
  • RQ5サブネットワーク切り替えの実行時オーバーヘッドはどれほどで、リアルタイム応答性にどのように影響するか?

主な発見

  • 類似した ImageNet Top-1 精度において、Dynamic-OFA は CPU で最大 3.5 倍、GPU で最大 2.4 倍の高速な推論を達成した。
  • 類似した遅延において、Dynamic-OFA は CPU でベースライン手法よりも 3.8% 高い Top-1 精度、GPU で 5.1% 高い精度を達成した。
  • 実行時マネージャーは、遅延制約の変化に応じてサブネットワークを適応的に切り替えることに成功し、GPU で 40ms の stricter 目標を満たすためにレベル 6 からレベル 2 に切り替えた。
  • GPU リソースが同時に学習タスクと共有される状況では、Dynamic-OFA はサブネットワークレベルを 4 から 2 に低下させ、2.6% の精度を犠牲にして遅延制約を満たした。
  • 同じ GPU 上に 2 つの Dynamic-OFA モデルが共存する場合、モデル A はレベル 6 から 5 に、モデル B はレベル 5 から 4 に切り替えることで、個々の遅延制約を満たすように共同で適応した。
  • 実行時マネージャーは切り替えごとにわずか ~15ms のオーバーヘッドを追加し、反応時間は 1〜2 秒(約 50 回の推論)であった。これは、実世界のデプロイに実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。