Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Latency Performance Estimation for Once-For-All Neural Architecture Search

Muhtadyuzzaman Syed, Arvind Akpuram Srinivasan|arXiv (Cornell University)|Jan 4, 2021
Advanced Neural Network Applications参考文献 8被引用数 5
ひとこと要約

本稿では、一度に全ネットワークアーキテクチャ探索(OFA)のための一般化された遅延予測フレームワークを提案する。このフレームワークは、ハードウェア固有のルックアップテーブルの代わりに学習可能な遅延予測器を採用する。微調整およびGPU一般化戦略を導入することで、ProxylessNASと比較して50%以上のRMSE低減を達成し、多様なハードウェアプラットフォームでベースライン性能を維持または上回る。これにより、人的作業が著しく削減され、効率的かつハードウェアに依存しないNASが可能になる。

ABSTRACT

Neural Architecture Search (NAS) has enabled the possibility of automated machine learning by streamlining the manual development of deep neural network architectures defining a search space, search strategy, and performance estimation strategy. To solve the need for multi-platform deployment of Convolutional Neural Network (CNN) models, Once-For-All (OFA) proposed to decouple Training and Search to deliver a one-shot model of sub-networks that are constrained to various accuracy-latency tradeoffs. We find that the performance estimation strategy for OFA's search severely lacks generalizability of different hardware deployment platforms due to single hardware latency lookup tables that require significant amount of time and manual effort to build beforehand. In this work, we demonstrate the framework for building latency predictors for neural network architectures to address the need for heterogeneous hardware support and reduce the overhead of lookup tables altogether. We introduce two generalizability strategies which include fine-tuning using a base model trained on a specific hardware and NAS search space, and GPU-generalization which trains a model on GPU hardware parameters such as Number of Cores, RAM Size, and Memory Bandwidth. With this, we provide a family of latency prediction models that achieve over 50% lower RMSE loss as compared to with ProxylessNAS. We also show that the use of these latency predictors match the NAS performance of the lookup table baseline approach if not exceeding it in certain cases.

研究の動機と目的

  • OFAのハードウェア固有の遅延ルックアップテーブルに一般化性の欠如がある問題に対処する。これは、各プラットフォームで膨大な手作業のキャリブレーションが必要である。
  • NASにおける新しいハードウェアプラットフォーム用の遅延ルックアップテーブルを構築する際の計算コストと人的コストを低減する。
  • CNNモデルのマルチプラットフォーム展開を支援するため、一度に全ネットワークアーキテクチャ探索(OFA)における効率的かつハードウェアに依存しない遅延推定を実現する。
  • 多様なハードウェア構成で高い精度を維持するスケーラブルでトレーニング可能な遅延予測フレームワークを開発する。
  • 学習された遅延予測器が、従来のルックアップテーブルベースのNASと同等またはそれを上回る性能を示しつつ、トレーニングのオーバーヘッドを最小限に抑えることを実証する。

提案手法

  • CNNレイヤー構成と測定済み遅延のデータセットを用いて、特定のハードウェアプラットフォーム(例:Samsung Note 10)でベースの遅延予測器をトレーニングする。
  • 小さなターゲットデータセット(完全なトレーニングデータの80%未満)を用いて、ベースモデルを新しいハードウェアプラットフォームに適応させるための微調整を実施する。
  • GPU一般化を導入し、GPUハードウェアパラメータ(コア数、RAMサイズ、メモリ帯域幅)を入力特徴として取り入れた遅延予測器をトレーニングする。
  • トランスファー学習とアーキテクチャ適応を用いて、複数のハードウェアプラットフォームに一般化可能な統合遅延予測モデルを構築する。
  • トレーニング済みの遅延予測器をNAS探索ループ内のパフォーマンス推定器として使用し、効率的なアーキテクチャ評価のためのルックアップテーブルを置き換える。
  • 4つのハードウェアプラットフォーム(Samsung Galaxy Note 10、Intel Xeon CPU、RTX 2080 Ti GPU、Tesla P40 GPU)でフレームワークを評価する。

実験結果

リサーチクエスチョン

  • RQ11つの遅延予測器が、プラットフォーム固有のルックアップテーブルを一切必要とせずに、多様なハードウェアプラットフォームに効果的に一般化できるか?
  • RQ2事前学習済みの遅延予測器を新しいハードウェアプラットフォームに微調整する方法と、初期からトレーニングを再開する方法とを比較した場合、精度とデータ効率の点でどちらが優れるか?
  • RQ3コア数やメモリ帯域幅などのGPUパラメータに基づいてトレーニングされた遅延予測器が、異なるGPUモデル間でどの程度一般化できるか?
  • RQ4NASにおける学習済み遅延予測器の使用が、ベースラインのルックアップテーブル手法と比較してモデル精度や探索効率を低下させるか?
  • RQ5トランスファー学習を遅延推定に適用する際、予測精度(RMSE)とデータ効率のトレードオフはどの程度か?

主な発見

  • 提案された遅延予測器は、ProxylessNASベースラインと比較して50%以上のRMSE低減を達成し、優れた予測精度を示した。
  • 元のデータセットの20%のデータでトレーニングされた微調整済みモデルが、ハードウェア固有のルックアップテーブルと同等の性能を達成し、データおよびトレーニングのオーバーヘッドを顕著に削減した。
  • 微調整済みの遅延予測器は、ルックアップテーブルベースラインのNAS性能と同等またはそれを上回り、モデル精度や探索効率に劣化は認められなかった。
  • GPU一般化戦略により、1つのモデルがハードウェア構成を入力として用いて複数のGPUタイプの遅延を予測可能となり、各GPUのキャリブレーションの必要性が削減された。
  • RTX 2080 Tiでは、特定の遅延制約下で、微調整済みの遅延予測器がルックアップテーブルおよび直接測定手法を上回る性能を示し、より高いロバストネスを示した。
  • このフレームワークにより、各ハードウェアごとの手動遅延測定を一切不要とし、効率的なマルチプラットフォームNASが可能になった。これにより、CO2排出量とGPU時間の両方が顕著に削減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。