[論文レビュー] Real-Time Execution of Large-scale Language Models on Mobile
本論文は、コンパイラレベルの最適化をNASループに統合することで、モバイルデバイス向けにBERTモデルの精度と推論遅延を同時に最適化するコンパイラ対応のニューラルアーキテクチャサーチ(NAS)フレームワークを提案する。このフレームワークは、TensorFlow Liteよりも最大7.8倍の高速化を達成し、精度の低下は0.5–2%にとどめる。これにより、消費者向けモバイルハードウェア上で大規模なトランスフォーマー・モデルのリアルタイム推論が可能になる。
Pre-trained large-scale language models have increasingly demonstrated high accuracy on many natural language processing (NLP) tasks. However, the limited weight storage and computational speed on hardware platforms have impeded the popularity of pre-trained models, especially in the era of edge computing. In this paper, we seek to find the best model structure of BERT for a given computation size to match specific devices. We propose the first compiler-aware neural architecture optimization framework. Our framework can guarantee the identified model to meet both resource and real-time specifications of mobile devices, thus achieving real-time execution of large transformer-based models like BERT variants. We evaluate our model on several NLP tasks, achieving competitive results on well-known benchmarks with lower latency on mobile devices. Specifically, our model is 5.2x faster on CPU and 4.1x faster on GPU with 0.5-2% accuracy loss compared with BERT-base. Our overall framework achieves up to 7.8x speedup compared with TensorFlow-Lite with only minor accuracy loss.
研究の動機と目的
- リソース制限のあるモバイルデバイスに、リアルタイムの遅延要件を満たす大規模な事前学習済み言語モデル(例:BERT)をデプロイする課題に対処すること。
- ハードウェアに最適化されたNASと実際のコンパイラ最適化のギャップを埋めることで、深層レイヤーを持つモデルではNASの結果が無効になりがちな問題を解消すること。
- モデルアーキテクチャとコンパイラレベルの最適化(例:レイヤー統合)を同時に最適化し、モバイルCPUおよびGPU上で低遅延・高精度の推論を実現すること。
- TensorFlow Liteなどの主要フレームワークが対応していなかった、モバイルCPUおよびGPU上でBERTバージョンのリアルタイム実行を可能にすること。
提案手法
- コンパイラ最適化をNASループに統合することで、リアルタイムおよびリソース制約を満たすモデル生成を保証する、コンパイラ対応のニューラルアーキテクチャサーチ(NAS)フレームワークを導入する。
- 精度と遅延の最適化を目的とした、コントローラーとトレーナーのパラダイムを採用し、GLUEベンチマークでの微調整を用いて迅速な評価を実現する。
- 中間テンソルのメモリと計算オーバーヘッドを削減するための新規なレイヤー統合技術を適用し、CPUおよびGPUの両方で著しく性能向上を達成する。
- 二段階のトレーニングプロセスを採用:まず深く細いBERTバージョン(28ブロック)を訓練し、その後知識蒸留を用いてより効率的なスチューデントモデルに変換する。
- モデル構造を解析し、デバイス固有の最適化(例:統合されたレイヤー実行)を適用するコンパイラパイプラインを用いて、最適化された推論コードを生成する。
- HuggingFaceおよびカスタムコンパイルパイプラインを用い、実際のモバイルデバイス(例:Samsung Galaxy S20, S10)で測定したリアルタイムの遅延と精度を評価する。
実験結果
リサーチクエスチョン
- RQ1コンパイラ対応のNASは、大規模なBERTモデルのモバイルデバイス上でのリアルタイム推論を、モデル構造とコンパイル最適化を同時に最適化することで達成できるか?
- RQ2レイヤー統合は、特に深層トランスフォーマー・モデルにおいて、モバイルCPUおよびGPUの推論遅延を顕著に短縮できるか?
- RQ3コンパイラフィードバックを組み込んだNASフレームワークは、従来のハードウェアに最適化されたNASやTensorFlow Liteのような既存の推論フレームワークに比べ、より優れた遅延・精度のトレードオフを達成できるか?
- RQ4モバイルGPU上でBERTバージョンのリアルタイム推論は可能か?また、CPU実行やTensorFlow Liteとの比較ではどうなるか?
主な発見
- 提案されたフレームワークは、モバイルGPU上でTensorFlow Liteよりも最大7.8倍の高速化を達成し、NASを適用したBERT(ours)は、CPUでは5.2倍、GPUでは4.1倍高速に動作する。
- 精度の低下が0.5–2%にとどまる一方で、最適化されたBERTモデルはGLUEベンチマークにおいて、BERT BASEおよびMobileBERTを上回る遅延と精度の両面での優位性を示す。
- レイヤー統合により中間メモリトラフィックが削減され、実行が高速化され、GPUでは最大2.4倍、CPUでは最大2.0倍の高速化が達成された(TensorFlow Lite比)。
- 本フレームワークは、モバイルGPU上でリアルタイムのBERT推論を実現する最初のものであり、これは以前のTensorFlow Liteでは対応されていなかった。
- コンパイラ最適化なしのベースラインモデルは、CPUではTensorFlow Liteと同等の性能を示すが、GPUでは著しく性能が低下する。これは、コンパイラレベルの最適化の重要性を示している。
- NASで最適化されたモデル(BERT(ours) with NAS)は、CPUではMobileBERTよりも1.49倍、GPUでは1.53倍高速に動作し、精度低下は0.4–1%にとどまる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。