[論文レビュー] Mobile Foundation Model as Firmware
本稿では、NPUに統合された変更不可な基盤モデルを備えたファームウェアとしてのMobile Foundation Model(M4)を提案する。このモデルは、多様なモバイルタスクを統合的に処理するシステムレベルのAIサービスとして機能する。各アプリケーションは、軽量でオフラインで微調整されたアダプタを用い、高い精度(85%のパラティー)、低メモリ/ストレージ使用量、およびCOTSモバイルデバイスにおける効率的な推論を実現する。
In today's landscape, smartphones have evolved into hubs for hosting a multitude of deep learning models aimed at local execution. A key realization driving this work is the notable fragmentation among these models, characterized by varied architectures, operators, and implementations. This fragmentation imposes a significant burden on the comprehensive optimization of hardware, system settings, and algorithms. Buoyed by the recent strides in large foundation models, this work introduces a pioneering paradigm for mobile AI: a collaborative management approach between the mobile OS and hardware, overseeing a foundational model capable of serving a broad spectrum of mobile AI tasks, if not all. This foundational model resides within the NPU and remains impervious to app or OS revisions, akin to firmware. Concurrently, each app contributes a concise, offline fine-tuned "adapter" tailored to distinct downstream tasks. From this concept emerges a concrete instantiation known as \sys. It amalgamates a curated selection of publicly available Large Language Models (LLMs) and facilitates dynamic data flow. This concept's viability is substantiated through the creation of an exhaustive benchmark encompassing 38 mobile AI tasks spanning 50 datasets, including domains such as Computer Vision (CV), Natural Language Processing (NLP), audio, sensing, and multimodal inputs. Spanning this benchmark, \sys unveils its impressive performance. It attains accuracy parity in 85\% of tasks, demonstrates improved scalability in terms of storage and memory, and offers satisfactory inference speed on Commercial Off-The-Shelf (COTS) mobile devices fortified with NPU support. This stands in stark contrast to task-specific models tailored for individual applications.
研究の動機と目的
- 多様なモデルアーキテクチャ、オペレータ、実装方法に起因するモバイルAIエコシステムにおける深刻な断片化を是正すること。
- タスク固有のモデルに対する一時的な最適化が引き起こすハードウェア・システム・ソフトウェアのオーバーヘッドを低減すること。
- 統一的でOS管理下の基盤モデルを通じて、アプリケーション間で重みと計算を共有する仕組みを実現すること。
- OSとハードウェアが共同で管理する恒久的かつファームウェアに似た基盤モデルを活用した、新たな共同設計パラダイムの探求。
- 1つの基盤モデルが最小限のランタイムコストで広範なモバイルAIタスクを処理可能な実現可能性の検証。
提案手法
- 基盤モデルはNPUに統合された、アプリケーションやOSによって変更不可能なファームウェアに似たシステムサービスとして実装され、安定性とハードウェアレベルの統合を確保する。
- 各アプリケーションは、その固有のタスクに最適化された軽量でパラメータ効率の良いアダプタ(例:LoRAスタイル)を提供し、オフラインで微調整する。
- システムは最先端の事前学習済みLLMおよびマルチモーダル統合技術(例:ImageBind, CoDi)を活用し、視覚、NLP、音声、センシングなど多様な入力を統合する。
- 50のデータセットにわたる38のモバイルAIタスクを網羅するベンチマークにより、M4の性能、精度、メモリ使用量、推論速度を評価する。
- アプリケーション間で動的データフローとランタイムスケジューリングを活用し、計算と重みの再利用を可能にする。
- NPUは基盤モデルと軽量アダプタの両方をネイティブに実行可能であり、CPU/GPUの関与を最小限に抑える。
実験結果
リサーチクエスチョン
- RQ1NPUに統合された単一の統一基盤モデルが、多様なモバイルタスクのためのユニバーサルオンデバイスAIエンジンとして機能可能か?
- RQ2ファームウェアベースの基盤モデルは、タスク固有のモデルと比較して精度、メモリ使用量、推論速度においてどのように異なるか?
- RQ3共同管理下の基盤モデルを通じて、アプリケーション全体で重みと計算をどれほど共有できるか?
- RQ4LoRAのようなパラメータ効率の良い微調整(PEFT)技術は、NPU最適化された推論パイプラインに効果的に統合可能か?
- RQ5時間経過に伴い基盤モデルとそのアダプタを独立して進化させるにあたり、主な課題と設計要件は何か?
主な発見
- M4は、ベンチマーク対象の38のモバイルAIタスクのうち85%でタスク固有モデルと同等の精度を達成し、優れた汎化性能を示した。
- 共有重みと統一されたモデルアーキテクチャのおかげで、ストレージおよびメモリ使用量のスケーラビリティが向上した。
- NPU搭載のCOTSモバイルデバイスにおける推論速度は満足できる水準であり、CPUに比べてNPUでの高速化が顕著に観察された。
- Snapdragon 8+ Gen 1プラットフォームでは、NPUがマルチコアCPUに比べ最大22倍の高速化を達成したが、これは現在のスタックにおけるオペレータサポート制限のため、全モデルの8%にしか適用されなかった。
- 本アプローチにより、既存のエコシステムにおけるモデル断片化のため実現が困難だった、アプリケーション間での計算と重みの共有が可能になった。
- プロトタイプは、基盤モデルをファームウェアとして実装する可能性を示したが、今後の研究でモデルサイズ、精度、アダプタの後方互換性の最適化が求められる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。