[논문 리뷰] Mobile Foundation Model as Firmware
이 논문은 NPU에 통합된 하드웨어 보호 기반의 기초 모델을 내장한 새로운 패러다임인 Mobile Foundation Model as Firmware(M4)를 제안한다. 이 기초 모델은 다양한 모바일 작업을 위한 시스템 수준의 AI 서비스로 기능하며, 각 앱은 경량의 오프라인 미세조정된 어댑터를 사용하여 높은 정확도(85% 정밀도 유지), 낮은 메모리/저장소 사용량, 그리고 COTS 모바일 기기의 NPU에서 효율적인 추론을 실현한다.
In today's landscape, smartphones have evolved into hubs for hosting a multitude of deep learning models aimed at local execution. A key realization driving this work is the notable fragmentation among these models, characterized by varied architectures, operators, and implementations. This fragmentation imposes a significant burden on the comprehensive optimization of hardware, system settings, and algorithms. Buoyed by the recent strides in large foundation models, this work introduces a pioneering paradigm for mobile AI: a collaborative management approach between the mobile OS and hardware, overseeing a foundational model capable of serving a broad spectrum of mobile AI tasks, if not all. This foundational model resides within the NPU and remains impervious to app or OS revisions, akin to firmware. Concurrently, each app contributes a concise, offline fine-tuned "adapter" tailored to distinct downstream tasks. From this concept emerges a concrete instantiation known as \sys. It amalgamates a curated selection of publicly available Large Language Models (LLMs) and facilitates dynamic data flow. This concept's viability is substantiated through the creation of an exhaustive benchmark encompassing 38 mobile AI tasks spanning 50 datasets, including domains such as Computer Vision (CV), Natural Language Processing (NLP), audio, sensing, and multimodal inputs. Spanning this benchmark, \sys unveils its impressive performance. It attains accuracy parity in 85\% of tasks, demonstrates improved scalability in terms of storage and memory, and offers satisfactory inference speed on Commercial Off-The-Shelf (COTS) mobile devices fortified with NPU support. This stands in stark contrast to task-specific models tailored for individual applications.
연구 동기 및 목표
- 다양한 모델 아키텍처, 운영자, 및 실행 방식으로 인해 발생하는 모바일 AI 생태계의 심각한 분열 문제를 해결하기 위해.
- 특정 작업에 최적화된 모델에 대한 수시 최적화로 인한 하드웨어, 시스템, 소프트웨어 오버헤드를 줄이기 위해.
- 통합된 OS 관리 기초 모델을 통해 앱 간에 가중치와 계산을 시스템 수준에서 공유할 수 있도록 하기 위해.
- OS와 하드웨어가 공동으로 관리하는 지속 가능한, 펌웨어 유사 기초 모델을 운영하는 새로운 공동 설계 패러다임을 탐색하기 위해.
- 단일 기초 모델이 최소한의 런타임 비용으로 광범위한 모바일 AI 작업을 처리할 수 있는지의 가능성을 입증하기 위해.
제안 방법
- 기초 모델은 NPU에 내장된 펌웨어 유사 시스템 서비스로 구현되며, 앱이나 OS에 의해 변경 불가능하여 안정성과 하드웨어 수준의 통합을 보장한다.
- 각 애플리케이션은 자체 작업에 최적화된 경량의 파rameter 효율적 어댑터(LiRA 스타일 등)를 오프라인에서 사전 미세조정하여 기여한다.
- 시스템은 최신 기술의 사전 훈련된 LLM과 다중 모odal 정렬 기법(예: ImageBind, CoDi)을 활용하여 다양한 입력(시각, NLP, 오디오, 센서)을 통합한다.
- 50개의 데이터셋을 기반으로 한 38개의 모바일 AI 작업에 대한 종합적 벤치마크를 통해 M4의 성능, 정확도, 메모리 사용량, 추론 속도를 평가한다.
- 응용 프로그램 간 동적 데이터 플로우 및 런타임 스케줄링을 지원하여 공유 계산과 가중치 재사용을 가능하게 한다.
- NPU는 기초 모델과 경량 어댑터를 모두 네이티브로 실행하여 CPU/GPU의 참여를 최소화한다.
실험 결과
연구 질문
- RQ1NPU에 통합된 단일 통합 기초 모델이 다양한 모바일 작업을 위한 유일한 현장 내 AI 엔진으로 기능할 수 있는가?
- RQ2펌웨어 기반 기초 모델은 정확도, 메모리 사용량, 추론 속도 측면에서 특정 작업에 최적화된 모델과 비교해 어떻게 성능을 내는가?
- RQ3공동 관리 기반 기초 모델을 통해 시스템 수준의 가중치 및 계산 공유를 어느 정도 달성할 수 있는가?
- RQ4LiRA와 같은 파라미터 효율적 미세조정(PEFT) 기법이 모바일 NPU 최적화 추론 파이프라인에 효과적으로 통합될 수 있는가?
- RQ5시간이 지남에 따라 기초 모델과 어댑터를 별도로 진화시키기 위한 주요 과제와 설계 요구사항은 무엇인가?
주요 결과
- M4는 벤치마크된 38개의 모바일 AI 작업 중 85%에서 특정 작업에 최적화된 모델과 동등한 정확도를 달성하여 강력한 일반화 능력을 입증한다.
- 공유 가중치와 통합된 모델 아키텍처 덕분에 저장소 및 메모리 사용량 측면에서 향상된 확장성(스케일러비리티)을 보였다.
- NPU를 지원하는 COTS 모바일 기기에서의 추론 속도는 만족스럽고, CPU 대비 NPU에서 뚜렷한 속도 향상이 관찰되었다.
- 스냅드래곤 8+ 제1세대 플랫폼에서 NPU는 다중 코어 CPU 대비 최대 22배의 속도 향상을 기록했지만, 현재 스택의 연산자 지원 한계로 인해 전체 모델의 8%에만 해당했다.
- 기존 생태계의 모델 분열 문제로 인해 현재는 불가능한 바, 이 접근법은 앱 간에 계산 및 가중치 공유를 실현한다.
- 프로토타입은 기초 모델을 펌웨어로 구현하는 것이 가능하다는 것을 입증했지만, 향후 모델 크기 최적화, 정확도 향상, 어댑터의 후행 호환성 향상을 위한 연구가 필요하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.