[논문 리뷰] MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT
MobiLlama는 모든 트랜스포머 블록에 공유된 피드포워드 네트워크(FFN)를 도입하여 부가적 중복을 줄이고 효율성을 향상시킨, 0.5B 파라미터의 완전히 투명한 소형 언어 모델(SLM)을 소개한다. 이로 인해 1B 이하의 모델 중 최고 성능을 기록하며, 평균적으로 9개의 벤치마크에서 기존 SLM보다 2.4% 높은 성능을 보이며, 낮은 메모리, 컴퓨팅 자원 및 에너지 소비로도 디바이스 내에서의 추론을 가능하게 한다.
"Bigger the better" has been the predominant trend in recent Large Language Models (LLMs) development. However, LLMs do not suit well for scenarios that require on-device processing, energy efficiency, low memory footprint, and response efficiency. These requisites are crucial for privacy, security, and sustainable deployment. This paper explores the "less is more" paradigm by addressing the challenge of designing accurate yet efficient Small Language Models (SLMs) for resource constrained devices. Our primary contribution is the introduction of an accurate and fully transparent open-source 0.5 billion (0.5B) parameter SLM, named MobiLlama, catering to the specific needs of resource-constrained computing with an emphasis on enhanced performance with reduced resource demands. MobiLlama is a SLM design that initiates from a larger model and applies a careful parameter sharing scheme to reduce both the pre-training and the deployment cost. Our work strives to not only bridge the gap in open-source SLMs but also ensures full transparency, where complete training data pipeline, training code, model weights, and over 300 checkpoints along with evaluation codes is available at : https://github.com/mbzuai-oryx/MobiLlama.
연구 동기 및 목표
- 자원 제약 환경에서 정확하고 효율적인 완전히 투명하고 오픈소스인 SLM의 부족을 해결하기 위해.
- 은닉 차원 수를 줄이거나 레이어 수를 감소시켜 대규모 모델을 축소하는 기존 SLM의 성능 한계를 극복하기 위해.
- 단순히 파라미터 수를 줄이는 것이 아니라 아키텍처 혁신을 통해 경량이면서도 강력한 SLM 프레임워크를 설계하기 위해.
- 모델 훈련 파이프라인, 코드, 모델 가중치, 300개 이상의 체크포인트를 공개하여 SLM에 대한 접근성을 민주화하기 위해.
- 실세계 응용 프로그램에서 개인정보 보호, 보안 및 에너지 효율성을 향상시키기 위해 디바이스 내 처리를 가능하게 하기 위해.
제안 방법
- 모든 트랜스포머 블록에 하나의 FFN을 공유하는 공유 피드포워드 네트워크(FFN) 아키텍처를 제안하여 파라미터 중복을 감소시킨다.
- 1.2조 토큰 데이터셋을 사용해 SLM을 처음부터 훈련시키며, 낮은 파라미터 수에서 성능을 유지하기 위해 신중한 초기화 및 최적화를 수행한다.
- 훈련 및 배포 비용을 모두 낮추면서도 모델 용량을 유지할 수 있도록 파라미터 공유 기법을 활용한다.
- 비전 인코더(CLIP)와 함께 종단 간 희소화를 통해 시각-언어 추론을 위한 다중모달 버전인 MobiLlama-V를 생성하기 위해 언어 모델을 엔드 투 엔드로 미세조정한다.
- 모델 훈련 파이프라인 전체를 공개하여 투명성과 재현 가능성을 확보하기 위해, 데이터, 코드, 모델 가중치, 300개 이상의 중간 체크포인트를 포함한다.
- GPU, CPU, 모바일 등 다양한 하드웨어에서 토큰/초, 메모리 사용량, 1000개 토큰당 배터리 소모량 등의 지표를 사용해 효율성을 평가한다.
실험 결과
연구 질문
- RQ1모든 트랜스포머 블록에 공유된 FFN 설계가 파라미터 수나 계산 비용을 늘리지 않고도 소형 언어 모델의 성능을 향상시킬 수 있는가?
- RQ2완전히 투명한 SLM이 훈련 및 추론 코드 전체를 공개할 경우, SLM 분야의 재현 가능성과 커뮤니티 수용에 어떤 영향을 미칠 수 있는가?
- RQ30.5B 파라미터 SLM이 하류 벤치마크에서 더 큰 SLM들, 심지어 일부 7B LLM들보다도 성능을 따라하거나 초월할 수 있는가?
- RQ4MobiLlama 모델은 실세계의 저자원 환경, 특히 스마트폰 및 엣지 디바이스에서 얼마나 효율적인가?
- RQ5공유된 FFN 기반 SLM은 강력한 시각적 추론 능력을 갖춘 다중모달 작업으로 효과적으로 확장될 수 있는가?
주요 결과
- MobiLlama 0.5B는 9개의 하류 벤치마크에서 평균적으로 기존 0.5B SLM보다 2.4% 높은 성능을 기록하여 뛰어난 정확도를 입증한다.
- RTX-2080Ti GPU에서 MobiLlama 0.5B는 평균 125 토큰/초의 추론 속도를 달성하며, 메모리 사용량은 1.2GB, 스마트폰에서 1000개 토큰당 12.5mAh의 배터리 소모량을 기록한다.
- i7 CPU를 탑재한 랩탑에서 MobiLlama 0.5B는 45 토큰/초의 속도를 기록하며, 메모리 사용량은 1.1GB, 1000개 토큰당 15.3mAh의 배터리 소모량을 기록한다.
- 다중모달 MobiLlama-V 0.8B 모델은 시각-언어 벤치마크에서 뛰어난 성능을 기록하였으며, MME에서 62.1%, GQA에서 58.3%의 성능을 기록하여 강력한 시각적 추론 능력을 입증한다.
- 대규모 기반 MobiLlama 1.2B 모델은 9개의 벤치마크에서 평균 점수 49.06을 기록하며, 더 큰 데이터셋으로 사전 훈련된 다른 완전히 투명한 SLM들을 능가한다.
- 모델의 효율성과 투명성 덕분에 최소한의 에너지 소비로도 디바이스 내 배포가 가능하여, 개인정보 보호, 저지연 응용 프로그램을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.