Skip to main content
QUICK REVIEW

[论文解读] MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT

Omkar Thawakar, Ashmal Vayani|arXiv (Cornell University)|Feb 26, 2024
Advanced Data Storage Technologies被引用 4
一句话总结

MobiLlama 引入了一种完全透明的 0.5B 参数小语言模型(SLM),通过在所有 Transformer 块中共享前馈网络(FFN),减少了冗余并提升了效率,从而在参数量小于 1B 的模型中实现了最先进性能。它在九项基准测试中平均性能优于现有 SLM 2.4%,同时实现了低内存、低算力和低能耗的设备端推理。

ABSTRACT

"Bigger the better" has been the predominant trend in recent Large Language Models (LLMs) development. However, LLMs do not suit well for scenarios that require on-device processing, energy efficiency, low memory footprint, and response efficiency. These requisites are crucial for privacy, security, and sustainable deployment. This paper explores the "less is more" paradigm by addressing the challenge of designing accurate yet efficient Small Language Models (SLMs) for resource constrained devices. Our primary contribution is the introduction of an accurate and fully transparent open-source 0.5 billion (0.5B) parameter SLM, named MobiLlama, catering to the specific needs of resource-constrained computing with an emphasis on enhanced performance with reduced resource demands. MobiLlama is a SLM design that initiates from a larger model and applies a careful parameter sharing scheme to reduce both the pre-training and the deployment cost. Our work strives to not only bridge the gap in open-source SLMs but also ensures full transparency, where complete training data pipeline, training code, model weights, and over 300 checkpoints along with evaluation codes is available at : https://github.com/mbzuai-oryx/MobiLlama.

研究动机与目标

  • 解决在资源受限环境中既准确又高效但完全透明且开源的 SLM 缺乏的问题。
  • 克服传统 SLM 通过减少隐藏维度或层数来缩放大模型所导致的性能限制。
  • 设计一种轻量化但强大的 SLM 框架,通过架构创新而非单纯增加参数量来保持高性能。
  • 通过发布完整的训练流程、代码、模型权重以及 300 多个检查点,实现 SLM 的普惠化。
  • 在真实应用场景中实现设备端处理,以提升隐私性、安全性与能效效率。

提出的方法

  • 提出一种共享前馈网络(FFN)架构,即单个 FFN 在所有 Transformer 块之间共享,以减少参数冗余。
  • 使用 1.2T 标记的训练数据集从零开始训练 SLM,通过精细的初始化与优化策略,在低参数量下保持高性能。
  • 采用参数共享机制,在降低预训练与部署成本的同时保持模型容量。
  • 通过端到端微调语言模型与视觉编码器(CLIP),构建多模态版本 MobiLlama-V,用于视觉推理。
  • 发布完整的训练流程,包括数据、代码、模型权重以及 300 多个中间检查点,以确保完全透明与可复现性。
  • 使用每秒生成标记数、内存占用和每 1000 标记的电池消耗等指标,在 GPU、CPU 和移动设备等多种硬件上评估效率。

实验结果

研究问题

  • RQ1在不增加参数量或计算成本的前提下,是否可以通过在所有 Transformer 块中共享 FFN 架构来提升小语言模型的性能?
  • RQ2完全透明的 SLM(包括完整训练与推理代码发布)在 SLM 领域中对可复现性与社区采纳程度有何影响?
  • RQ30.5B 参数的 SLM 在下游基准测试中,能在多大程度上匹配甚至超越更大规模的 SLM,甚至部分 7B 量级的大语言模型(LLM)?
  • RQ4MobiLlama 模型在真实低资源环境(包括移动设备与边缘设备)中的效率如何?
  • RQ5基于共享 FFN 的 SLM 是否能有效扩展至多模态任务,并具备强大的视觉推理能力?

主要发现

  • MobiLlama 0.5B 在九项下游基准测试中平均性能优于现有 0.5B SLM 2.4%,展现出更优的准确性。
  • 在 RTX-2080Ti GPU 上,模型平均推理速度达 125 tokens/sec,内存占用仅 1.2 GB,智能手机上每 1000 标记的电池消耗为 12.5 mAh。
  • 在配备 i7 CPU 的笔记本电脑上,MobiLlama 0.5B 实现 45 tokens/sec 的推理速度,内存占用 1.1 GB,每 1000 标记的电池消耗为 15.3 mAh。
  • 多模态版本 MobiLlama-V 0.8B 在视觉语言基准测试中表现强劲,MME 上达到 62.1%,GQA 上达到 58.3%,展现出强大的视觉推理能力。
  • 大模型基线版本 MobiLlama 1.2B 在九项基准测试中平均得分为 49.06,优于其他在更大数据集上预训练的完全透明 SLM。
  • 该模型的高效性与透明性使其能够实现极低能耗的设备端部署,支持隐私保护、低延迟的应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。