Skip to main content
QUICK REVIEW

[論文レビュー] MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT

Omkar Thawakar, Ashmal Vayani|arXiv (Cornell University)|Feb 26, 2024
Advanced Data Storage Technologies被引用数 4
ひとこと要約

MobiLlamaは、すべてのTransformerブロックに共通のフィードフォワードネットワーク(FFN)を採用することで、冗長性を低減し、効率性を向上させた、完全に透明な0.5Bパラメータの小規模言語モデル(SLM)を提供する。これにより、1B未満のモデルの中でも最先端の性能を達成し、9つのベンチマークで平均2.4%の性能向上を実現。また、低メモリ、低計算リソース、低消費電力でデバイス内での推論を可能にした。

ABSTRACT

"Bigger the better" has been the predominant trend in recent Large Language Models (LLMs) development. However, LLMs do not suit well for scenarios that require on-device processing, energy efficiency, low memory footprint, and response efficiency. These requisites are crucial for privacy, security, and sustainable deployment. This paper explores the "less is more" paradigm by addressing the challenge of designing accurate yet efficient Small Language Models (SLMs) for resource constrained devices. Our primary contribution is the introduction of an accurate and fully transparent open-source 0.5 billion (0.5B) parameter SLM, named MobiLlama, catering to the specific needs of resource-constrained computing with an emphasis on enhanced performance with reduced resource demands. MobiLlama is a SLM design that initiates from a larger model and applies a careful parameter sharing scheme to reduce both the pre-training and the deployment cost. Our work strives to not only bridge the gap in open-source SLMs but also ensures full transparency, where complete training data pipeline, training code, model weights, and over 300 checkpoints along with evaluation codes is available at : https://github.com/mbzuai-oryx/MobiLlama.

研究の動機と目的

  • リソース制約のある環境において、正確かつ効率的な完全に透明でオープンソースのSLMが不足している問題を解決すること。
  • 大規模モデルを隠れ層の次元数や層の数を減らすことでスケーリングする従来のSLMの性能制限を克服すること。
  • パラメータ数ではなく、アーキテクチャのイノベーションによって、軽量でありながら高い性能を発揮するSLMフレームワークを設計すること。
  • 完全なトレーニングパイプライン、コード、モデル重み、300以上のチェックポイントを公開することで、SLMへのアクセスを民主化すること。
  • 実世界のアプリケーションにおけるプライバシー、セキュリティ、エネルギー効率の向上を実現するため、デバイス内処理を可能にすること。

提案手法

  • すべてのTransformerブロックに1つのFFNを共有するアーキテクチャを提案し、パラメータの重複を低減する。
  • 1.2TトークンのデータセットからスクラッチでSLMをトレーニングし、パラメータ数が少ない状態で性能を維持できるよう、慎重な初期化と最適化を実施する。
  • パラメータ共有機構を活用することで、事前学習およびデプロイコストを低減しながら、モデル容量を保持する。
  • 視覚エンコーダー(CLIP)とエンドツーエンドでファインチューニングすることで、視覚推論に適したマルチモーダル版MobiLlama-Vを構築する。
  • 完全なトレーニングパイプライン(データ、コード、モデル重み、300以上の途中チェックポイントを含む)を公開し、完全な透明性と再現可能性を確保する。
  • GPU、CPU、モバイルデバイスなど多様なハードウェア上で、1秒あたりのトークン数、メモリ使用量、1000トークンあたりのバッテリー消費量などの指標を用いて、効率性を評価する。

実験結果

リサーチクエスチョン

  • RQ1すべてのTransformerブロックに共通のFFNを採用することで、パラメータ数や計算コストを増加させずに、小規模言語モデルの性能を向上させることができるか?
  • RQ2完全に透明なSLM(トレーニングおよび推論コードを完全公開)は、SLM分野における再現性とコミュニティの採用にどのような影響を与えるか?
  • RQ30.5BパラメータのSLMが、より大きなSLMや一部の7BパラメータのLLMと比較して、下流ベンチマークで同等またはそれを上回る性能を発揮できるか、その程度はどの程度か?
  • RQ4MobiLlamaモデルは、モバイルやエッジデバイスを含む実際の低リソース環境において、どの程度効率的か?
  • RQ5共通のFFNに基づくSLMは、強力な視覚推論能力を備えたマルチモーダルタスクに効果的に拡張可能か?

主な発見

  • MobiLlama 0.5Bは、9つの下流ベンチマークで平均2.4%の性能向上を達成し、既存の0.5B SLMを上回ることを示した。
  • RTX-2080Ti GPU上では、平均125トークン/秒の推論速度を達成し、メモリ使用量は1.2 GB、スマートフォン上では1000トークンあたり12.5 mAhのバッテリー消費量だった。
  • i7 CPU搭載のラップトップ上では、MobiLlama 0.5Bは45トークン/秒の速度を達成し、メモリ使用量は1.1 GB、1000トークンあたり15.3 mAhのバッテリー消費量だった。
  • マルチモーダル版MobiLlama-V 0.8Bは、視覚言語ベンチマークで強力な性能を発揮し、MMEで62.1%、GQAで58.3%のスコアを記録した。
  • 大規模ベースのMobiLlama 1.2Bは、9つのベンチマークで平均49.06のスコアを達成し、より大きなデータセットで事前学習された他の完全に透明なSLMを上回った。
  • モデルの効率性と透明性のおかげで、最小限のエネルギー消費でデバイス内デプロイが可能となり、プライバシー保護型で低遅延なアプリケーションを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。