Skip to main content
QUICK REVIEW

[論文レビュー] Apple Intelligence Foundation Language Models

Tom Gunter, Z. Wang|arXiv (Cornell University)|Jul 29, 2024
Advanced Database Systems and Queries被引用数 4
ひとこと要約

本論文では、オンデバイスおよびプライベートクラウド推論をそれぞれ目的としたAppleの基盤言語モデル—AFM-on-device(約30億パラメータ)およびAFM-server—を提示する。主な焦点は効率性、正確性、そして責任あるAIにあり、最適化されたTransformerアーキテクチャ、高品質でキュレートされたデータ、厳密なレッドチーム演習を活用することで、有害なコンテンツに関する人間の好み評価において他社製品を上回る最先端の安全性とパフォーマンスを達成している。

ABSTRACT

We present foundation language models developed to power Apple Intelligence features, including a ~3 billion parameter model designed to run efficiently on devices and a large server-based language model designed for Private Cloud Compute. These models are designed to perform a wide range of tasks efficiently, accurately, and responsibly. This report describes the model architecture, the data used to train the model, the training process, how the models are optimized for inference, and the evaluation results. We highlight our focus on Responsible AI and how the principles are applied throughout the model development.

研究の動機と目的

  • iOS、iPadOS、macOSのApple Intelligence機能に統合可能な、高機能で効率的かつプライバシーを尊重する基盤言語モデルの開発。
  • ユーザーの権限強化、多様性の反映、注意深い設計、プライバシー保護といった根幹的原則をモデル開発の全段階に統合することで、責任あるAIを確保すること。
  • 多様なタスク(テキスト生成、要約、ツール利用など)において高いパフォーマンスを維持しつつ、低遅延でオンデバイス推論に最適化されたモデルの最適化。
  • 敵対的プロンプトと他社製モデルとの人間の好み比較を用いた、モデルの安全性に関する厳密な評価。
  • ユーザーのデータを尊重し、バイアスを回避するための能動的設計とデータキュレーションを通じて、スケーラブルでプライバシー最優先のAIシステムの構築。

提案手法

  • トレーニングの安定性を高めるために、RMSNorm、事前正規化、クエリ/キー正規化を備えた密度型デコーダー専用のTransformerアーキテクチャを採用。
  • KVキャッシュのメモリ使用量を削減し、推論効率を向上させるために、8つのキーベクトルヘッドを備えたグループ化クエリアテンション(GQA)を採用。
  • パラメータ数の削減と計算効率の向上を図るため、共有入力/出力埋め込みとSwiGLU活性化関数を活用。
  • 長文の推論を可能にするために、50万の基本周波数を有するRoPE位置埋め込みを採用。
  • ライセンス付き出版物のコンテンツ、オープンソースデータセット、Applebotがクロールしたウェブページから構成される高品質で多様なトレーニングデータセットをキュレートし、個人情報(PII)、不適切な表現、危険なコンテンツを厳密にフィルタリング。
  • モデルの脆弱性を特定・是正するため、安全に関する分類体系を用いた自動プロンプト生成と人間によるレッドチーム演習を実施。

実験結果

リサーチクエスチョン

  • RQ1オンデバイス推論に最適化された状態で高いパフォーマンスを発揮しつつ、効率性と電力効率を維持できる基盤言語モデルのアーキテクチャ設計はどのようなものか?
  • RQ2高品質で安全かつプライバシー保護された事前学習データを確保するために、最も効果的なデータキュレーションおよびフィルタリング戦略は何か?
  • RQ3バイアス低減とプライバシー保護を含む責任あるAIの原則は、モデルの安全性とユーザーの信頼にどの程度寄与するか?
  • RQ4有害性と有用性の両面で、他社製およびオープンソースモデルと比較して、人間の好み評価においてモデルのパフォーマンスはどの程度優れているか?
  • RQ5自動および人間によるレッドチーム演習は、敵対的プロンプトに対するモデルの脆弱性を効果的に特定・低減できるか?

主な発見

  • AFM-on-deviceおよびAFM-serverは、オープンソースおよび商業用モデルと比較して、敵対的プロンプトに対する違反率が顕著に低く、有害なコンテンツに対して高い耐性を示している。
  • 人間のグレーディング評価において、85%のケースでAppleのモデルの出力が他社製モデルの出力よりも好まれており、安全性と有用性の両面で優れていると評価された。
  • テキスト生成、要約、ツール利用といった多様なタスクにおいても、高いパフォーマンスを維持しており、オンデバイスモデルは約2.58Bの非埋め込みパラメータを有し、Apple Silicon上で効率的な推論が可能である。
  • 厳密なデータのデコンタミネーションとフィルタリングにより、PII、不適切な表現、危険なコンテンツへの露出が大幅に削減され、トレーニングには個人のユーザー情報は一切使用されていない。
  • 内部および外部のクラウドレッドチームを活用し、健康支援リソースと時間制限を設けることで、ユーザーの wellbeing を損なうことなく、安全性リスクを包括的に探査できた。
  • データ収集に自動プロンプト生成を活用した結果、モデルのギャップを特定し、評価セットのカバレッジを向上させるのに効果的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。