[論文レビュー] Octopus v2: On-device language model for super agent
Octopus v2 は、関数呼び出しの精度を GPT-4 水準に達する 2B パラメータのデバイス内言語モデルを導入し、関数トークンを用いたファインチューニングにより、遅延を 35 倍軽減し、コンテキスト長を 95% 減少させた。この手法により、スマートフォンなどのエッジデバイス上で生産的で低遅延の AI エージェントの実現が可能となり、GPT-4 や RAG を用いた Llama-7B よりも高速かつ効率的である。
Language models have shown effectiveness in a variety of software applications, particularly in tasks related to automatic workflow. These models possess the crucial ability to call functions, which is essential in creating AI agents. Despite the high performance of large-scale language models in cloud environments, they are often associated with concerns over privacy and cost. Current on-device models for function calling face issues with latency and accuracy. Our research presents a new method that empowers an on-device model with 2 billion parameters to surpass the performance of GPT-4 in both accuracy and latency, and decrease the context length by 95\%. When compared to Llama-7B with a RAG-based function calling mechanism, our method enhances latency by 35-fold. This method reduces the latency to levels deemed suitable for deployment across a variety of edge devices in production environments, aligning with the performance requisites for real-world applications.
研究の動機と目的
- コンパクトなデバイス内言語モデルを用いて、エッジデバイス上で高精度で低遅延の関数呼び出しを実現すること。
- GPT-4 のようなクラウドベースの LLM に伴うプライバシーとコストの懸念を解消するため、スマートフォンやエッジデバイスにモデルをローカルにデプロイすること。
- デバイス内 AI エージェントのためのコンテキスト長と推論遅延を短縮し、バッテリー制限のある実世界環境での実用性を高めること。
- 大規模なクラウドベースのモデルに匹敵またはそれを上回るパフォーマンスを達成するため、小規模モデルを機能トークンでファインチューニングするスケーラブルな手法を開発すること。
- LoRA アダプタを介して、完全な再トレーニングなしにアプリケーション固有の関数呼び出しを可能にする、多様なアプリケーションへの効率的なデプロイを支援すること。
提案手法
- Gemma-2B から開始し、特定の API や関数を表す特別なトークン(<nexa_0> から <nexa_N-1> まで)を用いたファインチューニングによりモデルを訓練する。
- クラスの不均衡を是正し収束を改善するために、特別な機能トークンに高い重みを割り当てる重み付き交差エントロピー損失関数を適用する。
- フルモデルファインチューニングと LoRA(低ランク適応)を比較し、LoRA が高精度を維持しながらも、効率的かつアプリケーション固有の適応を可能にすることを確認した。
- 1 つの API に対して 4K 個のデータポイントを生成することで、並列的およびネストされた関数呼び出しをサポートし、1 回の呼び出しレベルのパフォーマンスを維持する。
- 機能トークンをトークナイザーとモデルのアテンションヘッドの両方に統合し、自然言語クエリと関数呼び出しの直接的なマッピングを学習可能にする。
- 長大な関数説明をコンactなトークンに置き換えることで、コンテキスト長を 95% 以上短縮し、推論速度と効率を著しく向上させる。
実験結果
リサーチクエスチョン
- RQ12B パラメータのデバイス内言語モデルは、GPT-4 と同等の精度と遅延を達成できるか?
- RQ2機能トークンをどのように言語モデルに統合すれば、関数呼び出しの精度を向上させるとともにコンテキスト長を短縮できるか?
- RQ3希少な機能トークンを含む訓練において、重み付き損失関数が収束性とパフォーマンスに与える影響は何か?
- RQ4LoRA ベースのファインチューニングは、高精度を維持しながら、デバイス内 AI エージェントの効率的かつアプリケーション固有のデプロイを可能にするか?
- RQ5RAG を用いたクラウドベースのモデルと比較して、デバイス内モデルは推論遅延とコンテキスト長をどの程度短縮できるか?
主な発見
- Octopus v2 は、RAG を用いた Llama-7B よりも 35 倍の遅延低減を達成しながら、GPT-4 水準の関数呼び出しの精度を実現した。
- 推論時、コンテキスト長を 95% 以上短縮し、スマートフォンでのバッテリー1回の充電でより多くの関数呼び出しを可能にした。
- iPhone デプロイでは、コンテキスト長の短縮とエネルギー効率の向上により、同等の 7B モデルと比較して最大 37 倍の関数呼び出し回数が可能になった。
- LoRA ファインチューニングはわずかなパフォーマンス低下で高精度を維持し、完全な再トレーニングなしに効率的なアプリケーション固有の適応が可能になった。
- 重み付き交差エントロピー損失の使用により、希少な機能トークンの訓練において収束が改善されたが、最終的な推論パフォーマンスに影響はなかった。
- このモデルにより、従来のデバイス内モデルの速度と精度の制限を克服し、生産的で低遅延のエッジデバイス向け AI エージェントの実現が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。