[論文レビュー] Octopus: On-device language model for function calling of software APIs
本稿では、30,000以上のソフトウェアAPIを用いて微調整された、2B、3B、7Bパラメータのオンデバイス型言語モデルであるOctopusを紹介する。カリキュラム学習、データセットの選別、推論時における新しい条件付きマスキング技術を活用することで、Octopusは低遅延とフォーマットの正確性を維持しながら、GPT-4を上回るAPI関数呼び出しの正確性を達成した。
In the rapidly evolving domain of artificial intelligence, Large Language Models (LLMs) play a crucial role due to their advanced text processing and generation abilities. This study introduces a new strategy aimed at harnessing on-device LLMs in invoking software APIs. We meticulously compile a dataset derived from software API documentation and apply fine-tuning to LLMs with capacities of 2B, 3B and 7B parameters, specifically to enhance their proficiency in software API interactions. Our approach concentrates on refining the models' grasp of API structures and syntax, significantly enhancing the accuracy of API function calls. Additionally, we propose extit{conditional masking} techniques to ensure outputs in the desired formats and reduce error rates while maintaining inference speeds. We also propose a novel benchmark designed to evaluate the effectiveness of LLMs in API interactions, establishing a foundation for subsequent research. Octopus, the fine-tuned model, is proved to have better performance than GPT-4 for the software APIs calling. This research aims to advance automated software development and API integration, representing substantial progress in aligning LLM capabilities with the demands of practical software engineering applications.
研究の動機と目的
- GPT-4のような大規模で高コストなモデルに依存せずに、ソフトウェアAPIを正確に呼び出せる軽量でオンデバイス型LLMの開発。
- 特にパrameter選択と関数名の一致において、LLM生成のAPI呼び出しにおけるフォーマットエラーと幻覚現象の課題に対処すること。
- 条件付きマスキングを通じて推論効率と出力の信頼性を向上させ、特にJSONに類似した出力構造の正しい形式を保証すること。
- 実世界のAPIインタラクションタスクにおけるLLMの評価のための新しいベンチマークを確立すること。
- モバイルおよびエッジデバイスへの実用的導入を可能にするために、高精度なAPI呼び出しを実現するコンパクトなモデルを訓練すること。
提案手法
- RapidAPI Hubから得た30,000以上のソフトウェアAPIを対象とした選別済みデータセットを用いて、CodeLlama、Gemma、Stable Codeなどの2B、3B、7Bパラメータのモデルを微調整した。
- モデルの汎化能力を向上させ、類似したAPI関数間の混乱を低減するために、カリキュラム学習とネガティブサンプリングを採用した。
- 推論時に出力フォーマットを制約するための条件付きマスキング技術を設計し、特に列挙型パラメータにおいて構文的正確性を確保した。
- 関数およびパラメータ選択を導くために、few-shotのデモンストレーションと構造化された入力を含むプロンプトテンプレートを用いた。
- 関数および引数予測の精度を最大化するために、推論時にグリーディデコードを適用した。
- 評価のため、バランスの取れた解ける/解けないクエリを含み、人間がアノテートした正解を備えた新しいベンチマークを構築した。
実験結果
リサーチクエスチョン
- RQ1小さなオンデバイス型LLMは、実世界のソフトウェアAPI関数呼び出しタスクにおいてGPT-4を上回ることができるか?
- RQ2条件付きマスキングは、LLM生成のAPI呼び出しにおけるフォーマットエラーと幻覚現象をどれほど効果的に低減できるか?
- RQ3カリキュラム学習とデータセットの選別は、複雑なAPI選択およびパラメータ生成タスクにおけるモデル性能をどの程度向上できるか?
- RQ4コンパクトなLLMは、低遅延とモバイルデバイスへの展開可能性を維持しながら、高精度なAPIインタラクションを達成できるか?
- RQ5多様で実世界のAPIデータセット上で微調整された場合、モデルサイズ(2B、3B、7B)がAPI呼び出しの正確性に与える影響は何か?
主な発見
- 提案されたベンチマークにおいて、Octopus 7BモデルはGPT-4を上回る関数呼び出しの正確性を達成し、関数名およびパラメータ予測の両方で高い正確性を示した。
- 条件付きマスキングは、特に列挙型パラメータにおいて出力フォーマットの正確性を顕著に向上させ、推論時間の増加を伴わずに検証損失を低減した。
- すべてのOctopusモデルは関数名の正確性がほぼ完璧であったが、ベースラインのGPT-4出力ではパラメータの幻覚現象が主なエラー要因であった。
- 条件付きマスキング技術は、有効なフォーマットに制限された出力空間に制限することで正確性を向上させることを数学的に証明した。
- Octopusシリーズの7BモデルはGPT-4を上回る正確性を達成し、より小さいタスク特化型モデルが、大規模で汎用的なモデルを特殊なAPIタスクにおいて上回ることを示した。
- データセットとベンチマークはオープンソース化されており、今後のオンデバイス型LLMによるAPIインタラクション分野の研究基盤を提供している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。