Skip to main content
QUICK REVIEW

[论文解读] Octopus v2: On-device language model for super agent

Wei Chen, Zhiyuan Li|arXiv (Cornell University)|Apr 2, 2024
Multi-Agent Systems and Negotiation被引用 4
一句话总结

Octopus v2 引入了一款参数量为 2B 的设备端语言模型,通过使用功能标记进行微调,实现了与 GPT-4 水平相当的功能调用准确率,同时将延迟降低 35 倍,上下文长度减少 95%,从而在智能手机等边缘设备上实现了生产就绪的低延迟 AI 代理,其速度和效率优于使用 RAG 的 GPT-4 和 Llama-7B。

ABSTRACT

Language models have shown effectiveness in a variety of software applications, particularly in tasks related to automatic workflow. These models possess the crucial ability to call functions, which is essential in creating AI agents. Despite the high performance of large-scale language models in cloud environments, they are often associated with concerns over privacy and cost. Current on-device models for function calling face issues with latency and accuracy. Our research presents a new method that empowers an on-device model with 2 billion parameters to surpass the performance of GPT-4 in both accuracy and latency, and decrease the context length by 95\%. When compared to Llama-7B with a RAG-based function calling mechanism, our method enhances latency by 35-fold. This method reduces the latency to levels deemed suitable for deployment across a variety of edge devices in production environments, aligning with the performance requisites for real-world applications.

研究动机与目标

  • 通过使用紧凑的设备端语言模型,在边缘设备上实现高准确率、低延迟的功能调用。
  • 通过在智能手机和边缘设备上本地部署模型,解决 GPT-4 等云部署大语言模型带来的隐私和成本问题。
  • 减少设备端 AI 代理的上下文长度和推理延迟,使其适用于实际的、受电池限制的环境。
  • 开发一种可扩展的小模型微调方法,通过功能标记实现与大型云模型相当或更优的性能。
  • 通过 LoRA 适配器支持高效部署,实现无需完整微调的应用特定功能调用。

提出的方法

  • 模型从 Gemma-2B 微调而来,使用特殊标记(如 <nexa_0> 到 <nexa_N-1>)表示特定 API 或功能。
  • 应用加权交叉熵损失函数,为特殊功能标记分配更高权重,以解决训练期间的类别不平衡问题,提升收敛性。
  • 对比全模型微调与 LoRA(低秩适应)方法,LoRA 在保持高准确率的同时,实现高效、应用特定的模型适配。
  • 通过为每个 API 生成 4K 个数据点,支持并行和嵌套功能调用,从而维持单次调用的性能水平。
  • 功能标记被集成到分词器和模型的注意力头中,使模型能够学习自然语言查询与功能调用之间的直接映射。
  • 通过用紧凑标记替代冗长的功能描述,将上下文长度减少超过 95%,显著提升推理速度和效率。

实验结果

研究问题

  • RQ1一款参数量为 2B 的设备端语言模型能否在准确率和延迟方面实现与 GPT-4 相当的功能调用性能?
  • RQ2如何有效将功能标记集成到语言模型中,以提升功能调用准确率并减少上下文长度?
  • RQ3在训练稀有功能标记时,加权损失函数对收敛性和性能的影响如何?
  • RQ4基于 LoRA 的微调能否在保持高准确率的同时,实现设备端 AI 代理的高效、应用特定部署?
  • RQ5与 RAG 增强的云模型相比,设备端模型在推理延迟和上下文长度方面能减少多少?

主要发现

  • Octopus v2 在功能调用准确率上达到 GPT-4 水平,同时相比使用 RAG 的 Llama-7B 将延迟降低 35 倍。
  • 在推理过程中,模型将上下文长度减少超过 95%,显著提升移动设备上的功能调用次数(按电池续航计算)。
  • 在 iPhone 上部署时,由于上下文长度减少和能效提升,该模型支持的功能调用次数是同类 7B 模型的 37 倍。
  • LoRA 微调在仅造成轻微性能下降的情况下保持了高准确率,实现了无需完整微调的高效、应用特定适配。
  • 使用加权交叉熵损失显著改善了训练过程中的收敛性,尤其在处理稀有功能标记时,且不影响最终推理性能。
  • 该模型使边缘设备上的生产就绪、低延迟 AI 代理成为可能,克服了以往设备端模型在速度和准确率方面的局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。