Skip to main content
QUICK REVIEW

[论文解读] Petals: Collaborative Inference and Fine-tuning of Large Models

Alexander Borzunov, Dmitry Baranchuk|arXiv (Cornell University)|Sep 2, 2022
Topic Modeling被引用 6
一句话总结

Petals 通过在互联网上将模型层分发到多个参与者的 GPU 上,实现了大规模语言模型(如 BLOOM-176B)的协作式推理与微调。它利用动态负载均衡、8 位量化和低延迟路由,在消费级硬件上实现了约每秒 1 个 token 的推理速度,同时通过适配器和提示微调方式暴露隐藏状态,支持研究级别的微调。

ABSTRACT

Many NLP tasks benefit from using large language models (LLMs) that often have more than 100 billion parameters. With the release of BLOOM-176B and OPT-175B, everyone can download pretrained models of this scale. Still, using these models requires high-end hardware unavailable to many researchers. In some cases, LLMs can be used more affordably via RAM offloading or hosted APIs. However, these techniques have innate limitations: offloading is too slow for interactive inference, while APIs are not flexible enough for research that requires access to weights, attention or logits. In this work, we propose Petals - a system for inference and fine-tuning of large models collaboratively by joining the resources of multiple parties. We demonstrate that this strategy outperforms offloading for very large models, running inference of BLOOM-176B on consumer GPUs with $\approx$ 1 step per second, which is enough for many interactive LLM applications. Unlike most inference APIs, Petals also natively exposes hidden states of served models, allowing to train and share custom model extensions based on efficient fine-tuning methods.

研究动机与目标

  • 解决运行如 BLOOM-176B 和 OPT-175B 这类百亿参数语言模型所带来的高计算与内存开销问题。
  • 克服 RAM/SSD 交换机制的局限性(交互使用时速度过慢)以及托管 API 的局限性(缺乏对内部状态的访问权限与灵活性)。
  • 使研究人员和实践者能够在无需高端硬件或可信中心服务器的情况下,协作完成推理与参数高效的微调。
  • 通过模型仓库支持微调模型扩展(如适配器)的共享,实现协作式模型改进。

提出的方法

  • 将模型层分发到多个参与者的 GPU 上,客户端形成服务器链,以流水线并行方式执行推理。
  • 采用 8 位量化技术以减少内存需求,使消费级 GPU 也能运行推理。
  • 采用动态路由机制,选择低延迟的服务器链,并在服务器间实现负载均衡,以最小化推理延迟。
  • 通过适配器和提示微调支持参数高效的微调,训练好的子模块可共享至模型仓库。
  • 在推理过程中暴露隐藏状态与注意力机制,支持研究级分析与定制化操作。
  • 通过输入与输出的密码学哈希验证,检测并阻止恶意或故障服务器,同时引入经济激励机制以保障正确性。

实验结果

研究问题

  • RQ1是否可以通过仅使用消费级 GPU 的协作分发方式,高效且交互式地推理参数量超过 1000 亿的大规模语言模型?
  • RQ2在去中心化的推理系统中,如何暴露隐藏状态与注意力机制以支持研究级别的微调?
  • RQ3为实现在去中心化硬件上的交互式推理速度,需要哪些系统级优化(如路由、量化、负载均衡)?
  • RQ4如何在去中心化的参与者网络中安全地共享与重用微调后的模型扩展(如适配器)?
  • RQ5在去中心化、无信任的推理环境中,应采用何种机制确保正确性并防止作弊行为?

主要发现

  • Petals 仅使用消费级 GPU 即可实现对 BLOOM-176B 的交互式推理,速度约为每秒 1 个 token,推理速度优于基于 RAM 的交换机制。
  • 该系统通过 8 位量化、动态低延迟路由以及在分布式服务器间的高效负载均衡,实现了这一性能表现。
  • 在推理过程中,隐藏状态与注意力机制被原生暴露,支持提示微调和适配器训练等高级研究应用。
  • 可通过模型仓库协作共享并重用参数高效的微调方法(如适配器和提示微调),实现社区驱动的模型适应。
  • 通过输入与输出的密码学哈希,提供可验证机制以检测并抑制恶意或故障服务器,提升系统完整性。
  • 系统支持版本化的模型更新与微调适配器标签,为未来支持模型版本控制与增量改进奠定基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。