[논문 리뷰] Petals: Collaborative Inference and Fine-tuning of Large Models
Petals는 인터넷을 통해 여러 참가자의 GPU에 모델 레이어를 분산시켜 대규모 언어 모델(BLOOM-176B 등)의 공동 추론 및 미세조정을 가능하게 한다. 동적 로드 밸런싱, 8비트 정량화, 저지연 라우팅 기법을 활용해 소비자용 하드웨어에서도 약 1토큰/초의 추론 속도를 달성하며, 어댑터 및 프롬프트 토닝을 통한 연구 수준의 미세조정을 위한 숨겨진 상태를 노출한다.
Many NLP tasks benefit from using large language models (LLMs) that often have more than 100 billion parameters. With the release of BLOOM-176B and OPT-175B, everyone can download pretrained models of this scale. Still, using these models requires high-end hardware unavailable to many researchers. In some cases, LLMs can be used more affordably via RAM offloading or hosted APIs. However, these techniques have innate limitations: offloading is too slow for interactive inference, while APIs are not flexible enough for research that requires access to weights, attention or logits. In this work, we propose Petals - a system for inference and fine-tuning of large models collaboratively by joining the resources of multiple parties. We demonstrate that this strategy outperforms offloading for very large models, running inference of BLOOM-176B on consumer GPUs with $\approx$ 1 step per second, which is enough for many interactive LLM applications. Unlike most inference APIs, Petals also natively exposes hidden states of served models, allowing to train and share custom model extensions based on efficient fine-tuning methods.
연구 동기 및 목표
- BLOOM-176B 및 OPT-175B와 같은 수십억 파rameter를 가진 언어 모델을 실행하는 데 필요한 높은 계산 및 메모리 비용을 해결하기 위함.
- RAM/SSD 오프로딩의 한계(인터랙티브 사용에 너무 느림)와 호스팅 API의 한계(내부 상태 접근성 및 유연성 부족)를 극복하기 위함.
- 고성능 하드웨어나 신뢰할 수 있는 중앙 서버 없이도 연구자 및 실무자가 공동으로 추론 및 파rameter 효율적인 미세조정을 수행할 수 있도록 하기 위함.
- 모델 허브를 통해 미세조정된 모델 확장(예: 어댑터)을 공유함으로써 공동의 모델 개선을 지원하기 위함.
제안 방법
- 참가자들의 GPU에 모델 레이어를 분산 배포하며, 클라이언트가 서버 체인을 형성하여 파이프라인 병렬 방식으로 추론을 수행한다.
- 메모리 요구량을 줄이고 소비자용 GPU에서도 추론이 가능하도록 8비트 정량화를 적용한다.
- 저지연 서버 체인을 선택하고 서버 간 로드 밸런싱을 수행함으로써 추론 지연을 최소화하기 위해 동적 라우팅을 활용한다.
- 어댑터 및 프롬프트 토닝을 통한 파rameter 효율적인 미세조정을 지원하며, 훈련된 서브모듈을 모델 허브에 공유한다.
- 추론 중에 숨겨진 상태와 어텐션 메커니즘을 노출하여 고급 연구 응용 및 맞춤 설정이 가능하도록 한다.
- 입력 및 출력의 암호 해시를 사용해 악성 또는 고장난 서버를 탐지하고 방지하며, 정확성 유도를 위한 경제적 인centives를 제공한다.
실험 결과
연구 질문
- RQ11000억 이상의 파라미터를 가진 대규모 언어 모델이 소비자용 GPU만을 사용해 협업 방식으로 효율적이고 인터랙티브하게 추론될 수 있는가?
- RQ2분산된 추론 시스템에서 숨겨진 상태와 어텐션 메커니즘을 어떻게 노출시켜 연구 수준의 미세조정을 지원할 수 있는가?
- RQ3분산된 하드웨어에서 인터랙티브 추론 속도를 달성하기 위해 필요한 시스템 수준 최적화(예: 라우팅, 정량화, 로드 밸런싱)는 무엇인가?
- RQ4미세조정된 모델 확장(예: 어댑터)을 분산된 참가자 네트워크 전반에서 안전하게 공유하고 재사용할 수 있는가?
- RQ5신뢰할 수 없는 분산 환경에서 정확성을 보장하고 도용을 방지하기 위한 메커니즘은 무엇인가?
주요 결과
- Petals는 소비자용 GPU만을 사용해 BLOOM-176B의 인터랙티브 추론을 약 1토큰/초 속도로 수행할 수 있으며, RAM 오프로딩 대비 빠른 성능을 보였다.
- 시스템은 8비트 정량화, 동적 저지연 라우팅, 분산 서버 간 효율적 로드 밸런싱을 통해 이 성능을 달성했다.
- 추론 중에 숨겨진 상태와 어텐션 메커니즘이 네이티브로 노출되어 프롬프트 토닝 및 어댑터 훈련과 같은 고급 연구 응용이 가능했다.
- 어댑터 및 프롬프트 토닝과 같은 파rameter 효율적인 미세조정 방법을 공동으로 수행하고 모델 허브를 통해 공유함으로써 커뮤니티 기반의 모델 적응이 가능했다.
- 입력 및 출력의 암호 해시는 악성 또는 고장난 서버를 검증 가능한 방식으로 탐지하고, 이를 방지하기 위한 메커니즘을 제공하여 시스템의 무결성을 향상시켰다.
- 버전 관리 모델 업데이트 및 미세조정된 어댑터 태깅을 지원하여 향후 모델 버전 관리 및 점진적 개선 기능을 위한 기반을 마련했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.