[논문 리뷰] FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance
FrugalGPT는 여러 LLM API 중에서 적응적으로 선택하는 LLM cascade를 도입하여 비용을 최대 98%까지 절감하면서도 최고의 단일 LLM의 정확도에 맞먹거나 이를 상회합니다.
There is a rapidly growing number of large language models (LLMs) that users can query for a fee. We review the cost associated with querying popular LLM APIs, e.g. GPT-4, ChatGPT, J1-Jumbo, and find that these models have heterogeneous pricing structures, with fees that can differ by two orders of magnitude. In particular, using LLMs on large collections of queries and text can be expensive. Motivated by this, we outline and discuss three types of strategies that users can exploit to reduce the inference cost associated with using LLMs: 1) prompt adaptation, 2) LLM approximation, and 3) LLM cascade. As an example, we propose FrugalGPT, a simple yet flexible instantiation of LLM cascade which learns which combinations of LLMs to use for different queries in order to reduce cost and improve accuracy. Our experiments show that FrugalGPT can match the performance of the best individual LLM (e.g. GPT-4) with up to 98% cost reduction or improve the accuracy over GPT-4 by 4% with the same cost. The ideas and findings presented here lay a foundation for using LLMs sustainably and efficiently.
연구 동기 및 목표
- 다양한 LLM API를 조회하는 데 드는 높은 비용과 예산 의식 있는 사용의 필요성에 대해 동기를 부여한다.
- 세 가지 비용 절감 전략을 제안한다: 프롬프트 적응, LLM 근사화, LLM cascade.
- 간단한 FrugalGPT 구현(LLM cascade)을 시연하여 더 저렴한 모델로 쿼리를 삼진화하면서도 성능을 유지한다.
제안 방법
- 쿼리당 비용 구성요소를 포함한 K개의 LLM API를 조회하기 위한 예산 제약 문제를 정의한다.
- 세 가지 비용 절감 전략을 설명한다: 프롬프트 적응(더 작은 프롬프트, 프롬프트 선택, 쿼리 연결), LLM 근사화(완료 캐시, 저가 모델의 미세 조정), LLM cascade(생성 점수화 + API를 선택하기 위한 라우터).
- FrugalGPT를 3단 cascade 길이로 구성하여 ChatGPT, GPT-3, GPT-4 등과 함께 LLM cascade로 구현하고 비용 제약 하에서 보상을 최대화하도록 쿼리별 API 시퀀스를 학습한다.
- 다양한 검색 공간을 가지는 API 목록 및 임계값을 선택하기 위한 혼합 정수 최적화를 형식화한 뒤, 효율성을 위해 탐색 공간을 가지치고 목적함수를 보간하는 실용적 최적화기를 제공한다.
실험 결과
연구 질문
- RQ1예산 제약하에 다수의 LLM API를 사용해도 단일 최적 LLM과 비슷하거나 더 나은 작업 성능을 달성할 수 있는가?
- RQ2적응형 LLM cascade를 통해 다양한 작업에서 어떤 비용 절감 및 정확도 절충이 가능한가?
- RQ3프루걸GPT 시스템을 구성할 때 프롬프트 적응, LLM 근사화, cascade 전략은 어떻게 상호 작용하고 복합적으로 작용하는가?
- RQ4현실 세계 환경에서 LLM cascade를 학습하고 배포하기 위한 실질적 한계점과 필요한 조건은 무엇인가?
주요 결과
- FrugalGPT는 최고의 개별 LLM(예: GPT-4)과 동일한 성능에 도달하면서 비용을 최대 98%까지 절감할 수 있다.
- FrugalGPT는 평가된 작업에서 동일한 비용으로 GPT-4보다 정확도를 최대 4% 향상시킬 수 있다.
- HEADLINES, OVERRULING, COQA 전반에 걸쳐 FrugalGPT는 비용 절감(50%–98%)을 보이면서 정확도를 유지하거나 향상시킨다.
- 캐스케이드는 생성 다양성을 활용하여 저렴한 모델이 비싼 모델이 틀린 사례에 대해 올바르게 답할 수 있게 하여 전체 성능 향상을 가능하게 한다.
- 사례 연구에서 FrugalGPT는 신뢰할 수 있는 출력을 제공하는 경우 GPT-J 및 GPT-J와 유사한 모델에 순차적으로 질의하여 GPT-4에 대한 의존도를 줄인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.