Skip to main content
QUICK REVIEW

[논문 리뷰] RouteLLM: Learning to Route LLMs with Preference Data

Isaac Ong, Amjad Almahairi|arXiv (Cornell University)|2024. 06. 26.
Data Mining Algorithms and Applications인용 수 4
한 줄 요약

RouteLLM는 추론 시기 동안 강력한 모델과 약한 모델 간을 동적으로 선택하는 라우터 모델을 제안하여 비용-성능 트레이드오프를 최적화합니다. 인간 선호 데이터를 기반으로 훈련하고 데이터 증강을 추가함으로써, MT Bench 및 GSM8K와 같은 벤치마크에서 비용을 2배 이상 절감하면서도 높은 응답 품질을 유지하며, 재훈련 없이도 새로운 모델 조합으로도 효과적으로 일반화됩니다.

ABSTRACT

Large language models (LLMs) exhibit impressive capabilities across a wide range of tasks, yet the choice of which model to use often involves a trade-off between performance and cost. More powerful models, though effective, come with higher expenses, while less capable models are more cost-effective. To address this dilemma, we propose several efficient router models that dynamically select between a stronger and a weaker LLM during inference, aiming to optimize the balance between cost and response quality. We develop a training framework for these routers leveraging human preference data and data augmentation techniques to enhance performance. Our evaluation on widely-recognized benchmarks shows that our approach significantly reduces costs-by over 2 times in certain cases-without compromising the quality of responses. Interestingly, our router models also demonstrate significant transfer learning capabilities, maintaining their performance even when the strong and weak models are changed at test time. This highlights the potential of these routers to provide a cost-effective yet high-performance solution for deploying LLMs.

연구 동기 및 목표

  • 강력한 모델과 약한 모델 간의 동적 라우팅을 통해 LLM 배포 시 비용-품질 트레이드오프를 해결하기 위해.
  • 인간 선호도 데이터와 데이터 증강을 활용한 라우터 훈련 프레임워크를 개발하여 일반화 능력을 향상시키기 위해.
  • 다양한 벤치마크에서 고성능을 유지하면서도 상당한 비용 절감을 달성하기 위해.
  • 외부 분포(out-of-distribution) 벤치마크에서 라우터 성능을 평가하고, 다양한 모델 조합 간 이식성(transferability)을 입증하기 위해.
  • 재현 가능성과 커뮤니티 활용을 위해 코드와 선호도 데이터를 오픈소스로 제공하기 위해.

제안 방법

  • 라우터 모델은 Chatbot Arena에서 확보한 인간 선호도 데이터를 사용하여 각 입력 쿼리에 대해 어느 LLM(강력한 모델 또는 약한 모델)이 선호되는지 학습합니다.
  • 데이터 증강은 LLM 심판 또는 도메인 내 데이터를 사용해 합성된 선호도 비교를 생성함으로써 일반화 능력을 향상시킵니다.
  • BERT, 인과적 LLM, 행렬 분해, 유사도 가중 순위 매기기 등 다양한 라우터 아키텍처를 평가합니다.
  • 입력 임bedding과 학습된 선호도 패tern을 기반으로 라우터는 각 쿼리에 대해 최적의 모델을 예측합니다.
  • Call-Performance Threshold (CPT)와 Average Performance Gain Recovered (APGR)와 같은 지표를 사용해 성능을 평가합니다.
  • 새로운 강력-약한 모델 조합에 대해 재훈련 없이도 제로샷 전이(Zero-shot transfer)를 지원합니다.

실험 결과

연구 질문

  • RQ1인간 선호도 데이터를 기반으로 훈련된 라우터 모델이 강력한 모델과 약한 모델 간에 쿼리를 효과적으로 라우팅하여 비용을 절감하면서도 품질을 유지할 수 있는가?
  • RQ2데이터 증강은 다양한 벤치마크에서 라우터 성능에 어떤 영향을 미치는가?
  • RQ3훈련 중에 볼 수 없었던 새로운 모델 조합으로 라우터 모델이 얼마나 잘 일반화되는가?
  • RQ4실제 환경에서 이러한 라우터를 구현할 경우 추론 오버헤드와 비용 효율성은 어떠한가?
  • RQ5다양한 라우터 아키텍처는 성능 및 확장성 측면에서 어떻게 상호 비교되는가?

주요 결과

  • 가장 성능이 뛰어난 라우터는 MT Bench에서 비용을 3.66배 절감하면서도 GPT-4의 95% 수준의 응답 품질을 유지합니다.
  • MMLU에서는 비용을 1.41배 절감하면서 GPT-4 성능의 92%를 달성합니다.
  • GSM8K에서는 비용을 1.49배 절감하면서도 GPT-4 품질의 87%를 유지합니다.
  • 새로운 모델 조합으로도 효과적으로 일반화되어, 랜덤 라우팅 대비 80% CPT에 도달하기 위해 GPT-4 호출 수를 최대 30% 줄일 수 있습니다.
  • 데이터 증강은 특히 훈련 데이터와 평가 데이터의 분포가 유사할 경우 라우터 성능 향상에 크게 기여합니다.
  • 라우터의 추론 오버헤드는 매우 미미하여 GPT-4 생성 비용의 0.4% 미만을 추가로 차지하며, 실용적인 구현 가능성을 입증합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.