Skip to main content
QUICK REVIEW

[논문 리뷰] Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models

Keming Lu, Hongyi Yuan|arXiv (Cornell University)|2023. 11. 15.
Topic Modeling인용 수 4
한 줄 요약

Zooter는 사전 훈련된 보상 모델에서 전문 지식 신호를 희석하여, 쿼리를 가장 능력 있는 LLM으로 라우팅하는 보상 유도 라우팅 방법을 제안한다. 이는 보상 모델 순위와 유사한 성능을 달성하면서도 쿼리당 한 개의 모델만 추론하여 추론 비용을 크게 줄인다.

ABSTRACT

The complementary potential of Large Language Models (LLM) assumes off-the-shelf LLMs have heterogeneous expertise in a wide range of domains and tasks so that an ensemble of LLMs can achieve consistently better performance. Existing ensemble methods for LLMs mainly focus on reward model ranking of outputs, leading to significant computation overhead. To combat this issue, we revisit the complementary potential of LLMs and further elaborate it by mining latent expertise with off-the-shelf reward models. We propose Zooter, a reward-guided routing method distilling rewards on training queries to train a routing function, which can precisely distribute each query to the LLM with expertise about it. We also integrate a tag-based label enhancement to mitigate noise from uncertainty when using rewards as silver supervision. Zooter shows computation efficiency in inference as it introduces only a minor computation overhead of a routing function compared with reward model ranking methods. We evaluate Zooter on a comprehensive benchmark collection with 26 subsets on different domains and tasks. Zooter outperforms the best single model on average and ranks first on 44% of tasks, even surpassing multiple reward model ranking methods.

연구 동기 및 목표

  • 기존 LLM 앙상블 방법이 모든 모델에서 응답을 생성해야 하는 높은 추론 비용을 해결하기 위해.
  • 사용 가능한 LLM이 도메인과 작업 간에 이질적인 전문 지식을 지닐 수 있는지 탐색하기 위해.
  • 보상 모델 출력을 은밀한 지도로 활용하여 계산 비용이 적은 라우팅 메커니즘을 개발하기 위해.
  • 보상 모델의 불확실성으로 인한 노이즈를 태그 기반 레이블 강화 기법으로 완화하기 위해.
  • 최소한의 추론 오버헤드로 다양한 벤치마크에서 라우팅 방법의 효과성을 평가하기 위해.

제안 방법

  • Zooter는 다양한 훈련 쿼리 세트에서 사용 가능한 보상 모델(예: QwenRM, UltraRM)의 보상을 희석하여 경량 라우팅 함수를 훈련시킨다.
  • 라우팅 함수는 보상 점수를 기반으로 각 입력 쿼리를 가장 능력 있는 것으로 예측된 LLM으로 할당하여, 쿼리당 한 모델로의 추론 비용을 최소화한다.
  • 샘플 수준의 보상과 군집 수준의 태그 보상의 조합을 통해 보상 모델의 불확실성으로 인한 노이즈를 줄이는 태그 기반 레이블 강화 기법을 사용한다.
  • 훈련 중에 세밀한 보상 점수와 태그 수준 사전 지식 간 기여도를 균형 잡기 위해 하이퍼파rameter β를 사용한다.
  • 보상 모델 출력에서 희석을 통해 끝에서 끝까지 훈련된 라우팅 모델을 사용하여, 전체 앙상블 생성 없이도 효율적인 추론을 가능하게 한다.
  • 이 방법은 네 도메인에 걸쳐 26개의 벤치마크 서브셋에서 BMA 및 RMR 방법과 비교하여 평가된다.

실험 결과

연구 질문

  • RQ1보상 모델 출력을 간접 지도로 사용하여 사용 가능한 LLM을 도메인 전용 전문 지식으로 효과적으로 라우팅할 수 있는가?
  • RQ2보상 모델의 불확실성은 쿼리 라우팅 함수 훈련에 어떤 영향을 미치며, 이를 완화할 수 있는가?
  • RQ3경량 라우팅 함수는 훨씬 낮은 계산 비용으로 전체 보상 모델 순위와 유사한 성능을 달성할 수 있는가?
  • RQ4샘플 수준 보상과 태그 수준 보상 간의 최적의 균형은 라우팅 정확도 향상에 어떤 영향을 미치는가?
  • RQ5라우팅을 통해 여러 LLM을 조합하면 다양한 작업에서 최고의 단일 모델을 능가하는가?

주요 결과

  • Zooter는 26개의 벤치마크 서브셋 평균에서 최고의 단일 LLM을 능가하며, 44%의 작업에서 최신 기술 수준의 성능을 달성한다.
  • MT-Bench에서 BMA보다 0.39점 높은 점수를 기록하여, 기존 앙상블 기반 베이스라인에 비해 일관된 향상을 보였다.
  • 단지 86M 파라미터로 구성된 Zooter의 라우팅 오버헤드는 전체 모델 추론이 필요한 보상 모델 순위보다 크게 낮다.
  • 태그 기반 레이블 강화의 최적 하이퍼파rameter β = 0.3이 가장 뛰어난 성능을 보였으며, 이는 샘플 수준과 태그 수준 보상의 조합이 강건성을 향상시킨다는 것을 보여준다.
  • β = 0일 때 태그 수준 보상을 희석하는 것이 β = 1일 때 샘플 수준 보상만 희석하는 것보다 성능이 뛰어나, 보상 불확실성으로 인한 노이즈가 훈련에 악영향을 준다는 것을 확인한다.
  • Zooter는 OAssistRM, LLM-Blender, Auto-J와 비교해 성능 면에서 뛰어나면서도 훨씬 적은 계산 자원을 사용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.