Skip to main content
QUICK REVIEW

[論文レビュー] RouteLLM: Learning to Route LLMs with Preference Data

Isaac Ong, Amjad Almahairi|arXiv (Cornell University)|Jun 26, 2024
Data Mining Algorithms and Applications被引用数 4
ひとこと要約

RouteLLMは、推論時に強力なモデルと弱いモデルの間で動的に切り替えるルーター・モデルを提案し、コストパフォーマンスのトレードオフを最適化する。人間の好みのデータを用いて訓練され、データ拡張を組み合わせることで、MT Bench や GSM8K などのベンチマークで2倍以上のコスト削減を達成しながら高い応答品質を維持し、再トレーニングなしに新しいモデルペアにも効果的に一般化する。

ABSTRACT

Large language models (LLMs) exhibit impressive capabilities across a wide range of tasks, yet the choice of which model to use often involves a trade-off between performance and cost. More powerful models, though effective, come with higher expenses, while less capable models are more cost-effective. To address this dilemma, we propose several efficient router models that dynamically select between a stronger and a weaker LLM during inference, aiming to optimize the balance between cost and response quality. We develop a training framework for these routers leveraging human preference data and data augmentation techniques to enhance performance. Our evaluation on widely-recognized benchmarks shows that our approach significantly reduces costs-by over 2 times in certain cases-without compromising the quality of responses. Interestingly, our router models also demonstrate significant transfer learning capabilities, maintaining their performance even when the strong and weak models are changed at test time. This highlights the potential of these routers to provide a cost-effective yet high-performance solution for deploying LLMs.

研究の動機と目的

  • 推論時に強力なモデルまたは弱いモデルにクエリを動的にルーティングすることで、LLMのデプロイにおけるコストと品質のトレードオフを解消すること。
  • 人間の好みのデータとデータ拡張を活用したルーター訓練フレームワークを開発し、一般化性能を向上させること。
  • 多様なベンチマークで高い応答品質を維持しながら、顕著なコスト削減を達成すること。
  • 分布外のベンチマークでのルーター性能を評価し、異なるモデルペア間での転送性を示すこと。
  • 再現性とコミュニティ利用を目的に、コードと好みのデータをオープンソース化すること。

提案手法

  • ルーター・モデルは、Chatbot Arena から得た人間の好みのデータを用いて、各入力クエリに対して好まれるLLM(強力または弱い)を学習する。
  • データ拡張は、LLMジャッジやドメイン内データを用いて合成された好みの比較を生成することで、一般化性能を向上させる。
  • BERT、因果的LLM、行列分解、類似度重み付きランク付けといった複数のルーター・アーキテクチャを評価する。
  • ルーターは、入力の埋め込みと学習済みの好みのパターンに基づき、各クエリに対して最適なモデルを予測する。
  • Call-Performance Threshold (CPT) や Average Performance Gain Recovered (APGR) といった指標を用いて性能を評価する。
  • 新しい強力・弱いモデルペアに対しても、再トレーニングなしにゼロショット転送が可能である。

実験結果

リサーチクエスチョン

  • RQ1人間の好みのデータで訓練されたルーター・モデルは、コストを削減しながら品質を維持する形で、強力なLLMと弱いLLMの間でクエリを効果的にルーティングできるか?
  • RQ2データ拡張は、多様なベンチマークにおいてルーター性能にどのように影響するか?
  • RQ3トレーニング時に見られなかった新しいモデルペアに対して、ルーター・モデルはどの程度一般化できるか?
  • RQ4実際の展開において、このようなルーターの推論オーバーヘッドとコスト効率はどの程度か?
  • RQ5異なるルーター・アーキテクチャは、性能とスケーラビリティの観点からどのように比較できるか?

主な発見

  • 最良のルーターは、MT Bench において3.66倍のコスト削減を達成しながら、GPT-4の応答品質の95%を維持する。
  • MMLUでは、コストを1.41倍削減し、GPT-4のパフォーマンスの92%を達成する。
  • GSM8Kでは、コストを1.49倍削減しながら、GPT-4の品質の87%を維持する。
  • ルーターは新しいモデルペアに対しても効果的に一般化し、80%のCPTに到達するまで、ランダムルーティングよりも最大30%少ないGPT-4呼び出しで済ませる。
  • データ拡張はルーター性能を顕著に向上させ、特にトレーニングデータと評価データの分布が近い場合に顕著である。
  • ルーターの推論オーバーヘッドは最小限であり、GPT-4生成の総コストに0.4%未満しか追加しないことから、実用的な展開が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。