[论文解读] Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models
Zooter 提出了一种基于奖励的路由方法,通过从预训练的奖励模型蒸馏专业知识信号,将查询路由到最胜任的大语言模型(LLM),从而在保持与奖励模型排序相当性能的同时,将推理成本降低至每个查询仅推理一个模型。
The complementary potential of Large Language Models (LLM) assumes off-the-shelf LLMs have heterogeneous expertise in a wide range of domains and tasks so that an ensemble of LLMs can achieve consistently better performance. Existing ensemble methods for LLMs mainly focus on reward model ranking of outputs, leading to significant computation overhead. To combat this issue, we revisit the complementary potential of LLMs and further elaborate it by mining latent expertise with off-the-shelf reward models. We propose Zooter, a reward-guided routing method distilling rewards on training queries to train a routing function, which can precisely distribute each query to the LLM with expertise about it. We also integrate a tag-based label enhancement to mitigate noise from uncertainty when using rewards as silver supervision. Zooter shows computation efficiency in inference as it introduces only a minor computation overhead of a routing function compared with reward model ranking methods. We evaluate Zooter on a comprehensive benchmark collection with 26 subsets on different domains and tasks. Zooter outperforms the best single model on average and ranks first on 44% of tasks, even surpassing multiple reward model ranking methods.
研究动机与目标
- 为解决现有 LLM 集成方法推理成本过高的问题,这些方法需要为所有模型生成响应。
- 探究现成的 LLM 是否在不同领域和任务中具备异质性专业知识,从而实现高效路由。
- 开发一种计算高效的路由机制,利用奖励模型输出作为银标准监督进行训练。
- 通过基于标签的标签增强技术,缓解奖励模型不确定性带来的噪声影响。
- 在多样化的基准测试中评估该路由方法的有效性,同时保持极低的推理开销。
提出的方法
- Zooter 在多样化的训练查询集上,从现成的奖励模型(如 QwenRM、UltraRM)蒸馏奖励信号,以训练轻量级的路由函数。
- 该路由函数根据奖励分数将每个输入查询分配给预测最胜任的 LLM,将推理成本最小化至每个查询仅调用一个模型。
- 基于标签的标签增强技术将样本级奖励与粗粒度标签级奖励相结合,以减少奖励模型不确定性带来的噪声。
- 该方法使用超参数 β 来平衡训练过程中细粒度奖励分数与标签级先验的贡献。
- 路由模型通过端到端蒸馏从奖励模型输出进行训练,实现在无需完整集成生成的情况下高效推理。
- 该方法在四个领域共 26 个基准子集上进行评估,并与 BMA 和 RMR 方法进行比较。
实验结果
研究问题
- RQ1能否利用奖励模型输出作为间接监督,有效将现成的 LLM 路由至其特定领域专业知识?
- RQ2奖励模型的不确定性如何影响查询路由函数的训练?是否可以被缓解?
- RQ3轻量级路由函数能否在显著降低计算量的前提下,实现与完整奖励模型排序相当的性能?
- RQ4在提升路由准确率方面,样本级奖励与标签级奖励之间的最优平衡是什么?
- RQ5通过路由组合多个 LLM 是否能在多样化任务中超越表现最好的单个模型?
主要发现
- 在 26 个基准子集上,Zooter 平均性能优于最佳单个 LLM,在 44% 的任务中达到最先进性能。
- 在 MT-Bench 上,Zooter 的得分比 BMA 高出 0.39,表明其在基线集成方法上实现了持续改进。
- 仅使用 8600 万参数,Zooter 的路由开销显著低于奖励模型排序方法,后者需要对所有模型进行推理。
- 基于标签的标签增强最优超参数 β = 0.3 时性能最佳,表明结合样本级与标签级奖励可提升鲁棒性。
- 蒸馏标签级奖励(β = 0)优于仅蒸馏样本级奖励(β = 1),证实奖励不确定性带来的噪声会损害训练效果。
- Zooter 在性能上超越 RMR 方法,且在使用 OAssistRM、LLM-Blender 和 Auto-J 时,计算资源消耗显著更低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。