[论文解读] Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?
本文提出了一种新型多智能体讨论框架——征服与合并讨论(CMD),以探究多智能体交互是否能提升大语言模型的推理能力。令人惊讶的是,研究发现使用示范的强单智能体提示通常能与多智能体表现相当甚至更优,这挑战了多智能体讨论对推理能力提升必不可少的假设——尤其是在使用稳健提示时。
Recent progress in LLMs discussion suggests that multi-agent discussion improves the reasoning abilities of LLMs. In this work, we reevaluate this claim through systematic experiments, where we propose a novel group discussion framework to enrich the set of discussion mechanisms. Interestingly, our results show that a single-agent LLM with strong prompts can achieve almost the same performance as the best existing discussion approach on a wide range of reasoning tasks and backbone LLMs. We observe that the multi-agent discussion performs better than a single agent only when there is no demonstration in the prompt. Further study reveals the common interaction mechanisms of LLMs during the discussion.
研究动机与目标
- 重新评估多智能体讨论显著提升大语言模型推理能力这一说法。
- 设计一种新型多智能体讨论框架(CMD),以模拟人类群体讨论过程。
- 在多个推理基准和大语言模型主干网络上,系统性地比较单智能体提示与多智能体讨论。
- 识别多智能体讨论相较于单智能体提示具有可测量优势的条件。
- 分析多智能体讨论中的常见故障模式,如裁判错误和答案传播错误。
提出的方法
- 提出一种受人类群体讨论动态启发的新型多智能体讨论框架——征服与合并讨论(CMD)。
- 设计四阶段流程:启动提示、智能体交互、算法化讨论规则(如投票、分层结构)以及结果聚合。
- 采用多种讨论机制,包括投票、分层辩论,以及通过秘书智能体进行的平局解决。
- 使用多个推理基准:ECQA、GSM8k 和 FOLIO-wiki,涵盖不同大语言模型主干网络(如 Gemini Pro、Bard、GPT-4)。
- 在多种配置下比较性能:是否包含示范、智能体团队中使用强模型与弱模型、是否采用结构化讨论规则。
- 引入基于对称性的提示机制分析,以理解提示质量在推理结果中的作用。
实验结果
研究问题
- RQ1多智能体讨论是否在多样化的推理任务和大语言模型主干网络上始终提升推理性能?
- RQ2在何种条件下,多智能体讨论优于使用示范的强单智能体提示?
- RQ3不同的讨论机制(如投票、分层辩论)如何影响推理结果?
- RQ4多智能体讨论中的常见故障模式有哪些,它们如何影响最终准确率?
- RQ5在多智能体设置中,弱大语言模型是否能从与强模型的交互中受益?
主要发现
- 使用强示范增强提示的单智能体大语言模型在 ECQA、GSM8k 和 FOLIO-wiki 基准上,性能与最佳多智能体讨论框架相当。
- 只有当提示中未提供示范时,多智能体讨论才优于单智能体提示,表明提示质量是主导因素。
- 研究识别出两种关键故障模式:裁判错误(对推理步骤的错误评估)和错误答案传播(因推理链有缺陷导致的错误共识)。
- 在多大语言模型设置中,由弱模型(如 Bard)驱动的智能体在与强模型(如 Gemini Pro)交互时,推理性能得到提升,表明通过讨论可实现知识蒸馏。
- 当使用强提示时,单智能体与多智能体设置之间的性能差距显著缩小,这挑战了复杂多智能体架构的必要性。
- CMD 框架成功复现了类人讨论动态,并支持对交互机制的系统性分析,为未来多智能体推理研究提供了新基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。