[论文解读] Diversity of Thought Improves Reasoning Abilities of LLMs
本文提出Div-Se与IDiv-Se方法,通过大语言模型(LLM)反馈生成多样化的提示策略,进而对多次推理调用(Div-Se)或单次调用内(IDiv-Se)的响应进行集成,以增强大语言模型(LLM)的推理能力。该方法在不修改解码过程的前提下提升了准确性,实现了SOTA性能——在4/5 Blocksworld任务上最高提升29.6个百分点,同时在使用GPT-3.5和GPT-4的多个推理基准上推进了准确率-成本的帕累托前沿。
Large language models (LLMs) are documented to struggle in settings that require complex reasoning. Nevertheless, instructing the model to break down the problem into smaller reasoning steps, or ensembling various generations through modifying decoding steps boosts performance. However, these methods assume that the input prompt is fixed and expect the decoding strategies to introduce the diversity needed for ensembling. In this work, we discuss how one can create and leverage variations of the input prompt as a means of diversity of thought. We propose a method that automatically improves prompt diversity by soliciting feedback from the LLM to ideate approaches that are apt for the problem. We then ensemble the diverse prompts in our method DIVSE (DIVerse reasoning path Self-Ensemble) across multiple inference calls, or use diverse approaches within a single inference call; we call the latter IDIV-SE (In-call DIVerse reasoning path Self-Ensemble). Apart from our approaches outperforming prior work, DIV-SE(in particular) advances state-of-the-art performance on the challenging planning and graph coloring benchmarks. Our results improve the Pareto frontier of the accuracy-cost trade-off.
研究动机与目标
- 为解决少样本和零样本思维链(CoT)提示中固定提示的局限性,即性能提升完全依赖于解码的随机性。
- 在不修改解码过程的前提下提升LLM的推理性能,尤其适用于商业或黑箱部署环境。
- 探究思维层面的多样性——即不同的问题求解方法——是否能比标记层面的随机性更有效地提升集成准确率。
- 通过IDiv-Se实现单次调用内处理多个多样化提示,降低推理成本,同时保持或提升性能。
- 确立思维多样性作为一项有原则的提示策略,推动LLM推理中准确率与成本之间的帕累托前沿。
提出的方法
- 该方法通过大语言模型反馈,为给定的推理任务生成多种高层次的问题求解方法(例如,倒推法、可视化、排除法)
- 将每种识别出的方法用于将先前工作中的示例推理步骤(如思维链)进行风格迁移,转化为与该方法一致的新提示格式
- Div-Se执行多次独立的推理调用,每次使用不同的多样化提示,通过多数投票法聚合结果
- IDiv-Se将n个多样化提示整合为单个输入提示,在一次推理调用中生成n条推理路径,随后通过多数投票法聚合输出
- 该方法利用模型提出多样化推理策略的能力,确保思维层面的多样性,而非标记层面的多样性
- 通过多数投票或元推理技术进行聚合,以提高最终输出的可靠性

实验结果
研究问题
- RQ1向大语言模型征询多样化的问题求解方法,是否能超越标准CoT和自一致性(SC)方法,提升推理性能?
- RQ2思维层面的多样性(如倒推法、可视化等不同策略)是否比标记层面的多样性带来更高的集成准确率?
- RQ3单次推理调用方法(IDiv-Se)能否在显著降低计算成本的同时,实现与多调用集成(Div-Se)相当的性能?
- RQ4通过大语言模型反馈生成的提示多样性,在多大程度上推进了推理基准中的准确率-成本帕累托前沿?
- RQ5在不使用集成聚合的情况下,由大语言模型建议的多样化提示策略是否能独立超越零样本CoT?
主要发现
- 在GPT-3.5和GPT-4的多个推理基准(包括AQUA-RAT和Blocksworld)上,Div-Se与IDiv-Se均优于思维链(CoT)和自一致性(SC)提示方法
- 在具有挑战性的4/5 Blocksworld任务中,Div-Se相比之前SOTA方法提升了29.6个百分点,超过该指标最高报告准确率的幅度达此水平
- 在AQUA-RAT基准中,IDiv-Se在少样本设置下,使用GPT-3.5时相比CoT提升了16.52个百分点
- IDiv-Se在显著更低的推理成本下实现了与Div-Se相当的准确率,证明了单次调用内集成推理的可行性
- 即使不使用集成聚合,由大语言模型建议的多样化提示策略也优于标准的零样本CoT,表明提示多样性本身具有内在价值
- 元推理聚合进一步提升了结果,表明推理路径中蕴含丰富信息,可被事后处理技术有效利用

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。