[论文解读] Agent Instructs Large Language Models to be General Zero-Shot Reasoners
该论文提出 AgentInstruct,一种利用自主语言智能体生成特定任务指令的方法,通过将大语言模型(LLMs)的推理过程与网络验证的、任务特定的指导对齐,从而提升 LLM 在多样化自然语言处理任务中的零样本推理能力。AgentInstruct 在 29 个数据集中的 20 个上达到当前最优的零样本性能,使 Llama-2-70b-chat 的性能提升 23.2%,相较于思维链提示方法,推理能力平均提升 10.5%。
We introduce a method to improve the zero-shot reasoning abilities of large language models on general language understanding tasks. Specifically, we build an autonomous agent to instruct the reasoning process of large language models. We show this approach further unleashes the zero-shot reasoning abilities of large language models to more tasks. We study the performance of our method on a wide set of datasets spanning generation, classification, and reasoning. We show that our method generalizes to most tasks and obtains state-of-the-art zero-shot performance on 20 of the 29 datasets that we evaluate. For instance, our method boosts the performance of state-of-the-art large language models by a large margin, including Vicuna-13b (13.3%), Llama-2-70b-chat (23.2%), and GPT-3.5 Turbo (17.0%). Compared to zero-shot chain of thought, our improvement in reasoning is striking, with an average increase of 10.5%. With our method, Llama-2-70b-chat outperforms zero-shot GPT-3.5 Turbo by 10.2%.
研究动机与目标
- 提升大语言模型在通用、多样化自然语言理解任务中的零样本推理能力。
- 解决现有零样本方法(如思维链)在广泛任务分布上泛化能力差的局限性。
- 开发一种可扩展、通用的方法,在无需微调或特定任务示例的情况下解锁 LLM 的推理能力。
- 通过自主智能体提供高质量、任务特定的推理指令,使 LLM 在未见过的任务上表现更优。
提出的方法
- 部署一个自主语言智能体,基于最少输入(如数据集名称和示例输入)使用网络检索获取与任务相关的知识。
- 利用该智能体生成逐步的、任务特定的指令,引导 LLM 的推理过程朝向正确答案。
- 将智能体生成的指令与 LLM 的思维链推理相结合,使推理步骤与任务特定需求对齐。
- 使用一个 LLM 作为推理引擎,另一个 LLM 作为智能体规划器,两者均被提示生成结构化、可执行的指令。
- 通过网络来源的事实和一致性检查验证指令质量,以确保可靠性和任务对齐。
- 在生成、分类和推理任务中端到端应用该方法,采用零样本设置——无需微调,也无需少样本示例。

实验结果
研究问题
- RQ1自主智能体能否生成显著提升 LLM 在多样化自然语言处理任务中零样本推理能力的任务特定指令?
- RQ2AgentInstruct 在通用自然语言理解任务的零样本性能方面,与标准零样本提示和思维链提示相比如何?
- RQ3AgentInstruct 在多大程度上超越狭窄任务领域,在更广泛的任务分布中提升推理能力?
- RQ4AgentInstruct 能否在涵盖生成、分类和推理的 29 个数据集的广泛基准上实现最先进水平的零样本性能?
主要发现
- AgentInstruct 在 29 个评估数据集中的 20 个上达到最先进水平的零样本性能,展现出在各类任务类型中的强大泛化能力。
- 该方法使 Llama-2-70b-chat 的平均零样本性能提升 23.2%,Vicuna-13b 提升 13.3%,GPT-3.5 Turbo 提升 17.0%。
- 与零样本思维链提示相比,AgentInstruct 平均提升推理性能 10.5%,在 12 个推理任务中的 10 个上表现更优。
- 尽管 GPT-3.5 Turbo 模型性能更强,Llama-2-70b-chat 搭载 AgentInstruct 后,在平均性能上仍比标准零样本 GPT-3.5 Turbo 提升 10.2%。
- 智能体生成的指令极为有效,因其基于网络检索的知识,并经过一致性与任务相关性验证。
- 该方法具有鲁棒性和可扩展性,无需微调或特定任务示例,适用于包括文本生成、分类和推理在内的多样化自然语言处理任务。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。