[论文解读] Reprompting: Automated Chain-of-Thought Prompt Inference Through Gibbs Sampling
Reprompting 是一种自动化的、迭代的 Gibbs 采样算法,无需人工干预即可为少样本推理任务发现高性能的思维链(CoT)提示。通过使用更强的模型生成初始 CoT 解决方案,并通过自我重提示迭代优化,其在 Big-Bench Hard 任务上的准确率相比人工编写的 CoT 基线最高提升了 17 个百分点。
We introduce Reprompting, an iterative sampling algorithm that automatically learns the Chain-of-Thought (CoT) recipes for a given task without human intervention. Through Gibbs sampling, Reprompting infers the CoT recipes that work consistently well for a set of training samples by iteratively sampling new recipes using previously sampled recipes as parent prompts to solve other training problems. We conduct extensive experiments on 20 challenging reasoning tasks. Results show that Reprompting outperforms human-written CoT prompts substantially by +9.4 points on average. It also achieves consistently better performance than the state-of-the-art prompt optimization and decoding algorithms.
研究动机与目标
- 为解决人工编写的思维链(CoT)提示在可扩展性和泛化性方面的局限性,这些提示需要专家投入且具有模型特异性。
- 开发一种自动化方法,仅使用少量标注的问答对,为给定模型发现有效的 CoT 提示。
- 通过为目标模型专门优化 CoT 提示,实现从更强模型到更弱模型的知识迁移。
- 通过识别模型特定的 CoT 提示配方而非依赖通用提示,确保更公平的模型比较。
- 通过使用 Gibbs 采样进行迭代且自我改进的提示生成,提升少样本推理性能。
提出的方法
- Reprompting 将 CoT 提示发现建模为推理配方的联合分布,该分布难以直接计算。
- 它使用 Gibbs 采样,通过将先前生成的解决方案作为父提示来解决其他训练样本,迭代采样新的 CoT 配方。
- 初始配方通过零样本提示生成,随后通过使用不同训练样本进行多轮自我重提示进行优化。
- 该算法将来自多样化训练问题的解决方案整合为一个共享的高性能提示集合,使其能泛化到测试实例。
- 它支持模型组合,使用更强的 LLM(如 ChatGPT)生成初始 CoT 解决方案,再使用更弱的 LLM(如 InstructGPT)进行优化。
- 该过程收敛到一组稳定的 CoT 配方,能持续解决训练问题并泛化到未见的测试样本。
实验结果
研究问题
- RQ1自动化算法能否在无需人工干预的情况下,为多步推理任务发现有效的思维链提示?
- RQ2与零样本或人工编写的提示相比,通过 Gibbs 采样进行迭代自我重提示在多大程度上提升了 CoT 提示的质量?
- RQ3更弱的 LLM 在多大程度上能从由更强 LLM 通过重提示生成的 CoT 提示中受益?
- RQ4CoT 提示的性能是否严重依赖于目标 LLM,从而需要进行模型特定的优化?
- RQ5Reprompting 是否能在基准推理任务上超越最先进的、人工编写的 CoT 提示方法?
主要发现
- 在 Big-Bench Hard 任务上,Reprompting 相较于此前最先进的方法(依赖人工编写的 CoT 提示)最高提升了 +17.0 个百分点的准确率。
- 在五个 BBH 任务上,Reprompting 在 ChatGPT 和 InstructGPT 上均一致优于零样本、少样本以及人工编写的 CoT 基线。
- 使用 ChatGPT 生成初始 CoT 解决方案,再通过 InstructGPT 进行重提示,相比仅使用 InstructGPT,性能最高提升了 +71.0 个百分点。
- 当使用为自身专门优化的 CoT 提示时,InstructGPT 在某些任务上甚至优于 ChatGPT,凸显了模型特定提示的敏感性。
- 该方法表明,对某一模型有效的 CoT 配方可能在另一模型上失效,强调了进行模型特定提示优化的必要性。
- Reprompting 仅用少量训练样例即可成功生成高质量的 CoT 配方,实现了强大的少样本泛化能力,且未减慢推理速度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。