[论文解读] PREFER: Prompt Ensemble Learning via Feedback-Reflect-Refine
该论文提出 Prefer,一种新颖的提示集成方法,通过反馈-反思-优化循环自动化并增强大语言模型(LLM)的提示工程,实现自我驱动的提示优化与通过双边袋装法保持的稳定性能。该方法在多个任务上实现了最先进性能,仅需极少的人工干预,并且在效率上优于现有方法。
As an effective tool for eliciting the power of Large Language Models (LLMs), prompting has recently demonstrated unprecedented abilities across a variety of complex tasks. To further improve the performance, prompt ensemble has attracted substantial interest for tackling the hallucination and instability of LLMs. However, existing methods usually adopt a two-stage paradigm, which requires a pre-prepared set of prompts with substantial manual effort, and is unable to perform directed optimization for different weak learners. In this paper, we propose a simple, universal, and automatic method named PREFER (Pompt Ensemble learning via Feedback-Reflect-Refine) to address the stated limitations. Specifically, given the fact that weak learners are supposed to focus on hard examples during boosting, PREFER builds a feedback mechanism for reflecting on the inadequacies of existing weak learners. Based on this, the LLM is required to automatically synthesize new prompts for iterative refinement. Moreover, to enhance stability of the prompt effect evaluation, we propose a novel prompt bagging method involving forward and backward thinking, which is superior to majority voting and is beneficial for both feedback and weight calculation in boosting. Extensive experiments demonstrate that our PREFER achieves state-of-the-art performance in multiple types of tasks by a significant margin. We have made our code publicly available.
研究动机与目标
- 解决现有两阶段提示集成方法的局限性,这些方法依赖预定义提示且缺乏联合优化。
- 通过大语言模型的反思实现自动、自适应的提示生成,从而减少人工干预和领域专业知识需求。
- 通过在统一的、反馈驱动的框架中整合提升(boosting)与袋装(bagging),提升稳定性和性能。
- 通过结合正向与反向思维的双边袋装策略,提升提示质量和鲁棒性。
- 通过反馈驱动的反思,聚焦于难例,实现提示的定向优化。
提出的方法
- 提出一个反馈-反思-优化循环,大语言模型在难例上接收错误反馈并进行反思,以生成优化后的提示。
- 利用大语言模型基于对先前提示缺陷的反思分析,自动合成新提示。
- 引入一种双边袋装方法,结合正向与反向思维以计算置信度分数,提升稳定性。
- 采用动态重加权提示的提升机制,根据性能表现聚焦于难例。
- 利用大语言模型的生成与反思能力,联合优化提示质量与下游任务性能。
- 设计一种自洽的反馈机制,通过多重视角验证推理路径,避免幻觉。
实验结果
研究问题
- RQ1自动、自我反思的提示框架是否能在大语言模型任务中超越人工或预定义提示集成?
- RQ2将反馈-反思-优化与双边袋装结合,如何提升提示集成学习中的稳定性和性能?
- RQ3反馈驱动的提示优化在多大程度上能减少幻觉并提升难例上的泛化能力?
- RQ4统一的提升与袋装框架是否能超越分离或单阶段的集成方法?
- RQ5与现有自动化提示方法相比,该方法在效率和收敛速度方面表现如何?
主要发现
- Prefer 在多个自然语言处理任务中实现了最先进性能,显著超越现有提示集成基线方法。
- 移除反馈-反思-优化机制导致的性能下降幅度大于移除袋装机制,表明其在定向优化中的关键作用。
- 结合正向与反向思维的双边袋装方法优于多数投票法,提升了稳定性和置信度估计。
- 与 APO 相比,Prefer 收敛更快,且在更少的 API 调用下保持稳定性能,展现出更优的训练效率。
- 该方法减少了对人工提示工程的依赖,同时提升了鲁棒性,案例研究显示其提示优化更具信息量且逻辑更一致。
- 在训练效率基准测试中,Prefer 所需的 API 调用次数显著更少,每优化步骤耗时更短,尤其在束搜索和带 bandit 选择阶段表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。