[论文解读] SPELL: Semantic Prompt Evolution based on a LLM
SPELL 提出了一种黑箱提示优化方法,利用大型语言模型(LLM)作为语义文本生成器,通过进化计算演化出连贯且高性能的提示。通过使用 LLM 以繁殖和选择的方式生成流畅、全局优化的提示,SPELL 实现了显著的性能提升——例如在 SST-2 上达到 89.2% 的准确率——同时保持了流畅性,在更少轮次内优于其他黑箱方法。
Prompt engineering is a new paradigm for enhancing the performance of trained neural network models. For optimizing text-style prompts, existing methods usually individually operate small portions of a text step by step, which either breaks the fluency or could not globally adjust a prompt. Since large language models (LLMs) have powerful ability of generating coherent texts token by token, can we utilize LLMs for improving prompts? Based on this motivation, in this paper, considering a trained LLM as a text generator, we attempt to design a black-box evolution algorithm for automatically optimizing texts, namely SPELL (Semantic Prompt Evolution based on a LLM). The proposed method is evaluated with different LLMs and evolution parameters in different text tasks. Experimental results show that SPELL could rapidly improve the prompts indeed. We further explore the evolution process and discuss on the limitations, potential possibilities and future work.
研究动机与目标
- 解决现有提示优化方法局部修改提示导致流畅性下降的局限性。
- 探究大型语言模型(LLMs)是否可作为有效生成器,用于演化高质量、连贯的提示。
- 开发一种无需访问目标模型梯度的黑箱进化框架,以优化提示。
- 评估不同 LLM 及进化超参数对提示质量与任务性能的影响。
- 分析所提出的语义提示演化过程的稳定性、连贯性与可扩展性。
提出的方法
- SPELL 维护一个提示个体的种群,并通过繁殖和选择机制在多代中演化它们。
- 繁殖通过提示一个预训练的 LLM 来改写或改进现有提示,基于适应度反馈生成后代。
- LLM 充当文本生成器,通过逐标记建模整个提示上下文,确保语义连贯性和全局优化。
- 选择从父代与后代的并集中保留适应度最高的个体,使用验证集上的准确率作为适应度度量。
- 该方法在黑箱设置下运行,仅需目标模型的推理访问权限,无需梯度或参数访问。
- 进化过程持续 T 代,超参数如种群大小(N_POP)、选择 k 和适应度函数经过调整,以在探索与利用之间取得平衡。
实验结果
研究问题
- RQ1大型语言模型能否被有效用作语义生成器,以演化出连贯且高性能的提示?
- RQ2SPELL 在性能和收敛速度方面相较于现有黑箱提示优化方法表现如何?
- RQ3用作生成器的不同 LLM 对演化提示的质量与稳定性有何影响?
- RQ4关键超参数(如种群大小和选择 k)如何影响优化结果?
- RQ5使用 LLM 进行语义提示演化存在哪些局限与挑战,特别是关于不稳定性与连贯性方面?
主要发现
- SPELL 在 SST-2 基准上达到 89.2% 的准确率,优于其他黑箱方法如 BBT(88.2%)和 RLPrompt(90.5%),且在零样本设置下表现更优。
- 该方法所需的优化轮次显著少于基线黑箱方法——例如,对于 5 个 token 的提示,优化轮次少于 3k 次——表明其收敛迅速。
- 使用目标模型的准确率作为适应度函数,效果优于使用交叉熵损失,表明 LLM 可能无法有效理解损失信号。
- 作为生成器的更大、更强大的 LLM(如 ERNIE-Bot 和 Llama2-13B)生成的提示性能优于较小或对齐度较低的模型(如 BLOOMZ)。
- 种群大小和选择 k 对性能有显著影响:种群过小或过大均会降低性能,最优平衡点出现在 N_POP=20 和 k=16。
- 尽管生成过程存在随机性导致的性能波动,演化出的提示仍保持语义连贯与流畅,如示例所示:'你能帮我判断这句话的情感吗?'
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。