[论文解读] TEMPERA: Test-Time Prompting via Reinforcement Learning
TEMPERA 提出了一种基于强化学习的测试时提示编辑方法,用于大规模语言模型,通过灵活修改指令、少样本范例和表述词,实现动态、查询相关的提示优化。该方法在多个自然语言处理任务中达到最先进性能,样本效率比标准微调高出4倍,显著优于提示调优和离散提示优化方法。
Careful prompt design is critical to the use of large language models in zero-shot or few-shot learning. As a consequence, there is a growing interest in automated methods to design optimal prompts. In this work, we propose Test-time Prompt Editing using Reinforcement learning (TEMPERA). In contrast to prior prompt generation methods, TEMPERA can efficiently leverage prior knowledge, is adaptive to different queries and provides an interpretable prompt for every query. To achieve this, we design a novel action space that allows flexible editing of the initial prompts covering a wide set of commonly-used components like instructions, few-shot exemplars, and verbalizers. The proposed method achieves significant gains compared with recent SoTA approaches like prompt tuning, AutoPrompt, and RLPrompt, across a variety of tasks including sentiment analysis, topic classification, natural language inference, and reading comprehension. Our method achieves 5.33x on average improvement in sample efficiency when compared to the traditional fine-tuning methods.
研究动机与目标
- 为解决大语言模型对提示设计的敏感性问题,通过在测试时实现动态、与查询相关的提示优化。
- 通过用自适应提示编辑替代或补充传统微调,提升少样本学习中的样本效率。
- 通过使用结构化的编辑动作空间,在提示优化中实现可解释性、灵活性与可行性之间的平衡。
- 通过从人工设计的初始提示出发,采用可学习的编辑过程,将人类先验知识融入提示优化。
- 在包括 GLUE 和 SuperGLUE 在内的多样化自然语言处理基准上,以极少的超参数调优实现最先进性能。
提出的方法
- 将离散提示优化形式化为强化学习问题,其中智能体使用预定义的动作空间对初始提示进行编辑。
- 设计了一种新颖的动作空间,通过自然语言操作(如替换、插入、删除)支持对指令、上下文范例和表述词的编辑。
- 以编辑前后提示的得分差值作为主要奖励信号,并通过奖励归一化稳定训练过程。
- 采用基于注意力的策略网络,关注候选编辑和设计选择,以提升探索效率和策略学习效果。
- 通过从人工手工设计的提示初始化,并允许强化学习根据每个查询进行优化,实现人类先验知识的集成。
- 在训练中应用课程学习和温度缩放,以提升收敛性和性能表现。
实验结果
研究问题
- RQ1通过强化学习实现的测试时提示编辑,是否能在多种自然语言处理任务中显著提升大语言模型的零样本和少样本性能?
- RQ2与标准微调和其他提示调优技术相比,该方法在样本效率方面表现如何?
- RQ3与固定或黑箱提示生成方法相比,编辑动作空间的灵活性在多大程度上促进了性能提升?
- RQ4该方法在少样本范例数量和提示池大小变化时的鲁棒性如何?
- RQ5该方法能否在确保语义连贯编辑的前提下,保持高性能并实现可解释性?
主要发现
- TEMPERA 在多个基准上达到最先进性能,相比少样本微调,在 SST-2 上实现1.8%的绝对性能提升,在 CR 上实现3.9%的提升。
- 与标准微调相比,该方法在样本效率方面平均提升5.33倍,结果表明仅需4倍少的样本即可达到相同性能。
- 随着上下文范例数量增加(最多4个),性能持续提升,但在 AG News 中,当范例数量增至8个时,由于输入长度限制,性能出现下降。
- 该方法对提示池大小具有鲁棒性,当提示池大小从8增至32时,AG News 上性能略有提升(最高0.6%)。
- 表述词编辑对性能有显著贡献,在 AG News 上带来1.2%的性能增益,凸显其在特定任务提示设计中的重要性。
- 消融实验证实,每个编辑组件(表述词、指令、范例)均带来可测量的性能增益,移除任一组件均导致最终性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。