Skip to main content
QUICK REVIEW

[论文解读] Query-Dependent Prompt Evaluation and Optimization with Offline Inverse RL

Hao Sun, Hüyük, Alihan|arXiv (Cornell University)|Sep 13, 2023
Topic Modeling被引用 5
一句话总结

该论文提出 Prompt-OIRL,一种基于离线逆强化学习的查询相关提示优化框架,用于在无需在线大语言模型推理的情况下评估和选择大语言模型在算术推理任务中的最优提示。通过利用基准测试中提示的离线演示数据,该方法训练一个奖励模型来评分查询-提示对,从而在多个大语言模型和数据集上,通过最佳- N 策略实现低成本、高精度的提示选择。

ABSTRACT

In this study, we aim to enhance the arithmetic reasoning ability of Large Language Models (LLMs) through zero-shot prompt optimization. We identify a previously overlooked objective of query dependency in such optimization and elucidate two ensuing challenges that impede the successful and economical design of prompt optimization techniques. One primary issue is the absence of an effective method to evaluate prompts during inference when the golden answer is unavailable. Concurrently, learning via interactions with the LLMs to navigate the expansive natural language prompting space proves to be resource-intensive. To address this, we introduce Prompt-OIRL, which harnesses offline inverse reinforcement learning to draw insights from offline prompting demonstration data. Such data exists as by-products when diverse prompts are benchmarked on open-accessible datasets. With Prompt-OIRL, the query-dependent prompt optimization objective is achieved by first learning an offline reward model. This model can evaluate any query-prompt pairs without accessing LLMs. Subsequently, a best-of-N strategy is deployed to recommend the optimal prompt. Our experimental evaluations across various LLM scales and arithmetic reasoning datasets underscore both the efficacy and economic viability of the proposed approach.

研究动机与目标

  • 解决在缺乏真实答案时,推理阶段评估提示有效性的挑战。
  • 克服因试错搜索过程中大量大语言模型推理调用而导致的在线提示优化成本过高问题。
  • 提出一种查询相关的提示优化目标,认识到最优提示因输入查询而异。
  • 系统性地利用现有离线提示数据集——这些数据是在基准测试过程中作为副产品生成的——作为提示优化的训练数据。
  • 开发一种成本效益高、可扩展的方法,以识别在多种大语言模型上表现优异的算术推理任务提示。

提出的方法

  • 利用先前在公开访问的算术推理数据集上对多样化提示进行基准测试所获得的离线演示数据,作为专家轨迹。
  • 通过逆强化学习训练一个离线奖励模型,以在推理阶段不访问大语言模型的情况下估计查询-提示对的质量。
  • 将提示优化问题建模为一个序列决策任务,其中每个动作是一个自然语言提示。
  • 在推理阶段应用最佳- N 采样策略,基于学习到的奖励模型选择得分最高的提示。
  • 利用算术推理任务的结构,定义状态表示,以编码查询上下文和提示特征。
  • 通过在相同数据集上学习多种提示变体,使奖励模型在不同查询间具备泛化能力,捕捉查询特定的性能模式。

实验结果

研究问题

  • RQ1离线逆强化学习能否在无需在线大语言模型交互的情况下,有效学习一个用于查询相关提示评估的奖励模型?
  • RQ2在不同大语言模型上,Prompt-OIRL 在准确性和成本效率方面与标准提示选择方法相比表现如何?
  • RQ3与查询无关的方法相比,查询相关提示优化在多大程度上提升了算术推理的准确性?
  • RQ4现有离线提示数据集能否在无需额外标注或大语言模型调用的情况下,被有效重用于提示优化?
  • RQ5该方法在不同规模的大语言模型和算术推理基准测试中表现如何?

主要发现

  • Prompt-OIRL 在多个大语言模型(如 GPT-3.5-turbo、Llama-2)上实现了算术推理准确性的显著提升,且在优化过程中无需任何额外的大语言模型推理。
  • 与在线试错方法相比,该方法将提示优化成本降低了 90% 以上,因为它仅依赖于预先收集的离线数据。
  • 查询相关优化目标相比分布级优化带来了更优性能,在 SVAMP 和 MAWPS 基准测试中准确率最高提升达 12%。
  • 学习到的奖励模型在不同大语言模型和算术推理任务间具有良好泛化能力,表明提示质量信号具有可迁移性。
  • 使用奖励模型进行最佳- N 推理可实现接近最优的性能,且额外成本极低,验证了该选择策略的有效性。
  • 该方法成功利用现有离线数据集作为专家演示数据源,实现了无需新数据收集的系统性提示优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。