Skip to main content
QUICK REVIEW

[论文解读] Learning To Retrieve Prompts for In-Context Learning

Ohad Rubin, Jonathan Herzig|arXiv (Cornell University)|Dec 16, 2021
Topic Modeling被引用 10
一句话总结

本文提出EPR(高效提示检索),一种利用语言模型作为打分函数,基于其生成正确输出的可能性,将训练样本标记为优质或劣质提示的方法。随后,基于这些标签通过对比学习训练密集检索器,在三个序列到序列任务中显著提升了少样本学习性能,相较于先前基线,在Break数据集上提升7.7%,在MTop数据集上提升7.2%。

ABSTRACT

In-context learning is a recent paradigm in natural language understanding, where a large pre-trained language model (LM) observes a test instance and a few training examples as its input, and directly decodes the output without any update to its parameters. However, performance has been shown to strongly depend on the selected training examples (termed prompt). In this work, we propose an efficient method for retrieving prompts for in-context learning using annotated data and a LM. Given an input-output pair, we estimate the probability of the output given the input and a candidate training example as the prompt, and label training examples as positive or negative based on this probability. We then train an efficient dense retriever from this data, which is used to retrieve training examples as prompts at test time. We evaluate our approach on three sequence-to-sequence tasks where language utterances are mapped to meaning representations, and find that it substantially outperforms prior work and multiple baselines across the board.

研究动机与目标

  • 为解决少样本学习性能严重依赖于少样本训练样本(提示)选择这一关键挑战。
  • 开发一种无需访问模型参数或微调即可学习检索高质量提示的方法。
  • 利用语言模型生成的监督信号,训练轻量级、高效的密集检索器,以实现提示选择。
  • 实现在模型权重不可用场景(如仅通过API使用)下与大语言模型的有效交互。
  • 提升结构化序列到序列任务(如语义解析和任务导向对话)的性能。

提出的方法

  • 对于每个训练样本(x, y),该方法使用无监督检索器从训练集中检索候选提示。
  • 一个打分语言模型估计每个候选提示的P(y|x, prompt),衡量在给定输入x和提示的情况下,正确输出y的可能性。
  • P(y|x, prompt)较高的提示被标记为正样本;概率较低的提示被标记为负样本。
  • 使用对比学习目标在标记数据上训练密集检索器,使其在推理时能够检索到高质量提示。
  • 打分语言模型可小于推理语言模型,从而实现高效的数据生成;或与之相同,支持基于API的部署。
  • 最终检索器在推理阶段用于为测试输入检索最相关的训练样本作为提示。

实验结果

研究问题

  • RQ1能否将语言模型用作代理,为少样本学习中的提示检索器训练生成高质量监督信号?
  • RQ2使用语言模型生成的提示质量标签是否能带来优于表面相似性启发式方法的检索性能?
  • RQ3在语言模型监督数据上训练的轻量级检索器是否能在下游序列到序列任务上超越基线表现?
  • RQ4当打分语言模型小于推理语言模型,或两者相同时(如GPT-3),该方法的有效性如何?
  • RQ5检索器在推理过程中在多大程度上依赖于高排名提示?其泛化能力是否超越了精确模式复制?

主要发现

  • 在Break基准上,EPR将少样本学习性能提升了5.9个百分点,当使用GPT-Neo作为打分和推理语言模型时,准确率从26%提升至31.9%。
  • 在MTop数据集上,EPR实现7.2个百分点的提升,准确率从57%上升至64.2%,在相同设置下。
  • 在SMCalFlow上,EPR将性能从51.4%提升至54.3%,表明在多样化任务中具有持续增益。
  • 当使用GPT-Neo作为更大模型(GPT-J、GPT-3、Codex)的代理时,EPR仍取得显著提升,显示出在不同模型规模下的鲁棒性。
  • 检索器主要从高排名提示中复制内容,如Break数据集中复制距离的分布所示,表明其有效检索到语义相关的样本。
  • 即使在无精确复制的情况下,模型仍能泛化至新结构,表明检索器支持超越记忆化的有意义少样本学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。