Skip to main content
QUICK REVIEW

[论文解读] An Information-theoretic Approach to Prompt Engineering Without Ground Truth Labels

Taylor Sorensen, Joshua A. Robinson|arXiv (Cornell University)|Mar 21, 2022
Natural Language Processing Techniques被引用 5
一句话总结

该论文提出了一种新颖的无标签提示工程方法,通过最大化输入与模型输出之间的互信息(MI),选择最优的提示模板,从而无需依赖真实标签或模型参数访问。在八个多样化的自然语言处理任务中,基于MI的方法实现了从平均提示准确率到最佳提示准确率的90%进展——在无真实标签或模型权重的情况下达到接近最优(oracle)的性能。

ABSTRACT

Pre-trained language models derive substantial linguistic and factual knowledge from the massive corpora on which they are trained, and prompt engineering seeks to align these models to specific tasks. Unfortunately, existing prompt engineering methods require significant amounts of labeled data, access to model parameters, or both. We introduce a new method for selecting prompt templates extit{without labeled examples} and extit{without direct access to the model}. Specifically, over a set of candidate templates, we choose the template that maximizes the mutual information between the input and the corresponding model output. Across 8 datasets representing 7 distinct NLP tasks, we show that when a template has high mutual information, it also has high accuracy on the task. On the largest model, selecting prompts with our method gets 90\% of the way from the average prompt accuracy to the best prompt accuracy and requires no ground truth labels.

研究动机与目标

  • 解决在标注数据稀缺或不可用的低资源设置下提示工程的挑战。
  • 消除对模型参数或真实标签的依赖,以选择有效的提示模板。
  • 开发一种仅利用冻结语言模型的输入输出统计信息来预测提示性能的方法。
  • 证明输入与模型输出之间的互信息可作为下游任务准确率的强代理指标。
  • 实现对闭源或黑箱语言模型的提示选择,其中基于梯度的优化不可行。

提出的方法

  • 该方法通过估计输入标记与模型生成输出之间互信息(MI)来选择提示模板。
  • 对于每个候选模板,模型在保留的输入集合上生成输出,并计算输入与输出分布之间的MI。
  • 使用非参数化的k近邻方法对输入和输出标记序列的联合分布进行MI估计。
  • 选择估计MI最高的模板作为最具信息量且最可能实现高任务准确率的模板。
  • 该方法完全基于冻结语言模型的输出运行,无需微调或访问模型权重。
  • 通过合并标记集合来降低输出方差,提升MI估计的稳定性。

实验结果

研究问题

  • RQ1输入与模型输出之间的互信息能否作为提示选择中下游任务准确率的可靠代理?
  • RQ2在不使用真实标签的情况下,基于MI的提示选择在多大程度上能匹配使用真实标签的最优提示选择性能?
  • RQ3当真实标签不可用时,基于MI的方法在多样化NLP任务和不同模型规模下的表现如何?
  • RQ4该方法在不同提示模板和输入分布上是否具备泛化能力?
  • RQ5在无法访问模型参数的情况下,MI估计是否仍能识别出高性能提示?

主要发现

  • 在最大模型(GPT-3 Davinci,175B参数)上,基于MI的方法在未使用任何真实标签的情况下,实现了从平均提示准确率到最佳提示准确率的90%进展。
  • 该方法在八个数据集中的三个上选中了表现最佳的提示,展现出强大的预测能力。
  • 在全部八个数据集和七个NLP任务中,均观察到互信息与下游任务准确率之间存在强烈的正相关性。
  • 该方法优于随机选择和平均模板选择,在无真实标签或模型权重访问的情况下,始终将性能排在前列。
  • 互信息与准确率之间的相关性在更大语言模型上最强,表明该方法可扩展至当前最先进模型。
  • 该方法在黑箱模型上也有效,因为它仅需推理输出,无需梯度计算或模型访问。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。