Skip to main content
QUICK REVIEW

[论文解读] Prompting is not a substitute for probability measurements in large language models

Jennifer J. Hu, Roger Lévy|arXiv (Cornell University)|May 22, 2023
Topic Modeling被引用 7
一句话总结

本文表明,元语言提示(使用自然语言查询来评估语言模型知识)所得到的结果在准确性和一致性上均不如直接从模型logits中获取的概率测量。作者发现,大语言模型对提示的响应常常与其真实的内部概率分布不符,从而削弱了提示作为语言评估中直接测量替代方法的有效性。

ABSTRACT

Prompting is now a dominant method for evaluating the linguistic knowledge of large language models (LLMs). While other methods directly read out models' probability distributions over strings, prompting requires models to access this internal information by processing linguistic input, thereby implicitly testing a new type of emergent ability: metalinguistic judgment. In this study, we compare metalinguistic prompting and direct probability measurements as ways of measuring models' linguistic knowledge. Broadly, we find that LLMs' metalinguistic judgments are inferior to quantities directly derived from representations. Furthermore, consistency gets worse as the prompt query diverges from direct measurements of next-word probabilities. Our findings suggest that negative results relying on metalinguistic prompts cannot be taken as conclusive evidence that an LLM lacks a particular linguistic generalization. Our results also highlight the value that is lost with the move to closed APIs where access to probability distributions is limited.

研究动机与目标

  • 评估元语言提示是否能可靠地衡量大语言模型(LLMs)的语言知识。
  • 比较元语言提示与直接从模型logits中获取的概率测量在准确性和一致性方面的表现。
  • 强调依赖封闭API、无法访问内部概率分布所带来的风险。
  • 主张在大语言模型的科学评估中,不应将提示用作直接测量的替代方法。

提出的方法

  • 本研究比较了直接概率测量(从模型logits中提取P( token|context ))与元语言提示(通过自然语言查询评估语言可接受性或可能性)的方法。
  • 在多个语言领域内开展了四项实验,包括主谓一致、关系从句附着和语义合理性。
  • 对于每个任务,将模型对元语言提示(例如:'下一个最可能的词是什么?')的响应与其实际候选补全的概率分布进行对比。
  • 研究使用零样本提示和对GPT-3、GPT-3.5和LLaMA等模型的直接logit访问,以确保方法的一致性。
  • 通过比较两种方法下候选补全的排序一致性,量化提示与直接测量之间的一致性。
  • 所有实验均在多个模型和提示上重复进行,代码与数据已公开发布。
(a)
(a)

实验结果

研究问题

  • RQ1元语言提示的响应在多大程度上比直接测量更准确地反映大语言模型内部表征的概率?
  • RQ2提示结构与直接概率查询的偏离程度在多大程度上影响了元语言提示与直接概率测量之间的一致性?
  • RQ3模型在元语言提示任务上的表现是否反映了其真实的语言能力,还是仅是一种新兴的与性能相关的技能?
  • RQ4提示中得出的负面结果能否被解释为大语言模型缺乏特定语言归纳能力的证据?
  • RQ5由于封闭API导致无法访问内部概率分布,这在多大程度上影响了语言评估的有效性?

主要发现

  • 与直接概率测量相比,元语言提示在评估语言知识方面显著不准确,尤其是在罕见或复杂语言模式下。
  • 随着提示结构与直接概率查询的偏离程度增加,元语言提示与直接概率测量之间的一致性降低。
  • 即使模型内部的概率分布明确倾向于某个token,模型在提示任务中仍经常无法报告最可能的下一个词。
  • 提示与直接测量之间的差异并非源于模型在表征能力上的局限,而是源于模型在元语言查询下访问和报告其内部知识的能力不足。
  • 本研究证明,提示中得出的负面结果(如拒绝一个语法正确的结构)不能被作为语言能力不足的决定性证据。
  • 作者得出结论:在科学研究中,尤其当无法访问模型内部时,不应将提示用作直接概率测量的替代方法。
(b)
(b)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。