Skip to main content
QUICK REVIEW

[论文解读] "According to ...": Prompting Language Models Improves Quoting from Pre-Training Data

Orion Weller, Marc Marone|arXiv (Cornell University)|May 22, 2023
Topic Modeling被引用 6
一句话总结

本文提出了「according-to prompting」——一种通过提示模型直接引用其预训练数据(如维基百科)来提升大语言模型事实准确性的方法。通过一种新颖的度量指标QUIP-Score,作者证明此类提示可使精确引用重叠度提升5%至105%,同时保持或提升下游任务性能,尤其在模型规模增大时表现更优。

ABSTRACT

Large Language Models (LLMs) may hallucinate and generate fake information, despite pre-training on factual data. Inspired by the journalistic device of "according to sources", we propose according-to prompting: directing LLMs to ground responses against previously observed text. To quantify this grounding, we propose a novel evaluation metric (QUIP-Score) that measures the extent to which model-produced answers are directly found in underlying text corpora. We illustrate with experiments on three corpora (Wikipedia, PubMed, and the U.S. legal tax code) that these prompts improve grounding under our metrics, with the additional benefit of often improving end-task performance. Furthermore, prompts that ask the model to decrease grounding (or to ground to other corpora) indeed decrease QUIP-Score, indicating the ability of LLMs to increase or decrease grounded generations on request.

研究动机与目标

  • 解决尽管大语言模型(LLMs)在事实性数据上进行过预训练,但其幻觉问题依然持续存在的挑战。
  • 探究自然语言提示是否能够引导大语言模型更多地引用其记忆中的预训练语料库内容。
  • 开发一种快速、高效且保护隐私的方法,用于度量模型输出在多大程度上基于预训练数据。
  • 评估提示是否可根据指令内容同时提升或降低模型输出在特定语料库(如维基百科)中的事实准确性。
  • 评估在不同模型规模和数据集上,事实准确性提升的可扩展性。

提出的方法

  • 提出「according-to prompting」——一种提示策略,引导大语言模型使用如「According to Wikipedia」等短语来引用预训练数据,以增强其输出的事实依据。
  • 引入QUIP-Score,一种基于n-gram重叠的新型度量指标,用于量化生成内容中与预训练语料库中片段完全匹配的比例。
  • 使用Data Portraits实现快速、亚毫秒级的成员资格检测,从而高效计算大规模语料库(如维基百科)的QUIP-Score。
  • 收集并评估由人类编写的提示,用于引导大语言模型在开放域问答(ODQA)任务中更倾向于或更少依赖维基百科的事实来源。
  • 在多个模型(开源与闭源)、数据集和模型规模上开展实验,评估事实准确性与性能之间的权衡。
  • 分析QUIP-Score与实体流行度、共现频率以及指令微调等因素之间的相关性。

实验结果

研究问题

  • RQ1通过提示模型使用如「According to Wikipedia」等短语,是否能显著提升其输出在预训练数据中的事实准确性?
  • RQ2通过提示提升事实准确性是否能带来可测量的事实一致性提升及下游任务性能改善?
  • RQ3提示是否也能用于减少模型在特定语料库(如维基百科)中的事实准确性?这种减少是否会影响相关任务的性能?
  • RQ4模型规模如何影响「according-to prompting」在提升事实准确性方面的有效性?
  • RQ5QUIP-Score是否是一种可靠且可扩展的度量指标,可用于评估大语言模型生成内容的事实准确性?

主要发现

  • 在多个数据集和模型上,according-to prompting 使模型生成内容与维基百科的重叠度提升了5%至105%。
  • 该事实准确性提升在开源与闭源模型中均保持一致,包括GPT-3.5和GPT-J。
  • 反事实引导提示(即抑制维基百科引用或引导至其他来源)显著降低了QUIP-Score,并损害了依赖维基百科的任务性能。
  • QUIP-Score随模型规模增大而提升,表明更大模型对事实引导提示更具响应性。
  • QUIP-Score与问题中实体的流行度及共现频率呈正相关,表明对常见事实的召回能力更强。
  • 该方法具有领域无关性,可应用于任何已构建Data Portrait的语料库,从而实现对闭源模型事实准确性的隐私保护型评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。