Skip to main content
QUICK REVIEW

[论文解读] Self-Prompting Large Language Models for Zero-Shot Open-Domain QA

Junlong Li, Wang, Jinyuan|arXiv (Cornell University)|Dec 16, 2022
Topic Modeling被引用 13
一句话总结

本文提出 Self-Prompting,一种利用大语言模型(LLMs)自动生成高质量伪 QA 数据集的框架,包含用于 few-shot 开放域问答中上下文学习的文本片段与解释。通过迭代式提示 LLM 生成结构化的 QA 三元组,并采用基于聚类的检索方法选取多样且关键的示范样本,该方法在 WebQ、NQ 和 TriviaQA 上达到最先进性能,无需任何训练数据即可匹配或超越微调过的 Retriever-Reader 模型。

ABSTRACT

Open-Domain Question Answering (ODQA) aims to answer questions without explicitly providing specific background documents. This task becomes notably challenging in a zero-shot setting where no data is available to train tailored retrieval-reader models. While recent Large Language Models (LLMs) like GPT-3 have demonstrated their effectiveness in zero-shot ODQA using direct prompting methods, these methods still fall short of fully harnessing the potential of LLMs when implicitly invoked. In this paper, we propose a Self-Prompting framework to explicitly utilize the massive knowledge encoded in the parameters of LLMs and their strong instruction understanding abilities. Concretely, we prompt LLMs step by step to generate multiple pseudo QA pairs with background passages and explanations entirely from scratch. These generated elements are then utilized for in-context learning. Experimental results show that our method significantly surpasses previous state-of-the-art zero-shot methods on three widely-used ODQA datasets and even achieves comparable performance with various customized fine-tuned models on full training data. Our code is available at https://github.com/lockon-n/self-prompting.

研究动机与目标

  • 解决零样本开放域问答(ODQA)中缺乏训练数据或外部知识语料库的挑战。
  • 明确利用 LLM 的知识能力与指令遵循能力,超越简单的直接提示。
  • 通过为上下文学习生成带有文本片段与解释的伪 QA 数据集,提升零样本 ODQA 性能。
  • 开发一种有效方法,从生成的伪数据集中选取高质量、多样化的示范样本用于推理。
  • 评估 LLM 生成的数据在上下文学习中是否可达到人工标注训练数据的性能。

提出的方法

  • 该方法包含两个阶段:准备阶段与推理阶段。
  • 在准备阶段,LLM 逐步被提示生成类似维基百科的文本片段,提取命名实体作为答案,构建问题,并为每个 QA 对编写简洁解释。
  • 生成的伪数据集包含带有相关文本片段与解释的结构化 QA 对,构成高质量的合成训练集。
  • 在推理阶段,基于聚类的检索方法从伪数据集中选取语义相似且多样化的示例用于每个测试问题。
  • 将选定的 QA 对及其文本片段与解释,按照特定格式(例如,QAE: 问题, 答案, 解释)与测试问题拼接,形成 LLM 的最终输入。
  • 最终答案由 LLM 基于上下文中的示范样本生成,实现无需任何微调的零样本推理。

实验结果

研究问题

  • RQ1LLM 能否自主生成高质量、事实一致的 QA 三元组,包含支持性文本片段与解释,用于零样本 ODQA?
  • RQ2使用自生成的伪数据集进行上下文学习是否优于直接提示法及先前的最先进零样本方法?
  • RQ3基于聚类的检索策略在从生成的伪数据集中选取多样且相关示范样本方面是否有效?
  • RQ4LLM 生成的数据在上下文学习中的性能是否可与人工标注的训练数据相媲美?
  • RQ5不同提示格式(例如,QA 与 QAE)如何影响最终答案的准确率?

主要发现

  • Self-Prompting 在 WebQ、NQ 和 TriviaQA 基准上显著优于先前的最先进零样本 ODQA 方法,包括 GENREAD。
  • 尽管未使用任何训练数据,该方法性能可与在完整训练数据上微调的 Retriever-Reader 模型相媲美。
  • Self-Prompting 的性能与使用相同数量示范样本的人工标注训练数据相比,仅相差 1 EM/F1 分,表明数据生成质量极高。
  • QAE 格式(问题, 答案, 解释)在所有情况下均持续优于 QA 格式,尤其在示范样本较少时表现更优。
  • InstructGPT 和 Codex 生成的数据质量更高,事实性错误更少,优于较小模型如 Alpaca 和 GPT-NeoX,表明模型规模与指令遵循能力对生成质量有显著影响。
  • 基于聚类的检索方法能有效选取多样且语义相关的示范样本,提升模型在测试样本上的泛化能力与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。