Skip to main content
QUICK REVIEW

[论文解读] Query Refinement Prompts for Closed-Book Long-Form Question Answering

Reinald Kim Amplayo, Kellie Webster|arXiv (Cornell University)|Oct 31, 2022
Topic Modeling被引用 5
一句话总结

本文提出查询优化提示(query refinement prompts),以提升大型语言模型(LLMs)在少样本闭卷长文本问答中的表现。通过提示模型显式识别模糊或多面向问题的多个方面(如替代解释或多源信息),LLMs 能够生成更全面、更连贯的答案。该方法在 ASQA 和 AQuAMuSe 数据集上的表现可与开卷检索-生成模型相媲美,并优于完全微调的闭卷模型。

ABSTRACT

Large language models (LLMs) have been shown to perform well in answering questions and in producing long-form texts, both in few-shot closed-book settings. While the former can be validated using well-known evaluation metrics, the latter is difficult to evaluate. We resolve the difficulties to evaluate long-form output by doing both tasks at once -- to do question answering that requires long-form answers. Such questions tend to be multifaceted, i.e., they may have ambiguities and/or require information from multiple sources. To this end, we define query refinement prompts that encourage LLMs to explicitly express the multifacetedness in questions and generate long-form answers covering multiple facets of the question. Our experiments on two long-form question answering datasets, ASQA and AQuAMuSe, show that using our prompts allows us to outperform fully finetuned models in the closed book setting, as well as achieve results comparable to retrieve-then-generate open-book models.

研究动机与目标

  • 为解决闭卷问答中长文本生成的评估挑战,其中输出具有主观性且难以验证。
  • 通过显式建模涉及模糊性或多源信息整合的多面向问题,提升长文本回答的质量与完整性。
  • 开发一种提示策略,促使 LLM 在生成答案前将复杂问题分解为多个可解释的方面。
  • 证明使用查询优化的少样本提示可超越完全微调的闭卷模型,并在性能上与开卷检索-生成系统相当。

提出的方法

  • 设计查询优化提示,促使 LLM 识别并阐明问题的多个方面,如替代解释或依赖来源的信息。
  • 将多面向性分类为类型(如模糊性、多源信息),并构建涵盖多样化问题类型的标注提示集。
  • 在生成答案前引入中间的查询优化步骤,类似于思维链推理,显式揭示多个解释或信息来源。
  • 在 PaLM 540B 和 T5 模型上使用少样本提示与提示微调技术,结合这些优化提示生成长文本答案。
  • 使用 ROUGE 评估流畅性,使用 QAEval_rheme 评估正确性,其中问题由模型输出生成并评估其可回答性。
  • 在提示微调过程中,动态从 ASQA 和 AQuAMuSe 数据集中选择样本,以提升对各类问题的泛化能力。

实验结果

研究问题

  • RQ1查询优化提示能否提升闭卷 LLM 问答中长文本答案的质量与完整性?
  • RQ2与标准少样本提示或提示微调相比,提示模型进行多面向问题分解是否能提升性能?
  • RQ3使用优化提示的少样本提示能否超越完全微调的闭卷模型在长文本问答中的表现?
  • RQ4在多方面提示优化下,闭卷提示在多大程度上能实现与开卷检索-生成模型相当的性能?
  • RQ5在动态提示选择过程中引入来自多个数据集(ASQA 和 AQuAMuSe)的样本,是否能提升模型的泛化能力与性能?

主要发现

  • 在 AQuAMuSe 上,使用 AF(Answer-Faceted)优化提示的少样本提示使 ROUGE-L 得分为 32.94,QAEval_rheme 得分为 12.50,显著优于随机基线(ROUGE-L 28.12,QAEval_rheme 10.26)。
  • 在动态提示选择中引入 ASQA 样本后,AQuAMuSe 上的 ROUGE-L 提升至 33.73,QAEval_rheme 提升至 13.24,表明在跨数据集泛化方面表现更优。
  • 使用优化提示的少样本提示优于完全微调的 T5-XL 闭卷模型(ROUGE-L 为 26.17,QAEval_rheme 为 5.62)。
  • 结合优化提示与 ASQA 样本的提示微调,ROUGE-L 达到 33.30,QAEval_rheme 达到 11.77,优于基线提示微调,但仍不及开卷模型。
  • 在 ASQA 上,该方法优于完全微调的闭卷模型,并在 ROUGE 和 QAEval 上与开卷系统持平,尽管开卷模型在绝对性能上仍占优。
  • 开卷 LongT5-XL 模型在 ASQA 上取得 61.43 的 ROUGE-L 和 39.22 的 QAEval_rheme,显著优于所有闭卷系统,凸显了检索机制的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。