Skip to main content
QUICK REVIEW

[论文解读] Query2doc: Query Expansion with Large Language Models

Liang Wang, Nan Yang|arXiv (Cornell University)|Mar 14, 2023
Topic Modeling被引用 6
一句话总结

本文提出 Query2doc,一种利用大语言模型(LLMs)进行少样本提示(few-shot prompting)生成伪文档的查询扩展方法,这些伪文档随后与原始查询拼接,以提升稀疏(如 BM25)和稠密检索系统的表现。该方法在无需微调模型的情况下,使 BM25 在 MS-MARCO 和 TREC DL 数据集上的性能提升 3% 至 15%,同时显著改善了当前最先进的稠密检索器(如 DPR、SimLM 和 E5)。

ABSTRACT

This paper introduces a simple yet effective query expansion approach, denoted as query2doc, to improve both sparse and dense retrieval systems. The proposed method first generates pseudo-documents by few-shot prompting large language models (LLMs), and then expands the query with generated pseudo-documents. LLMs are trained on web-scale text corpora and are adept at knowledge memorization. The pseudo-documents from LLMs often contain highly relevant information that can aid in query disambiguation and guide the retrievers. Experimental results demonstrate that query2doc boosts the performance of BM25 by 3% to 15% on ad-hoc IR datasets, such as MS-MARCO and TREC DL, without any model fine-tuning. Furthermore, our method also benefits state-of-the-art dense retrievers in terms of both in-domain and out-of-domain results.

研究动机与目标

  • 解决短文本、稀疏查询中存在的词汇鸿沟和歧义问题,以提升检索性能。
  • 探究大语言模型是否可在无需微调的情况下作为高效的查询扩展引擎。
  • 利用 LLM 生成的伪文档作为上下文增强,提升稀疏和稠密检索系统。
  • 在域内和域外设置下(包括零样本泛化)评估该方法的有效性。
  • 分析 LLM 模型规模和提示设计对检索性能及事实一致性的影响力。

提出的方法

  • 该方法使用 k=4 个上下文示例进行少样本提示,从给定查询 q 生成伪文档 d′。
  • 对于稀疏检索,原始查询 q 在拼接前重复 n=5 次,以平衡词项权重,形成扩展查询 q+ = concat({q}×5, d′)。
  • 对于稠密检索,扩展查询 q+ 通过拼接 q、[SEP] 和 d′ 构成,即 q+ = concat(q, [SEP], d′)。
  • 该方法与模型训练正交,无需架构或损失函数修改,可无缝集成至现有检索流水线。
  • 伪文档使用改进后的 GPT-3 text-davinci-003 模型生成,方法在 MS-MARCO、TREC DL 2019/2020 和零样本域外数据集上进行评估。
  • 在两种稠密检索设置下进行评估:使用 BM25 硬负样本从 BERT-base 训练,以及从交叉编码器重排序器进行知识蒸馏。

实验结果

研究问题

  • RQ1大语言模型的少样本提示能否生成高质量的伪文档以提升检索性能?
  • RQ2通过 LLM 生成的内容进行查询扩展是否能显著提升稀疏和稠密检索系统,且无需模型微调?
  • RQ3Query2doc 在域内和域外检索设置下的性能表现如何?
  • RQ4LLM 模型规模对 Query2doc 的有效性有何影响,特别是在事实准确性与检索增益方面?
  • RQ5与现有查询和文档扩展技术相比,该方法在效率和有效性方面表现如何?

主要发现

  • Query2doc 在 MS-MARCO 和 TREC DL 数据集上使现成的 BM25 检索器性能提升 3% 至 15%,且在 TREC DL 赛道的困难查询上增益更大。
  • 该方法改善了当前最先进的稠密检索器(包括 DPR、SimLM 和 E5),但当从强交叉编码器重排序器蒸馏时,增益有所减弱。
  • 在大多数数据集上,Query2doc 在零样本域外设置下优于强基线模型,展现出强大的泛化能力。
  • 该方法在使用最强大的 LLM 时效果最佳;较小的模型仅带来相对于基线的微小提升。
  • 尽管性能优异,LLM 生成的伪文档偶尔会出现事实性错误(如错误的日期或细节),可能损害系统的可信度。
  • 延迟显著增加:LLM 推理每查询增加超过 2000ms,且由于查询长度扩展,索引搜索速度也变慢,表明准确率与效率之间存在权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。