[论文解读] Dense X Retrieval: What Retrieval Granularity Should We Use?
本文提出在稠密检索中使用命题——即自包含的、原子的事实性陈述——作为检索单元,证明基于命题的索引显著提升了检索准确率以及下游开放域问答性能,相较于传统的段落或句子级别检索。其主要贡献是创建了包含2.5亿个命题的FactoidWiki,即英文维基百科的命题级索引,实现了更精确、信息密度更高的检索,同时减少了上下文长度。
Dense retrieval has become a prominent method to obtain relevant context or world knowledge in open-domain NLP tasks. When we use a learned dense retriever on a retrieval corpus at inference time, an often-overlooked design choice is the retrieval unit in which the corpus is indexed, e.g. document, passage, or sentence. We discover that the retrieval unit choice significantly impacts the performance of both retrieval and downstream tasks. Distinct from the typical approach of using passages or sentences, we introduce a novel retrieval unit, proposition, for dense retrieval. Propositions are defined as atomic expressions within text, each encapsulating a distinct factoid and presented in a concise, self-contained natural language format. We conduct an empirical comparison of different retrieval granularity. Our experiments reveal that indexing a corpus by fine-grained units such as propositions significantly outperforms passage-level units in retrieval tasks. Moreover, constructing prompts with fine-grained retrieved units for retrieval-augmented language models improves the performance of downstream QA tasks given a specific computation budget.
研究动机与目标
- 研究检索粒度如何影响稠密检索及下游问答性能。
- 解决粗粒度(段落)和过细粒度(句子)检索单元的局限性,前者可能包含无关上下文,后者缺乏自包含性。
- 提出并评估命题作为稠密检索中一种新型、原子化、自包含的检索单元。
- 证明在固定上下文预算下,以命题级别对维基百科进行索引,可同时提升检索准确率和下游问答性能。
- 发布FactoidWiki,一个大规模命题结构化的维基百科语料库,供未来研究使用。
提出的方法
- 使用微调的小型语言模型对英文维基百科进行命题分割,以提取命题。
- 构建FactoidWiki,一个由600万篇维基百科页面衍生出的2.5亿个命题的语料库。
- 在三种粒度下对语料库进行索引:段落(100字块)、句子和命题。
- 使用相同的检索器和固定的上下文预算,在检索任务和下游问答任务上评估六种双编码器稠密检索器(如Contriever、GTR)。
- 通过标准指标衡量性能:在五个开放域问答基准上的检索Recall@10和答案F1。
- 使用固定数量的检索token,以确保不同粒度间的公平比较,在最小化输入长度的同时最大化相关信息密度。

实验结果
研究问题
- RQ1检索粒度(段落、句子、命题)如何影响稠密检索性能?
- RQ2与传统检索单元相比,命题级别索引能否同时提升检索准确率和下游问答性能?
- RQ3通过提高信息密度,命题检索是否能减少对长输入序列的需求?
- RQ4当同一模型应用于不同索引粒度时,稠密检索器的性能如何变化?
- RQ5命题检索在多样化的开放域问答数据集上具有多大程度的泛化能力?
主要发现
- 在五个开放域问答数据集上,命题级检索在检索Recall@10和下游问答F1方面均优于段落和句子级检索。
- 在Natural Questions和TriviaQA基准上,使用相同检索器和上下文预算,命题级检索的F1最高比段落级检索高出8.5%。
- 与段落检索相比,命题的使用使平均输入长度减少了40%-50%,同时保持或提升了答案准确率。
- 成功构建并发布了FactoidWiki——一个包含2.5亿个命题的英文维基百科索引,作为未来研究的资源。
- 命题级检索带来的性能提升在六种不同的稠密检索器上均保持一致,表明该方法对模型架构具有鲁棒性且具有正交性。
- 命题级检索最大限度地减少了无关细节(如复国时期、流离数据)的引入,为下游模型提供了更清晰、更聚焦的输入。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。