Skip to main content
QUICK REVIEW

[论文解读] Multiview Identifiers Enhanced Generative Retrieval

Yongqi Li, Nan Yang|arXiv (Cornell University)|May 26, 2023
Topic Modeling被引用 4
一句话总结

本文提出 MINDER,一种多视角标识符增强的生成式检索框架,通过从文本内容生成合成标识符——特别是伪查询——来提升检索效果。通过联合利用标题、子串和基于内容的伪查询作为互补视角,MINDER 在三个公开数据集上实现了最先进性能,展现出在多样化查询类型下的优越鲁棒性和覆盖范围。

ABSTRACT

Instead of simply matching a query to pre-existing passages, generative retrieval generates identifier strings of passages as the retrieval target. At a cost, the identifier must be distinctive enough to represent a passage. Current approaches use either a numeric ID or a text piece (such as a title or substrings) as the identifier. However, these identifiers cannot cover a passage's content well. As such, we are motivated to propose a new type of identifier, synthetic identifiers, that are generated based on the content of a passage and could integrate contextualized information that text pieces lack. Furthermore, we simultaneously consider multiview identifiers, including synthetic identifiers, titles, and substrings. These views of identifiers complement each other and facilitate the holistic ranking of passages from multiple perspectives. We conduct a series of experiments on three public datasets, and the results indicate that our proposed approach performs the best in generative retrieval, demonstrating its effectiveness and robustness.

研究动机与目标

  • 为解决现有生成式检索方法依赖静态标识符(如标题或编号 ID)所导致的上下文信息贫乏和整体覆盖不足的问题。
  • 通过引入从文本内容派生的合成标识符,特别是捕捉多句语义的伪查询,来提升检索性能。
  • 通过同时考虑适用于不同查询类型的多种标识符视角(标题、子串、伪查询),实现对文本段落的全面排序。
  • 证明多视角标识符融合可显著提升模型在多样化检索场景下的鲁棒性和有效性。

提出的方法

  • MINDER 使用以查询和标识符类型(如 'title'、'substring'、'pseudo-query')为条件的自回归语言模型生成标识符。
  • 通过生成类似问题的改写形式对文本段落进行重述,从而创建合成标识符,使其具备丰富的上下文信息和多句语义。
  • 模型采用束搜索(beam search)为每个视角生成多个候选标识符,并通过启发式函数聚合结果,以对候选文本段落进行排序。
  • 根据文本段落在所有三个标识符视角上的覆盖程度对段落进行排序,从而实现来自不同视角的互补性评分。
  • 采用 FM-index 数据结构高效存储和检索标识符,确保空间复杂度与标识符大小呈线性关系。

实验结果

研究问题

  • RQ1从文本内容生成的合成标识符是否能超越静态标识符(如标题或子串)在生成式检索中的表现?
  • RQ2将标题、子串和伪查询等多种视角的标识符相结合,相比单视角方法,能否显著提升检索性能?
  • RQ3多视角标识符在应对多样化查询类型(包括通用、详细和复杂查询)时,能在多大程度上提升检索的鲁棒性?
  • RQ4将伪查询作为合成标识符引入后,对检索覆盖范围和准确性产生何种影响?

主要发现

  • MINDER 在三个公开数据集(MSMARCO、NQ 和 TriviaQA)上均达到最先进性能,优于现有生成式检索方法。
  • 将伪查询作为合成标识符引入后,显著提升了检索覆盖范围,尤其在需要多句理解的复杂查询上表现突出。
  • 在 NQ 和 TriviaQA 上,束搜索大小为 15–20 时性能最优;而在 MSMARCO 上,由于文本段落冗余度高,较小的束搜索大小(如 5)更为合适。
  • 在 MSMARCO 上,子串视角贡献较弱,因其区分度较低;而标题和伪查询视角在各数据集上均表现出更强性能。
  • 由于多视角生成过程,MINDER 的推理时间比 SEAL 增加 1.2 倍,但这一代价被检索准确性的提升所抵消。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。