Skip to main content
QUICK REVIEW

[论文解读] UnifieR: A Unified Retriever for Large-Scale Retrieval

Tao Shen, Xiubo Geng|arXiv (Cornell University)|May 23, 2022
Topic Modeling被引用 7
一句话总结

UnifieR 提出了一种统一的神经检索器,通过双致性学习在单一模型中联合学习密集向量表示与词典基础表示,从而提升性能。它在段落检索和 BEIR 基准上取得了最先进结果,新型统一检索方案相较强基线将检索质量提升了最高 2.0%。

ABSTRACT

Large-scale retrieval is to recall relevant documents from a huge collection given a query. It relies on representation learning to embed documents and queries into a common semantic encoding space. According to the encoding space, recent retrieval methods based on pre-trained language models (PLM) can be coarsely categorized into either dense-vector or lexicon-based paradigms. These two paradigms unveil the PLMs' representation capability in different granularities, i.e., global sequence-level compression and local word-level contexts, respectively. Inspired by their complementary global-local contextualization and distinct representing views, we propose a new learning framework, UnifieR which unifies dense-vector and lexicon-based retrieval in one model with a dual-representing capability. Experiments on passage retrieval benchmarks verify its effectiveness in both paradigms. A uni-retrieval scheme is further presented with even better retrieval quality. We lastly evaluate the model on BEIR benchmark to verify its transferability.

研究动机与目标

  • 为解决孤立的密集向量与词典基础检索方法的局限性,将二者统一为一个连贯的框架。
  • 利用预训练语言模型的互补全局与局部上下文特征,以提升检索性能。
  • 开发一种自学习策略,增强双表示视图间的一致性与泛化能力。
  • 通过兼容倒排索引与密集向量打分的统一编码器,实现高效的大规模检索。
  • 在包括 12 个数据集的 BEIR 在内的多样化检索基准上,展示模型的可迁移性与鲁棒性。

提出的方法

  • 设计一个具有共享主干的双表示神经编码器,集成局部增强序列表示模块用于密集向量学习,以及全局感知的词典加权模块用于词典基础检索。
  • 实施双致性学习:采用自对抗难负样本挖掘的对比目标,以及双视图间的列表级自正则化。
  • 引入查询端门控机制,仅根据查询语义动态选择密集或词典模式,实现零索引开销的高效推理。
  • 提出一种统一检索方案,先通过词典基础检索获取候选,再在候选约束下使用密集向量对候选进行重打分。
  • 使用在 UnifieR 的难负样本上训练的重打分器进行知识蒸馏,通过持续训练阶段的知识蒸馏提升性能。
  • 通过同时存储密集与稀疏嵌入,确保模型与现有检索基础设施兼容,同时保持低推理延迟。
Figure 2. The encoder in Unifie r .
Figure 2. The encoder in Unifie r .

实验结果

研究问题

  • RQ1统一检索器能否有效结合密集向量与词典基础检索范式,超越孤立方法?
  • RQ2双致性学习在多重视图中如何提升泛化能力与鲁棒性?
  • RQ3所提出的统一检索方案在融合两种范式方面,能在多大程度上提升检索质量?
  • RQ4查询端门控机制如何在不增加推理成本的前提下提升检索性能?
  • RQ5UnifieR 能否在包括 12 个数据集的 BEIR 套件在内的多样化基准上实现泛化?

主要发现

  • 在 BEIR 基准上,UnifieR 相较强基线实现了超过 2.0% 的性能提升,证明其在 12 个多样化数据集上具有强大的可迁移性。
  • 统一检索方案相较强竞争者将检索质量提升了最高 2.0%,并在多个基准上保持一致增益。
  • 查询端门控机制使 MRR@10 提升 0.9%,R@100 提升 0.4%,在不增加额外推理成本的前提下增强性能。
  • 经由重打分器蒸馏知识后,UnifieR 在 MRR 与 R@100 上仍比最强竞争者高出 1% 以上。
  • 案例研究显示,UnifieR 的双表示能捕捉相关性的互补视角:密集模型在语义理解方面表现更优,而词典模型在处理罕见或歧义术语方面更具优势。
  • 尽管在 PLM 兼容性与索引基础设施方面存在局限,UnifieR 仍保持与传统词典基础检索相当的低推理延迟。
Figure 3. The two-stage self-learning strategy for Unifie r .
Figure 3. The two-stage self-learning strategy for Unifie r .

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。