Skip to main content
QUICK REVIEW

[论文解读] Leveraging Semantic and Lexical Matching to Improve the Recall of Document Retrieval Systems: A Hybrid Approach

Saar Kuzi, Mingyang Zhang|arXiv (Cornell University)|Oct 2, 2020
Information Retrieval and Search Behavior参考文献 45被引用 15
一句话总结

本文提出一种混合文档检索方法,通过并行结合词法(BM25)与语义(深度神经网络)模型以提升召回率。通过利用预训练语言模型进行弱监督语义匹配,并结合近似KNN进行结果融合,该方法在召回率上显著优于单一模型,且在不同文档类型和长度下表现出词汇重叠低、互补覆盖广的特点。

ABSTRACT

Search engines often follow a two-phase paradigm where in the first stage (the retrieval stage) an initial set of documents is retrieved and in the second stage (the re-ranking stage) the documents are re-ranked to obtain the final result list. While deep neural networks were shown to improve the performance of the re-ranking stage in previous works, there is little literature about using deep neural networks to improve the retrieval stage. In this paper, we study the merits of combining deep neural network models and lexical models for the retrieval stage. A hybrid approach, which leverages both semantic (deep neural network-based) and lexical (keyword matching-based) retrieval models, is proposed. We perform an empirical study, using a publicly available TREC collection, which demonstrates the effectiveness of our approach and sheds light on the different characteristics of the semantic approach, the lexical approach, and their combination.

研究动机与目标

  • 为解决传统词法检索模型召回率有限的问题,即因缺乏查询词的精确匹配而遗漏相关文档。
  • 探索在效率受限的前提下,将深度神经网络应用于检索阶段(而不仅限于重排序)的可行性与有效性。
  • 开发一种实用、可部署的混合系统,在不依赖大规模查询日志且不牺牲系统效率的前提下提升召回率。
  • 证明语义模型与词法模型具有互补性,能够检索到具有不同特征的相关文档集合。

提出的方法

  • 基于预训练语言模型(如BERT)的弱监督学习任务训练语义检索模型,避免依赖查询日志。
  • 在完整文档集合上并行执行词法模型(BM25)与语义模型的检索。
  • 使用近似K近邻(KNN)搜索高效检索语义模型的top-k匹配结果,确保低延迟。
  • 将两个模型的结果列表合并为一个初始检索列表,用于后续重排序。
  • 使用语义模型将文档表示为密集向量嵌入,以支持语义相似度计算。
  • 应用t-SNE可视化与Jaccard指数分析,比较词法与语义结果之间的词汇重叠及文档聚类情况。

实验结果

研究问题

  • RQ1当与词法模型并行使用时,基于深度神经网络的语义模型是否能提升检索阶段的召回率?
  • RQ2词法模型与语义模型检索到的文档集合在词汇、长度和主题覆盖方面有何差异?
  • RQ3词法模型与语义模型检索到的相关文档之间的重叠程度如何?是否表明二者具有互补性?
  • RQ4在无查询日志的情况下训练的弱监督语义模型是否仍能实现有效的检索性能?
  • RQ5该混合方法对真实搜索系统中的系统效率与可部署性有何影响?

主要发现

  • 语义模型检索到了词法模型遗漏的相关文档,特别是那些使用同义词或改写术语而非精确查询词的文档。
  • 语义模型与词法模型的top-100代表性词汇之间的Jaccard指数平均仅为0.162,表明词汇重叠极低。
  • 语义模型检索的文档平均长度显著长于词法模型检索的文档,部分差异超过两倍。
  • t-SNE可视化显示,语义结果在文档嵌入空间中常形成独立的聚类,位于词法结果稀疏的区域。
  • 混合方法显著提升了初始检索列表的多样性与主题覆盖范围,证明了两种模型之间存在强烈互补性。
  • 该方法高效且可部署,采用近似KNN与开源工具,无需大规模训练数据或查询日志。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。