[论文解读] Efficient Passage Retrieval with Hashing for Open-domain Question Answering
本文提出二值化段落检索器(BPR),一种内存高效的神经检索模型,通过端到端的学hash方法,用紧凑的二进制码替代Dense Passage Retriever(DPR)中的密集向量索引。BPR在索引大小减少97%(从65GB降至2GB)且查询推理速度更快的同时,实现了接近最先进(SOTA)的开放域问答准确率,并采用多任务目标实现基于汉明距离的候选生成与基于内积的重排序。
Most state-of-the-art open-domain question answering systems use a neural retrieval model to encode passages into continuous vectors and extract them from a knowledge source. However, such retrieval models often require large memory to run because of the massive size of their passage index. In this paper, we introduce Binary Passage Retriever (BPR), a memory-efficient neural retrieval model that integrates a learning-to-hash technique into the state-of-the-art Dense Passage Retriever (DPR) to represent the passage index using compact binary codes rather than continuous vectors. BPR is trained with a multi-task objective over two tasks: efficient candidate generation based on binary codes and accurate reranking based on continuous vectors. Compared with DPR, BPR substantially reduces the memory cost from 65GB to 2GB without a loss of accuracy on two standard open-domain question answering benchmarks: Natural Questions and TriviaQA. Our code and trained models are available at https://github.com/studio-ousia/bpr.
研究动机与目标
- 为降低DPR等密集段落检索模型的高内存成本,这些模型在索引2100万篇维基百科段落时需要65GB的存储空间。
- 实现在PubMed和Common Crawl等大规模知识源上高效、可扩展的开放域问答。
- 在使用二进制码大幅压缩段落索引的同时,保持高检索与问答准确率。
- 开发一种两阶段检索流水线,结合基于汉明距离的快速候选生成与基于连续向量的精确重排序。
- 证明端到端学hash方法可在不损失准确率的情况下压缩检索索引,而传统后处理量化方法则会降低性能。
提出的方法
- BPR通过在反向传播中使用缩放tanh函数近似符号函数,将连续段落嵌入学习为紧凑的二进制码,从而扩展了DPR。
- 模型采用多任务损失,结合两个目标:(1) 使用二进制码进行基于汉明距离的候选生成;(2) 使用连续嵌入进行基于内积的重排序。
- 二进制码通过将连续嵌入应用符号函数生成,其中不可微的符号函数在训练中通过缩放tanh函数近似。
- 候选生成通过高效汉明距离计算的线性扫描或随汉明半径递增的哈希表查找实现。
- 检索流水线分两个阶段运行:(1) 使用二进制码进行快速候选检索;(2) 使用连续向量进行精确重排序。
- 模型在与DPR相同的训练数据和优化设置下进行端到端训练,并使用相同的阅读器架构进行评估。
实验结果
研究问题
- RQ1学hash能否有效集成到密集段落检索中,在不牺牲检索准确率的前提下减少索引大小?
- RQ2采用二进制码进行快速候选生成、连续向量进行精确重排序的两阶段检索流水线,其性能是否与完整密集检索相当或更优?
- RQ3与后处理量化技术(如LSH和乘积量化)相比,端到端训练哈希函数与编码器在准确率和效率方面表现如何?
- RQ4能否将密集检索的内存成本从65GB降低至5GB以下,同时保持SOTA的开放域问答性能?
- RQ5在段落检索中,使用二进制码与连续向量相比,检索速度与准确率之间的权衡如何?
主要发现
- BPR将段落索引大小从DPR的65GB减少至2GB,内存使用量降低97%。
- 在Natural Questions和TriviaQA基准上,BPR在top-20召回率和精确匹配(EM)问答准确率方面与DPR持平或略有超越。
- BPR的查询推理速度优于DPR,其中哈希表查找比线性扫描更高效,且远快于基于HNSW的检索。
- 后处理量化方法(LSH和乘积量化)性能劣于BPR,后者通过端到端训练保持了准确率。
- 若禁用BPR中的重排序头,性能显著下降,证实了两阶段设计的重要性。
- 在使用改进的ELECTRA-large阅读器时,BPR实现了具有竞争力的EM准确率,仅在参数量超过两倍的FiD大模型之外表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。