Skip to main content
QUICK REVIEW

[论文解读] Zero-Shot Retrieval with Search Agents and Hybrid Environments

Michelle Chen Huebscher, Christian Buck|arXiv (Cornell University)|Sep 30, 2022
Topic Modeling被引用 5
一句话总结

该论文提出 HaRE,一种零样本检索系统,通过搜索代理在混合检索环境(HRE)中迭代优化查询,该环境结合了稠密检索(GTR)与稀疏检索(BM25),并采用交叉编码器重排序。该代理在 BEIR 基准上实现了最先进性能,仅需重排序 10 分之一的文档,速度提升一倍,同时保持可解释性与强大的域内性能。

ABSTRACT

Learning to search is the task of building artificial agents that learn to autonomously use a search box to find information. So far, it has been shown that current language models can learn symbolic query reformulation policies, in combination with traditional term-based retrieval, but fall short of outperforming neural retrievers. We extend the previous learning to search setup to a hybrid environment, which accepts discrete query refinement operations, after a first-pass retrieval step via a dual encoder. Experiments on the BEIR task show that search agents, trained via behavioral cloning, outperform the underlying search system based on a combined dual encoder retriever and cross encoder reranker. Furthermore, we find that simple heuristic Hybrid Retrieval Environments (HRE) can improve baseline performance by several nDCG points. The search agent based on HRE (HARE) matches state-of-the-art performance, balanced in both zero-shot and in-domain evaluations, via interpretable actions, and at twice the speed.

研究动机与目标

  • 通过在混合环境中结合稠密检索与稀疏检索,提升零样本检索性能。
  • 通过使用离散查询操作的可学习搜索代理,实现可解释的、目标导向的搜索行为。
  • 通过最小化需要昂贵交叉编码器重排序的文档数量,降低计算成本。
  • 在实现最先进零样本结果的同时,保持强大的域内性能。
  • 探索在混合检索系统中学习高效、可解释搜索策略的可行性。

提出的方法

  • 混合检索环境(HRE)结合双编码器(GTR)与 BM25 的结果,再使用交叉编码器对 top-k 文档进行重排序。
  • 通过行为克隆在基于 Rocchio 的会话流程生成的查询优化轨迹上训练搜索代理(HaRE)。
  • 该代理应用离散的、符号化的查询操作——主要使用‘+’操作符添加词项——以迭代方式优化查询并提升检索结果。
  • 该代理以顺序、多步方式运行,模仿人类的‘兔子洞式’行为,探索相关文档簇。
  • 训练数据通过伪相关反馈生成,代理从初始查询的顶级结果中学习。
  • 系统使用大型 T5 模型(T5-R 用于重排序,T5-Q 用于查询生成),更大的模型展现出更强的鲁棒性。

实验结果

研究问题

  • RQ1在混合检索环境中,可学习的搜索代理是否能在零样本检索中超越神经检索器?
  • RQ2离散的、可解释的查询优化操作在多大程度上能提升检索性能并降低计算成本?
  • RQ3混合检索环境的性能与更复杂或更深的重排序基线相比如何?
  • RQ4该搜索代理在未微调的情况下,能否在域外查询上有效泛化?
  • RQ5模型规模在代理及其组件的鲁棒性与性能中扮演何种角色?

主要发现

  • HaRE 在 BEIR 基准上的平均 nDCG@10 达到 0.511,性能与最先进水平相当,但仅需重排序 100 篇文档而非 1000 篇。
  • 与单独使用 GTR 或 BM25 相比,混合检索环境(HRE)使基线性能提升了数个百分点的 nDCG。
  • 与最先进系统(Rosa et al., 2022)相比,该代理将延迟降低了 50%,后者需重排序 1000 篇文档。
  • 该代理在大多数情况下仅使用‘+’操作符,表明训练数据中‘+’在 83% 的动作中出现,可能存在数据分布不平衡。
  • 尽管 HRE 设计简单,其性能仍优于更复杂的混合系统,并保持了强大的域内性能。
  • 当文档深度超过 k=50 时性能下降,表明重排序器在大规模场景下的鲁棒性存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。