[论文解读] Baleen: Robust Multi-Hop Reasoning at Scale via Condensed Retrieval
Baleen 提出了一种可扩展、鲁棒的多跳推理系统,通过使用压缩检索减少搜索空间、采用聚焦的晚期交互检索器(FLIPR)进行复杂查询建模,并利用潜在跳转顺序从弱监督中学习有效的跳转序列,从而在开放域问答和声明验证任务中提升了检索准确率。该系统在两跳(HotPotQA)和多跳(HoVer)基准测试中均达到了最先进性能。
Multi-hop reasoning (i.e., reasoning across two or more documents) is a key ingredient for NLP models that leverage large corpora to exhibit broad knowledge. To retrieve evidence passages, multi-hop models must contend with a fast-growing search space across the hops, represent complex queries that combine multiple information needs, and resolve ambiguity about the best order in which to hop between training passages. We tackle these problems via Baleen, a system that improves the accuracy of multi-hop retrieval while learning robustly from weak training signals in the many-hop setting. To tame the search space, we propose condensed retrieval, a pipeline that summarizes the retrieved passages after each hop into a single compact context. To model complex queries, we introduce a focused late interaction retriever that allows different parts of the same query representation to match disparate relevant passages. Lastly, to infer the hopping dependencies among unordered training passages, we devise latent hop ordering, a weak-supervision strategy in which the trained retriever itself selects the sequence of hops. We evaluate Baleen on retrieval for two-hop question answering and many-hop claim verification, establishing state-of-the-art performance.
研究动机与目标
- 解决将多跳推理扩展到大量跳数时的挑战,同时保持高检索准确率。
- 通过在每轮跳跃后对上下文进行压缩,减少多跳检索中固有的指数级搜索空间。
- 利用灵活的检索机制,更有效地建模需要匹配多个不同来源相关段落的复杂、多维度查询。
- 在不依赖脆弱的、数据集特定启发式方法或昂贵的人工标注的情况下,学习有效的跳转顺序。
- 在大规模、多跳检索任务中,实现从弱监督信号进行鲁棒训练。
提出的方法
- 压缩检索:在每轮跳跃后将检索到的段落总结为紧凑上下文,作为下一轮跳跃的查询组成部分,从而减少搜索空间并提升可扩展性。
- 聚焦的晚期交互段落检索器(FLIPR):一种学习型检索模型,允许同一查询嵌入的不同部分匹配不同的相关段落,实现细粒度、上下文感知的匹配。
- 潜在跳转顺序(LHO):一种弱监督策略,检索器在训练过程中自行选择最优的跳转序列,避免依赖人工或启发式排序。
- 混合架构:结合贪婪检索与压缩上下文,在召回率与效率之间取得平衡,相比束搜索在可扩展性和性能上表现更优。
- 端到端弱监督训练:仅使用段落级标签(而非跳转顺序标注)进行训练,使系统能够泛化至任意数量的跳数。
- 对大规模语料的适应:设计用于高效扩展至大量跳数和大规模文档集合,利用 ColBERT 等晚期交互模型的高效性。
实验结果
研究问题
- RQ1检索系统是否能在有效扩展至多跳的同时,实现高召回率?
- RQ2如何比标准向量表示或词袋方法更有效地建模需要从多个不同段落获取信息的复杂查询?
- RQ3能否在无需显式跳转顺序标注的情况下,仅从弱监督信号中自动学习到有效的跳转顺序?
- RQ4与标准贪婪搜索或束搜索策略相比,压缩检索在多大程度上提升了召回率与鲁棒性?
- RQ5该系统在真实世界、多跳的声明验证任务中的表现如何,而不仅限于两跳基准?
主要发现
- 在两跳的 HotPotQA 基准测试中,Baleen 在前 20 个检索段落中实现了 96.3% 的答案召回率,显著优于之前的工作(89.4%)。
- 在四跳的 HoVer 声明验证数据集上,Baleen 实现了 92.2% 的整体检索准确率,远超次强基线模型(74.8%)。
- 消融实验表明,若移除 FLIPR,HoVer 上的性能降至 87.4%,凸显其在复杂查询建模中的关键作用。
- 若移除潜在跳转顺序(LHO),性能降至 84.8%,表明 LHO 对有效学习跳转序列至关重要。
- 混合架构(Baleen${}_{\textnormal{HYBRID}}$)在 HoVer 上实现了 94.5% 的准确率,表明结合压缩检索与重排序可提升系统鲁棒性。
- Baleen 在四跳任务中表现依然强劲(HotPotQA 上为 85.1%),表明其具备处理复杂、多跳推理任务的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。