Skip to main content
QUICK REVIEW

[论文解读] RRF102: Meeting the TREC-COVID Challenge with a 100+ Runs Ensemble

Michael Bendersky, Honglei Zhuang|arXiv (Cornell University)|Oct 1, 2020
RNA modifications and cancer参考文献 26被引用 15
一句话总结

本论文提出 RRF102,一种基于 102 个多样化检索与排序系统(包括词法、语义、基于 BERT 的方法以及相关性反馈运行)的加权分层排名融合集成方法,旨在适应 COVID-19 生物医学语料库的快速演变。该方法在 TREC-COVID 第 4 和第 5 轮中达到最先进性能,相较于次佳提交方案实现 13.4% 的 MAP 提升,证明了在动态生物医学检索场景中集成融合方法的有效性。

ABSTRACT

In this paper, we report the results of our participation in the TREC-COVID challenge. To meet the challenge of building a search engine for rapidly evolving biomedical collection, we propose a simple yet effective weighted hierarchical rank fusion approach, that ensembles together 102 runs from (a) lexical and semantic retrieval systems, (b) pre-trained and fine-tuned BERT rankers, and (c) relevance feedback runs. Our ablation studies demonstrate the contributions of each of these systems to the overall ensemble. The submitted ensemble runs achieved state-of-the-art performance in rounds 4 and 5 of the TREC-COVID challenge.

研究动机与目标

  • 为应对 COVID-19 大流行期间生物医学文献集合快速演变的挑战,构建一个稳健且可适应的搜索系统。
  • 通过结合多样化检索与排序方法,提升在动态科学文献检索中的检索性能。
  • 评估集成方法在生物医学信息检索中的有效性,特别是在随时间演变的语料库和相关性判断条件下。
  • 证明加权分层排名融合方法可始终优于单个系统及更简单的集成方法。

提出的方法

  • 该方法结合了来自三类系统的 102 个运行结果:词法与语义检索系统(如 BM25、BM25+重排序)、预训练与微调的 BERT 排名模型,以及相关性反馈运行。
  • 提出一种新颖的加权分层排名融合技术以整合运行结果,其中权重通过优化学习,以在保留的验证数据上最大化性能。
  • 融合过程在多个层级应用互惠排名融合(RRF),通过分层加权优先考虑高质量运行结果,同时降低较弱运行结果带来的噪声影响。
  • 在 BioASQ 和 MS-MARCO 数据集上对 BERT 模型进行微调,以提升生物医学段落排序性能,并使用验证数据调整超参数。
  • 利用相关性反馈生成额外运行结果,通过基于前期轮次相关性判断的文档重排序实现。
  • 最终集成模型 RRF102 在第 1 至第 3 轮数据上进行训练与验证,并在第 4 和第 5 轮进行评估,未使用未来轮次的数据,避免数据泄露。

实验结果

研究问题

  • RQ1在 TREC-COVID 挑战期间,大规模多样化检索与排序系统集成在应对 CORD-19 语料库动态演变方面有多有效?
  • RQ2在随时间演变的数据条件下,预训练与微调的 BERT 模型在生物医学信息检索中对性能提升的贡献程度如何?
  • RQ3加权分层排名融合方法在 MAP、NDCG 和召回率等指标上是否优于标准 RRF 和无权重集成方法?
  • RQ4在无先前相关性判断可用的情况下,相关性反馈运行与自动运行的性能表现如何比较?

主要发现

  • RRF102 在 TREC-COVID 挑战第 4 和第 5 轮中实现最先进性能,在多数评估指标上分别超越 72 个和 126 个运行结果。
  • 加权分层 RRF 融合方法(UPrrf102-wt-r5)在第 5 轮中相较次佳提交方案(elhuyar_rrf_nof09p)实现 13.4% 的 MAP 提升,且差异具有统计显著性。
  • 自动运行 UPrrf89-r5(在 BioASQ 数据上额外微调 9 个 BERT 模型)相较次佳自动运行(uogTrDPH_QE_SB_CB)实现 9.2% 的 MAP 提升。
  • UPrrf89-r5 与 UPrrf80-r5 在性能上无统计显著差异,表明在 BioASQ 上的额外微调未导致性能下降。
  • 该集成在多个指标上保持强劲表现,包括 NDCG@20 和 P@20,与顶尖团队的差异在这些指标上无统计显著性。
  • 消融研究证实,词法、语义、BERT 和反馈运行各组件均对最终集成性能有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。