[论文解读] Covidex: Neural Ranking Models and Keyword Search Infrastructure for the COVID-19 Open Research Dataset
Covidex 为 CORD-19 开放研究数据集构建了神经排序与关键词搜索基础设施,结合 Anserini 的检索与微调后的 T5 模型进行神经重排序。在 TREC-COVID 第三轮中,该系统在基于反馈的运行中得分最高,在完全自动化的运行中排名第二,通过开源工具和基线实现了最先进的性能,并产生了广泛的社区影响。
We present Covidex, a search engine that exploits the latest neural ranking models to provide information access to the COVID-19 Open Research Dataset curated by the Allen Institute for AI. Our system has been online and serving users since late March 2020. The Covidex is the user application component of our three-pronged strategy to develop technologies for helping domain experts tackle the ongoing global pandemic. In addition, we provide robust and easy-to-use keyword search infrastructure that exploits mature fusion-based methods as well as standalone neural ranking models that can be incorporated into other applications. These techniques have been evaluated in the ongoing TREC-COVID challenge: Our infrastructure and baselines have been adopted by many participants, including some of the highest-scoring runs in rounds 1, 2, and 3. In round 3, we report the highest-scoring run that takes advantage of previous training data and the second-highest fully automatic run.
研究动机与目标
- 开发一个稳健且面向社区的 CORD-19 数据集搜索基础设施,以支持疫情期间的快速信息获取。
- 通过在医学文本上微调 T5 模型并将其整合到多阶段检索管道中,推进神经排序技术的发展。
- 部署一个端到端的搜索应用(covidex.ai),使领域专家能够高效检索相关科学文献。
- 提供开源基线和基础设施,以支持 TREC-COVID 挑战中的高性能提交。
- 展示基于融合的关键词搜索与神经重排序在生物医学信息检索中的有效性。
提出的方法
- 初始检索通过 Anserini IR 工具包完成,该工具包使用 XML 适配器对 CORD-19 文章进行索引,并支持在摘要、全文和段落上进行词袋查询。
- 通过多索引(摘要、全文、段落)排名的互惠排名融合(RRF)增强关键词搜索结果,以提高检索效果。
- 使用在 MS MARCO 和 MS MARCO 医学子集上微调的 monoT5-3B 和 duoT5 模型执行神经重排序,对初始候选集进行重排序。
- 应用基于分类的反馈机制,通过利用相关性判断来优化结果,将神经得分与分类器输出通过 0.5 的混合权重相结合。
- 通过使用 ScispaCy 从问题字段中提取命名实体,对查询进行增强,以提升术语覆盖率和相关性。
- 该系统作为端到端搜索引擎部署在 covidex.ai,并作为 TREC-COVID 挑战提交的基础。
实验结果
研究问题
- RQ1结合关键词搜索与神经重排序的多阶段检索管道在 CORD-19 数据集上的生物医学问答任务中效果如何?
- RQ2与基线关键词查询相比,使用问题中命名实体进行查询扩展在多大程度上提升了检索性能?
- RQ3开源的神经排序模型与检索基础设施是否能显著提升 TREC-COVID 挑战中的表现?
- RQ4基于相关性判断的反馈重排序与完全自动化的神经重排序在效果上相比如何?
- RQ5在多个文档字段上使用基于融合的关键词搜索(如 RRF)对检索质量有何影响?
主要发现
- 在 TREC-COVID 第三轮中,作者通过结合分类方法的反馈机制,实现了所有提交中得分最高的运行。
- 使用 monoT5-3B 进行重排序的运行在所有完全自动化的运行中排名第二,证明了无需人工干预即可实现强大性能。
- 基于融合的关键词搜索运行(r3.fusion1 和 r3.fusion2)作为强有力的基线,分别有 136 个和 79 个运行在第二轮和第三轮中采用。
- duoT5 模型在重排序中相比 monoT5 略有提升,尽管增益有限,表明更深层神经架构带来的收益是渐进式的。
- 使用 ScispaCy 提取的命名实体进行查询扩展,显著提升了基线关键词查询的检索有效性。
- 开源的 Anserini 融合基线被多个表现优异的团队采纳,包括第二轮中得分最高的手动运行和排名第一的自动运行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。