[论文解读] CMT in TREC-COVID Round 2: Mitigating the Generalization Gaps from Web to Special Domain Search
本论文提出了一种用于TREC-COVID Round 2任务的神经排序系统,通过领域自适应预训练、基于ContrastQG和ReInfoSelect的 few-shot 学习以及密集检索,有效缓解了生物医学检索中的领域偏移和标签稀缺问题。该系统在极少人工标注数据的情况下,显著减少了词汇不匹配问题并提升了相关性标注质量,实现了非人工方法中的最佳性能。
Neural rankers based on deep pretrained language models (LMs) have been shown to improve many information retrieval benchmarks. However, these methods are affected by their the correlation between pretraining domain and target domain and rely on massive fine-tuning relevance labels. Directly applying pretraining methods to specific domains may result in suboptimal search quality because specific domains may have domain adaption problems, such as the COVID domain. This paper presents a search system to alleviate the special domain adaption problem. The system utilizes the domain-adaptive pretraining and few-shot learning technologies to help neural rankers mitigate the domain discrepancy and label scarcity problems. Besides, we also integrate dense retrieval to alleviate traditional sparse retrieval's vocabulary mismatch obstacle. Our system performs the best among the non-manual runs in Round 2 of the TREC-COVID task, which aims to retrieve useful information from scientific literature related to COVID-19. Our code is publicly available at https://github.com/thunlp/OpenMatch.
研究动机与目标
- 解决通用网络预训练语料与专门的COVID-19生物医学领域之间的领域差异问题。
- 缓解科学文献检索中人工标注相关性标签稀缺的问题。
- 克服BM25等稀疏检索方法固有的词汇不匹配问题。
- 通过few-shot和自监督学习技术,提升低资源生物医学领域中的神经排序性能。
- 在真实生物医学搜索场景中,评估密集检索与混合检索策略的有效性。
提出的方法
- 应用领域自适应预训练(DAPT)对SciBERT进行微调,使其在生物医学语料上更好地理解如'COVID-19'等领域特异性术语。
- 使用对比查询生成(ContrastQG)生成多样化且高质量的伪相关性标签,用于神经排序器的训练。
- 采用ReInfoSelect对伪标签进行筛选与优化,聚焦于高置信度、高信息量的相关性信号。
- 通过双编码器模型实现密集检索,将查询和文档编码为密集向量,从而减少词汇不匹配问题。
- 在两阶段检索流水线中融合基于BM25的稀疏检索与密集检索结果,以提升整体有效性。
- 采用混合重排序策略:先由BM25检索候选文档集,再通过领域自适应模型进行神经重排序。
实验结果
研究问题
- RQ1领域自适应预训练在多大程度上能缩小基于网络的语言模型与生物医学领域之间的泛化差距?
- RQ2如ContrastQG和ReInfoSelect等few-shot学习技术,在极少量标注数据下,能在多大程度上提升神经排序性能?
- RQ3密集检索在缓解生物医学信息检索中的词汇不匹配问题方面有多有效?
- RQ4重排序深度与融合策略对低资源环境下检索性能的影响如何?
- RQ5残差集合评估在多大程度上会偏向已知查询,其对系统评估结果有何影响?
主要发现
- 该系统在TREC-COVID Round 2中非人工运行中表现最佳,优于所有基线模型。
- 密集检索带来了最大的性能提升,与仅使用稀疏检索相比,P@5提升了11.8%。
- 重排序深度在50–100之间时表现最优,更深的深度因噪声增加导致准确率下降。
- 将密集检索与神经重排序结合,显著提升了新查询上的鲁棒性,避免了基线模型中常见的性能骤降。
- ContrastQG与ReInfoSelect有效生成并过滤了伪标签,即使在标注数据有限的情况下也增强了模型泛化能力。
- 发现残差集合评估倾向于偏向已知(旧)查询,可能导致评估结果偏向于利用先前标注的系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。