[论文解读] Passage Ranking with Weak Supervision
该论文提出了一种基于数据编程的弱监督框架,用于神经文档段落排序,利用BM25分数和语义相似性等多样化信号训练基于BERT的模型,而无需人工标注的标签。该方法在三个基准数据集上实现了最先进性能,在两个数据集上超越了BM25和先前完全监督的模型,尽管未使用任何真实标签。
In this paper, we propose a extit{weak supervision} framework for neural ranking tasks based on the data programming paradigm \citep{Ratner2016}, which enables us to leverage multiple weak supervision signals from different sources. Empirically, we consider two sources of weak supervision signals, unsupervised ranking functions and semantic feature similarities. We train a BERT-based passage-ranking model (which achieves new state-of-the-art performances on two benchmark datasets with full supervision) in our weak supervision framework. Without using ground-truth training labels, BERT-PR models outperform BM25 baseline by a large margin on all three datasets and even beat the previous state-of-the-art results with full supervision on two of the datasets.
研究动机与目标
- 为解决信息检索和阅读理解中大规模标注排序数据集的高昂创建成本问题。
- 探究来自多种来源的弱监督信号(如BM25、语义特征)是否能有效训练神经排序模型,而无需人工标注的相关性标签。
- 开发一种专为段落排序任务设计的数据编程框架。
- 评估弱监督的BERT模型在性能上是否能够超越完全监督的基线模型。
提出的方法
- 将数据编程范式(Ratner et al., 2016)适配到段落排序任务中,通过将排序问题转化为二元相关性标注任务。
- 采用两类弱监督信号:无监督排序分数(BM25、TF-IDF)和预训练模型生成的语义特征相似度。
- 使用标注函数为查询-段落对生成噪声二元标签,然后通过多数投票(MV)或几何平均(GM)聚合,生成更可靠的伪标签。
- 基于聚合后的伪标签,使用成对合页损失在BERT-PR模型上进行训练,其中[CLS] token嵌入通过一个两层前馈网络处理。
- 采用考虑噪声的训练策略,利用来自标注函数输出几何平均的置信度分数,但该方法仅带来有限的性能提升。
实验结果
研究问题
- RQ1来自多样化来源(如BM25、语义特征)的多个弱监督信号是否能有效训练神经段落排序模型,而无需人工标注标签?
- RQ2弱监督的基于BERT的模型是否能够超越BM25基线模型,甚至超越先前完全监督训练的最先进模型?
- RQ3与仅依赖单一信号(如BM25)相比,通过MV或GM聚合多个弱信号的有效性如何?
- RQ4在弱监督中引入标注函数的置信度分数是否能提升模型性能?
主要发现
- 弱监督的BERT-PR模型在三个数据集上的平均Top-1准确率相比BM25基线模型提升了20%。
- 在WikipassageQA和InsuranceQA_v2数据集上,弱监督模型达到了新的最先进性能,超越了先前完全监督的模型。
- 使用几何平均(GM)聚合弱信号相比仅使用BM25训练,P@1指标提升了10%。
- 在WikipassageQA(测试集)上,弱监督训练的模型MAP达到62.58,超过完全监督下的先前最先进水平(56.08)。
- 采用置信度分数的噪声感知训练带来性能提升微乎其微,表明当前的置信度估计可能并非最优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。