QUICK REVIEW
[论文解读] Longformer for MS MARCO Document Re-ranking Task
Ivan Sekulić, Amir Soleimani|arXiv (Cornell University)|Sep 20, 2020
Topic Modeling参考文献 10被引用 5
一句话总结
本文提出使用 Longformer——一种针对长序列优化的类似 BERT 的 Transformer 模型——在 MS MARCO 文档重排序任务中重新排序文档。通过利用局部注意力和全局注意力机制,Longformer 可处理最多 4096 个标记,在开发集上达到 MRR@100 为 0.329,在测试集上达到 0.305,优于该长文档排序基准上的先前方法。
ABSTRACT
Two step document ranking, where the initial retrieval is done by a classical information retrieval method, followed by neural re-ranking model, is the new standard. The best performance is achieved by using transformer-based models as re-rankers, e.g., BERT. We employ Longformer, a BERT-like model for long documents, on the MS MARCO document re-ranking task. The complete code used for training the model can be found on: https://github.com/isekulic/longformer-marco
研究动机与目标
- 使用能够处理长文档的基于 Transformer 的模型,提升在 MS MARCO 数据集上的文档重排序性能。
- 评估 Longformer——一种具有稀疏注意力机制的类似 BERT 的模型——在标准 BERT 受序列长度限制而表现受限的长文档重排序任务中的表现。
- 证明 Longformer 结合局部与全局注意力的机制,可在两阶段检索流水线中有效实现长文档的相关性评分。
- 通过微调 Longformer 模型,在 MS MARCO 文档重排序任务中取得最先进结果。
提出的方法
- 使用双流输入格式在 MS MARCO 文档重排序数据集上微调预训练的 Longformer 模型:查询作为句子 A,文档作为句子 B。
- 使用 [CLS] 和 [SEP] 标记连接查询和文档,将序列截断至最多 4096 个标记,以适配 Longformer 的上下文窗口。
- 将 Longformer 的 [CLS] 标记表示作为输入,输入到一个包含 dropout 和非线性激活函数的两层前馈分类器头,用于相关性预测。
- 使用批量大小为 128、Adam 优化器、初始初始值为 3×10⁻⁵ 的学习率,并在 2500 步内进行线性学习率预热,训练 150,000 次迭代,损失函数为交叉熵损失。
- 在训练过程中将正样本与负样本文档的比例从 1:100 调整为 1:10,以提升模型的泛化能力和收敛性。
- 使用 PyTorch Lightning 和 Hugging Face Transformers 实现训练。
实验结果
研究问题
- RQ1Longformer 是否能在标准 BERT 模型受序列长度限制的 MS MARCO 文档重排序任务中,有效对长文档进行重排序?
- RQ2Longformer 的稀疏注意力机制(结合局部与全局注意力)相比标准自注意力,在长文档中的相关性估计方面有何改进?
- RQ3与先前的神经重排序模型(如 Conformer-Kernel 和 DRMM)相比,Longformer 在 MS MARCO 文档重排序基准上实现了多大的性能提升?
- RQ4在正样本与负样本文档比例为 1:10 的平衡数据集上微调 Longformer,是否相比原始的 1:100 比例能提升排序效果?
主要发现
- Longformer 在官方 MS MARCO 开发集上实现了 MRR@100 为 0.329,优于基线模型 Indri Query Likelihood(0.192)及其他神经模型。
- 在测试集上,Longformer 实现了 MRR@100 为 0.305,优于此前最佳提交结果(Conformer-Kernel 搭配 QTI,在开发集上为 0.307,但测试集表现更低)。
- 该模型能够处理长达 4096 个标记的序列,从而有效建模长文档,这对文档重排序任务至关重要。
- 使用 1:10 的正负样本比例进行微调,相比原始的 1:100 比例,提升了训练稳定性和性能表现。
- Longformer 在 MS MARCO 文档重排序任务中展现出强大的泛化能力,在提交时成为当时基于 Transformer 的重排序模型中的最先进方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。