Skip to main content
QUICK REVIEW

[论文解读] Longformer for MS MARCO Document Re-ranking Task

Ivan Sekulić, Amir Soleimani|arXiv (Cornell University)|Sep 20, 2020
Topic Modeling参考文献 10被引用 5
一句话总结

本文提出使用 Longformer——一种针对长序列优化的类似 BERT 的 Transformer 模型——在 MS MARCO 文档重排序任务中重新排序文档。通过利用局部注意力和全局注意力机制,Longformer 可处理最多 4096 个标记,在开发集上达到 MRR@100 为 0.329,在测试集上达到 0.305,优于该长文档排序基准上的先前方法。

ABSTRACT

Two step document ranking, where the initial retrieval is done by a classical information retrieval method, followed by neural re-ranking model, is the new standard. The best performance is achieved by using transformer-based models as re-rankers, e.g., BERT. We employ Longformer, a BERT-like model for long documents, on the MS MARCO document re-ranking task. The complete code used for training the model can be found on: https://github.com/isekulic/longformer-marco

研究动机与目标

  • 使用能够处理长文档的基于 Transformer 的模型,提升在 MS MARCO 数据集上的文档重排序性能。
  • 评估 Longformer——一种具有稀疏注意力机制的类似 BERT 的模型——在标准 BERT 受序列长度限制而表现受限的长文档重排序任务中的表现。
  • 证明 Longformer 结合局部与全局注意力的机制,可在两阶段检索流水线中有效实现长文档的相关性评分。
  • 通过微调 Longformer 模型,在 MS MARCO 文档重排序任务中取得最先进结果。

提出的方法

  • 使用双流输入格式在 MS MARCO 文档重排序数据集上微调预训练的 Longformer 模型:查询作为句子 A,文档作为句子 B。
  • 使用 [CLS] 和 [SEP] 标记连接查询和文档,将序列截断至最多 4096 个标记,以适配 Longformer 的上下文窗口。
  • 将 Longformer 的 [CLS] 标记表示作为输入,输入到一个包含 dropout 和非线性激活函数的两层前馈分类器头,用于相关性预测。
  • 使用批量大小为 128、Adam 优化器、初始初始值为 3×10⁻⁵ 的学习率,并在 2500 步内进行线性学习率预热,训练 150,000 次迭代,损失函数为交叉熵损失。
  • 在训练过程中将正样本与负样本文档的比例从 1:100 调整为 1:10,以提升模型的泛化能力和收敛性。
  • 使用 PyTorch Lightning 和 Hugging Face Transformers 实现训练。

实验结果

研究问题

  • RQ1Longformer 是否能在标准 BERT 模型受序列长度限制的 MS MARCO 文档重排序任务中,有效对长文档进行重排序?
  • RQ2Longformer 的稀疏注意力机制(结合局部与全局注意力)相比标准自注意力,在长文档中的相关性估计方面有何改进?
  • RQ3与先前的神经重排序模型(如 Conformer-Kernel 和 DRMM)相比,Longformer 在 MS MARCO 文档重排序基准上实现了多大的性能提升?
  • RQ4在正样本与负样本文档比例为 1:10 的平衡数据集上微调 Longformer,是否相比原始的 1:100 比例能提升排序效果?

主要发现

  • Longformer 在官方 MS MARCO 开发集上实现了 MRR@100 为 0.329,优于基线模型 Indri Query Likelihood(0.192)及其他神经模型。
  • 在测试集上,Longformer 实现了 MRR@100 为 0.305,优于此前最佳提交结果(Conformer-Kernel 搭配 QTI,在开发集上为 0.307,但测试集表现更低)。
  • 该模型能够处理长达 4096 个标记的序列,从而有效建模长文档,这对文档重排序任务至关重要。
  • 使用 1:10 的正负样本比例进行微调,相比原始的 1:100 比例,提升了训练稳定性和性能表现。
  • Longformer 在 MS MARCO 文档重排序任务中展现出强大的泛化能力,在提交时成为当时基于 Transformer 的重排序模型中的最先进方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。