[论文解读] Pre-training Transformer Models with Sentence-Level Objectives for Answer Sentence Selection
本文为变压器模型提出了三种新颖的句子级预训练目标,通过融合段落级和文档级语义信息,以提升答案句子选择(AS2)性能。该模型学习预测句子到段落以及段落到文档的关系,在无需额外标注数据的情况下,相较于RoBERTa和ELECTRA,在公开和工业级AS2数据集上实现了3–4%的绝对F1提升。
An important task for designing QA systems is answer sentence selection (AS2): selecting the sentence containing (or constituting) the answer to a question from a set of retrieved relevant documents. In this paper, we propose three novel sentence-level transformer pre-training objectives that incorporate paragraph-level semantics within and across documents, to improve the performance of transformers for AS2, and mitigate the requirement of large labeled datasets. Specifically, the model is tasked to predict whether: (i) two sentences are extracted from the same paragraph, (ii) a given sentence is extracted from a given paragraph, and (iii) two paragraphs are extracted from the same document. Our experiments on three public and one industrial AS2 datasets demonstrate the empirical superiority of our pre-trained transformers over baseline models such as RoBERTa and ELECTRA for AS2.
研究动机与目标
- 通过减少对大规模标注数据集的依赖,提升低资源环境下答案句子选择(AS2)的性能。
- 通过引入段落级和文档级语义信息,增强句子对的表示能力,而这些语义在现有预训练方法中尚未得到充分探索。
- 设计能够捕捉跨文档和跨段落关系的句子级预训练目标,以模拟真实世界问答场景的复杂性。
- 证明通过这些目标进行预训练可提升下游AS2任务的性能,且无需额外标注数据。
- 发布代码和预训练模型,以支持在AS2数据集上高效微调。
提出的方法
- 提出三种新的句子级预训练目标:(i) 句子-同段落预测,(ii) 句子-来自段落预测,以及 (iii) 段落-同文档预测。
- 设计这些目标以作用于句子对,使模型能够学习跨段落和文档的层次化语义关系。
- 使用大规模维基百科数据,结合掩码语言建模(MLM)和所提目标,对RoBERTa-Base和ELECTRA-Base模型进行预训练。
- 采用数据采样策略,为每个目标构建正样本对和负样本对,确保训练样本的多样性和挑战性。
- 通过目标设计隐式引入对比学习原则,促使模型能够区分语义相关与无关的句子/段落对。
- 发布代码和预训练模型检查点,以支持在下游AS2数据集上的微调。
实验结果
研究问题
- RQ1是否可以通过建模段落和文档级语义的句子级预训练目标来提升AS2性能?
- RQ2所提目标是否在泛化能力上优于标准的MLM以及NSP/SOP目标?
- RQ3预训练模型在多大程度上减少了对大规模标注AS2数据集的需求?
- RQ4与NSP和SOP等现有预训练任务相比,所提目标的难度如何?
- RQ5预训练模型是否可在无需额外数据的情况下,有效微调至多样化的AS2基准上?
主要发现
- 在三个公开和一个工业级AS2数据集上,所提预训练目标相较RoBERTa和ELECTRA基线模型,F1分数提升了3–4个百分点。
- 仅使用MLM进行预训练的模型性能劣于采用所提目标的模型,表明性能提升源于新目标,而非数据采样策略。
- 预训练任务的难度显著高于NSP和SOP,验证集准确率更低(如SSP约80% vs. NSP约94%),表明其蕴含更丰富的语义学习能力。
- 模型将相关答案排在更高位置的能力得到提升,可能归因于在预训练阶段学习了跨多个段落和文档的推理能力。
- 消融实验证实,性能提升并非源于超参数调优或数据采样,而是源于新颖的预训练目标。
- 预训练模型在AS2基准上取得了最先进性能,证明在句子级预训练中引入文档级语义具有显著有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。