[论文解读] Pre-training for Abstractive Document Summarization by Reinstating Source Text
本文提出了三种序列到序列的预训练目标——句子重排、下一句生成和掩码文档生成——通过重建原始源文档,使模型能够在无标签文本上进行摘要生成的预训练。尽管仅使用19GB的预训练数据,该方法在ROUGE指标上仍达到或超过在160GB以上语料上预训练的模型表现,证明了在有限数据下具有极强的有效性。
Abstractive document summarization is usually modeled as a sequence-to-sequence (Seq2Seq) learning problem. Unfortunately, training large Seq2Seq based summarization models on limited supervised summarization data is challenging. This paper presents three pre-training objectives which allow us to pre-train a Seq2Seq based abstractive summarization model on unlabeled text. The main idea is that, given an input text artificially constructed from a document, a model is pre-trained to reinstate the original document. These objectives include sentence reordering, next sentence generation, and masked document generation, which have close relations with the abstractive document summarization task. Experiments on two benchmark summarization datasets (i.e., CNN/DailyMail and New York Times) show that all three objectives can improve performance upon baselines. Compared to models pre-trained on large-scale data (more than 160GB), our method, with only 19GB text for pre-training, achieves comparable results, which demonstrates its effectiveness.
研究动机与目标
- 通过利用无监督预训练,解决在有限监督数据下训练大型抽取式摘要模型的挑战。
- 设计显式建模内容重排的预训练目标,这是抽取式摘要的关键特征。
- 通过在无标签文本上使用序列到序列目标进行预训练,提升模型在抽取式摘要任务上的泛化能力和性能。
- 证明在远少于当前最先进模型所用数据量的情况下,仍可实现有效的抽取式摘要预训练。
提出的方法
- 提出三种序列到序列预训练(STEP)目标:句子重排(SR)、下一句生成(NSG)和掩码文档生成(MDG)。
- 每个目标均通过序列到序列模型从人工扰动的版本中重建原始源文档——例如,打乱句子顺序、预测下一段内容或掩码片段。
- 模型在摘要数据集(如CNN/DailyMail、NYT)的训练集无标签文档上进行预训练,随后在监督摘要任务上进行微调。
- 采用基于Transformer的序列到序列架构,具有共享编码器-解码器结构,并通过掩码语言建模和去噪目标进行预训练。
- 采用两阶段训练流程:首先在无标签数据上使用STEP目标进行预训练,然后在监督摘要数据上进行微调。
- 通过ROUGE和人工评估,在基准数据集上评估单一及组合STEP目标的有效性。
实验结果
研究问题
- RQ1在无标签文本上使用源文本重建进行预训练,能否提升抽取式摘要性能?
- RQ2建模内容重排的序列到序列预训练目标是否能提升摘要质量?
- RQ3仅使用19GB文本预训练的模型能否达到在160GB或更多数据上预训练模型的性能?
- RQ4所提出的STEP方法在自动评估和人工评估中,与BERTAbs和UniLM等强基线模型相比表现如何?
- RQ5在摘要数据集的训练集上进行预训练,是否仍能带来泛化优势?
主要发现
- 所提出的STEP预训练方法仅使用19GB无标签文本,在CNN/DailyMail数据集上达到的ROUGE-1、ROUGE-2和ROUGE-L分数与在160GB及以上数据上预训练的模型相当或更高。
- 仅使用句子重排(SR)目标即可在相同监督数据微调下超越强基线模型,表现更优。
- 人工评估显示,最佳STEP模型生成的摘要在23%的案例中被评为最佳,且平均排名(2.77)显著低于除人类参考摘要外的所有其他模型。
- STEP模型优于在16GB文本上预训练的ProphetNet和UniLM,证明其具有更优的数据效率。
- 该模型在ROUGE-1和ROUGE-L上优于T5和PEGASUS(HugeNews),尽管在ROUGE-2上略逊一筹,表明其在整体内容捕捉和语言流畅性方面表现优异。
- 定性分析表明,该模型生成的摘要语言流畅、信息丰富且简洁,通常对源文本内容进行重述和重排,体现出典型的抽取式行为特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。