[论文解读] Multi-stage Pretraining for Abstractive Summarization
本文提出一种用于抽取式摘要的多阶段预训练方法,通过使用 BERT 和 Gigaword 预训练进行全网络初始化,以提升性能与抽象性。相较于随机初始化,该方法在 Gigaword 上实现 +1.05 ROUGE-L,在 CNN/DailyMail 上实现 +1.78 ROUGE-L,且抽象率高达 4%,显著高于以往基于 MLE 的模型,仅使用最大似然训练且无需推理阶段的启发式规则。
Neural models for abstractive summarization tend to achieve the best performance in the presence of highly specialized, summarization specific modeling add-ons such as pointer-generator, coverage-modeling, and inferencetime heuristics. We show here that pretraining can complement such modeling advancements to yield improved results in both short-form and long-form abstractive summarization using two key concepts: full-network initialization and multi-stage pretraining. Our method allows the model to transitively benefit from multiple pretraining tasks, from generic language tasks to a specialized summarization task to an even more specialized one such as bullet-based summarization. Using this approach, we demonstrate improvements of 1.05 ROUGE-L points on the Gigaword benchmark and 1.78 ROUGE-L points on the CNN/DailyMail benchmark, compared to a randomly-initialized baseline.
研究动机与目标
- 在不依赖复杂推理阶段启发式规则或任务特定架构修改的前提下,提升抽取式摘要性能。
- 探究多阶段预训练(从通用语言建模 BERT 开始,逐步过渡到摘要特定任务 Gigaword)是否能提升模型性能与抽象性。
- 评估全网络参数初始化与部分或浅层预训练在摘要基准上的影响。
- 确定预训练是否能在保持高 ROUGE 分数的同时提升抽象率,尤其与最先进基于 MLE 的模型进行比较。
提出的方法
- 该模型采用基于 Transformer 的架构,并使用 BERT 和 Gigaword 预训练阶段的预训练权重对编码器和解码器层进行全网络初始化。
- 多阶段预训练分为两个阶段:首先,模型在 BERT 语言建模目标上进行预训练,以获得通用语言理解能力;随后,在 Gigaword 摘要任务上进行预训练,以获取摘要特定知识。
- 最终微调阶段在目标数据集(CNN/DailyMail 或 Gigaword)上使用最大似然估计(MLE)损失,不引入强化学习或推理阶段启发式规则。
- 该方法比较了不同的初始化方案,包括随机初始化、仅 BERT 编码器初始化,以及编码器和解码器均使用 BERT 和 Gigaword 预训练的联合初始化。
- 模型通过 ROUGE-L F1 和抽象率进行评估,并通过部分预训练的消融实验,评估层初始化深度的影响。
- 主要实验中避免使用指针-生成器或注意力覆盖机制,专注于预训练作为主要性能提升手段。
实验结果
研究问题
- RQ1与随机初始化相比,从 BERT 开始并逐步过渡到 Gigaword 摘要任务的多阶段预训练是否能提升抽取式摘要性能?
- RQ2与浅层预训练(如仅词嵌入)相比,全网络参数初始化是否能在摘要任务上带来更好的性能?
- RQ3预训练在多大程度上提升了生成摘要的抽象率,尤其与最先进基于 MLE 的模型相比?
- RQ4所提出的方法是否能在不依赖推理阶段启发式规则(如长度惩罚或 n-gram 重复控制)的情况下实现高性能?
- RQ5预训练层数与模型性能之间存在何种关系?更深层次的预训练是否始终能带来性能提升?
主要发现
- 与随机初始化基线相比,多阶段预训练方法在 Gigaword 基准上实现了 +1.05 ROUGE-L F1 的提升。
- 在 CNN/DailyMail 基准上,该方法相比同一基线实现了 +1.78 ROUGE-L F1 的提升,优于以往基于 MLE 的模型。
- 模型达到了 4% 的抽象率,显著高于 Gehrmann 等人(2018)提出的最先进 MLE 模型中观察到的 0.5%,表明在抽取式与抽象式生成之间实现了更好的平衡。
- 全网络初始化(即编码器和解码器均使用预训练权重)相比部分或浅层预训练表现更优,且预训练层数与 ROUGE-L F1 分数之间存在显著正相关(r = 0.8698)。
- 与零阶段或单阶段预训练基线相比,该模型在更少的训练周期内达到峰值性能,表明收敛速度更快。
- 引入内容选择预测仅带来 0.03 的 ROUGE-L F1 提升,表明其收益远低于仅通过预训练带来的增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。