Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Learning for Contextualized Extractive Summarization

Hong Wang, Xin Wang|arXiv (Cornell University)|Jun 11, 2019
Topic Modeling参考文献 31被引用 6
一句话总结

本文提出了三种自监督预训练任务——Mask、Replace 和 Switch——用于抽取式摘要,利用文档级上下文而无需人工标注。通过在原始 CNN/DM 文章上使用这些任务对层次化模型进行预训练,该方法在 ROUGE 指标上达到最先进水平(ROUGE-L: 37.86),且收敛速度优于从零开始训练的模型,优于先前的 SOTA 模型如 NeuSum。

ABSTRACT

Existing models for extractive summarization are usually trained from scratch with a cross-entropy loss, which does not explicitly capture the global context at the document level. In this paper, we aim to improve this task by introducing three auxiliary pre-training tasks that learn to capture the document-level context in a self-supervised fashion. Experiments on the widely-used CNN/DM dataset validate the effectiveness of the proposed auxiliary tasks. Furthermore, we show that after pre-training, a clean model with simple building blocks is able to outperform previous state-of-the-art that are carefully designed.

研究动机与目标

  • 通过捕捉文档级上下文来提升抽取式摘要性能,而现有模型往往无法从零开始学习到这一点。
  • 开发无需人工标注标签的自监督预训练任务,以学习文档的内在结构。
  • 证明仅使用预训练的简单层次化模型可超越复杂且精心设计的最先进模型。
  • 研究文档级上下文对模型性能与训练效率的影响。
  • 评估预训练方法对超参数选择(如替换概率)的鲁棒性。

提出的方法

  • 提出三种自监督预训练任务:Mask(从候选池中预测缺失的句子)、Replace(检测某一句子是否来自另一篇文档的替换)、Switch(检测同一文档内句子是否被互换)。
  • 使用具有双向 LSTM 的层次化模型进行句子编码,并通过自注意力模块引入文档级上下文信息。
  • 在未加标注的 CNN/DM 文章上使用这三项任务对模型进行预训练,随后在使用真实句子标签的抽取式摘要任务上进行微调。
  • 预训练阶段学习率为 0.0001,微调阶段为 0.00001,且每轮有 0.25 的概率对句子执行掩码、替换或互换操作。
  • 使用 ROUGE 分数(Rouge-1、Rouge-2、Rouge-L)进行评估,并采用 ±0.25 的置信区间以确保统计可靠性。
  • 通过复用预训练模型中的句子编码器并调整互换概率,开展消融研究以评估对超参数的敏感性。

实验结果

研究问题

  • RQ1在文档级结构上进行自监督预训练是否能提升抽取式摘要的性能?
  • RQ2与从零开始训练相比,使用 Mask、Replace 和 Switch 任务进行预训练是否能带来更快的收敛速度和更好的泛化能力?
  • RQ3性能提升主要来源于文档级上下文建模,还是句子级表征学习?
  • RQ4模型性能对控制句子互换概率的超参数有多敏感?
  • RQ5当使用文档感知的自监督任务进行预训练时,简单的模型架构能否超越复杂且最先进的模型?

主要发现

  • Switch 预训练任务取得最佳的 ROUGE-L 分数 37.86,优于先前的 SOTA 模型 NeuSum(37.61)。
  • 所有三项预训练任务均优于基础模型,ROUGE-L 分数分别为 37.65(Mask)、37.73(Replace)和 37.86(Switch)。
  • Switch 方法在微调阶段仅用 9 个 epoch 即收敛,显著快于基础模型需 24 个 epoch 才能达到峰值性能。
  • 即使仅复用预训练模型中的句子编码器,性能仍优于基础模型,表明预训练增强了句子表征学习能力。
  • 模型对超参数变化具有鲁棒性:互换概率为 0.15 时性能与 0.25 几乎相同,而 0.35 时略有下降,表明在 0.15–0.25 范围内性能稳定。
  • 通过使用基本的层次化架构,预训练模型实现了最先进性能,表明自监督预训练可减少对复杂模型设计的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。