[论文解读] Unsupervised Extractive Summarization by Pre-training Hierarchical Transformers
该论文提出STAS,一种新颖的无监督抽取式摘要方法,利用预训练层次化Transformer的句子级别自注意力机制对重要句子进行排序,而无需使用带标签的摘要。通过引入句子置换预训练目标,该模型减少了对句子位置的依赖,并在CNN/DailyMail和NYT数据集上取得了最先进(SOTA)的ROUGE得分,优于以往的无监督方法。
Unsupervised extractive document summarization aims to select important sentences from a document without using labeled summaries during training. Existing methods are mostly graph-based with sentences as nodes and edge weights measured by sentence similarities. In this work, we find that transformer attentions can be used to rank sentences for unsupervised extractive summarization. Specifically, we first pre-train a hierarchical transformer model using unlabeled documents only. Then we propose a method to rank sentences using sentence-level self-attentions and pre-training objectives. Experiments on CNN/DailyMail and New York Times datasets show our model achieves state-of-the-art performance on unsupervised summarization. We also find in experiments that our model is less dependent on sentence positions. When using a linear combination of our model and a recent unsupervised model explicitly modeling sentence positions, we obtain even better results.
研究动机与目标
- 开发一种无监督抽取式摘要方法,训练过程中无需使用带标签的摘要。
- 探究层次化Transformer中的句子级别自注意力是否能有效对句子重要性进行排序,而无需依赖图模型或现成的句子嵌入方法。
- 通过引入句子置换预训练任务,减少抽取式摘要中对句子位置的依赖。
- 在无监督条件下,在标准无监督摘要基准上实现最先进性能。
提出的方法
- 在大规模无标签文档上预训练一个层次化Transformer(扩展版HIBERT),采用两种新型预训练任务:掩码句子预测和句子置换。
- 使用预训练模型中的句子级别自注意力得分作为抽取式摘要中句子重要性的代理指标。
- 基于其他句子对句子i的注意力得分总和(即对句子i的注意力)对句子进行排序,并结合预训练目标以优化重要性估计。
- 在预训练过程中引入句子置换任务,以促使模型关注内容而非位置。
- 将最终的句子重要性得分与一个位置感知模型进行线性组合,以进一步提升性能。
- 通过选择重要性得分最高的k个句子,将该方法应用于抽取式摘要。
实验结果
研究问题
- RQ1层次化Transformer中的句子级别自注意力是否能有效用于无监督抽取式摘要中的句子重要性排序?
- RQ2通过句子置换预训练目标进行预训练,是否能减少模型在摘要中对句子位置的依赖?
- RQ3所提出方法在标准基准上的性能与现有无监督抽取式摘要模型相比如何?
- RQ4将所提出模型与一个位置感知模型结合,是否能进一步提升摘要性能?
主要发现
- 所提出的STAS模型在CNN/DailyMail数据集上取得了最先进ROUGE得分,测试集上的ROUGE-1、ROUGE-2和ROUGE-L得分分别为40.90、18.02和37.21。
- 在纽约时报(New York Times)数据集上,STAS表现出具有竞争力的性能,其在ROUGE和句子位置分布相似性方面均优于以往的无监督方法。
- STAS的句子位置分布与ORACLE上界相比显著更接近,其Kullback-Leibler散度为0.098,而PACSUM为0.614。
- 若移除句子置换预训练任务,位置偏差会增加,KL散度上升至0.108,证实该任务在减少位置依赖性方面的有效性。
- STAS与近期位置感知模型的线性组合可获得更优结果,表明内容驱动与位置驱动模型之间具有互补优势。
- 句子置换任务优于更简单的替代方案(如移除位置嵌入),表明其在保留有用的位置归纳偏差的同时,有效减少了位置偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。