Skip to main content
QUICK REVIEW

[论文解读] Discourse-Aware Neural Extractive Text Summarization

Jiacheng Xu, Zhe Gan|arXiv (Cornell University)|Oct 30, 2019
Topic Modeling参考文献 50被引用 20
一句话总结

本文提出DiscoBert,一种注重语篇的抽取式文本摘要模型,使用基本语篇单元(EDUs)而非完整句子作为选择单元,以减少冗余并提升摘要的信息量。通过构建RST和共指语篇图,并利用图卷积网络进行编码,DiscoBert捕捉长距离依赖关系,在CNN/DM和XSum基准上相比BERT-base模型达到最先进性能。

ABSTRACT

Recently BERT has been adopted for document encoding in state-of-the-art text summarization models. However, sentence-based extractive models often result in redundant or uninformative phrases in the extracted summaries. Also, long-range dependencies throughout a document are not well captured by BERT, which is pre-trained on sentence pairs instead of documents. To address these issues, we present a discourse-aware neural summarization model - DiscoBert. DiscoBert extracts sub-sentential discourse units (instead of sentences) as candidates for extractive selection on a finer granularity. To capture the long-range dependencies among discourse units, structural discourse graphs are constructed based on RST trees and coreference mentions, encoded with Graph Convolutional Networks. Experiments show that the proposed model outperforms state-of-the-art methods by a significant margin on popular summarization benchmarks compared to other BERT-base models.

研究动机与目标

  • 解决基于句子的抽取式摘要中存在的冗余问题以及长距离依赖建模不足的问题。
  • 通过在子句级语篇单元(EDUs)而非完整句子上操作,提升事实一致性和简洁性。
  • 将语篇结构——特别是修辞结构理论(RST)和共指关系——作为归纳偏置,以实现更好的文档级上下文建模。
  • 通过整合捕捉语篇单元之间长距离交互的语篇图,增强基于BERT的摘要模型。
  • 通过端到端神经框架在标准文本摘要基准上实现最先进性能。

提出的方法

  • 该模型使用BERT对基于RST分割生成的语篇单元(EDUs)进行编码,替代原有的句子级编码。
  • 构建两个语篇图:(1) 基于EDU的RST解析树生成的RST图,(2) 连接文档中同一实体提及的共指图。
  • 对两个语篇图分别应用图卷积网络(GCNs),以传播表示并建模EDUs之间的长距离依赖。
  • 通过基于编码表示选择排名靠前的EDUs实现抽取式摘要,且通过子句级选择自然实现压缩。
  • 使用标准的基于BERT的优化方法,在摘要数据集上进行端到端微调。
  • 语篇图使用预训练的语篇解析器和共指消解工具构建,边由修辞关系和共指链定义。

实验结果

研究问题

  • RQ1子句级语篇单元(EDUs)是否比完整句子更适合作为抽取式摘要的选择基础?
  • RQ2语篇图(RST和共指)在多大程度上能改善基于BERT的摘要中的长距离依赖建模?
  • RQ3通过GCNs整合语篇结构是否能带来更简洁、更少冗余且更具信息量的摘要?
  • RQ4所提出的模型在标准基准上与最先进基于BERT的抽取式模型相比表现如何?
  • RQ5语篇图构建的主要失败模式是什么,它们如何影响摘要质量?

主要发现

  • DiscoBert在CNN/DM和XSum摘要基准上达到新的最先进结果,优于其他BERT-base模型。
  • 使用EDUs作为选择单元相比句子级抽取,能生成更简洁、冗余更少的摘要。
  • 语篇图的整合显著提升了性能,证明了结构化语篇知识作为归纳偏置的价值。
  • 错误分析显示,性能下降主要源于RST依赖解析和共指消解中的错误,特别是回指消解问题。
  • 常见错误包括标点符号错误、引号缺失以及代词模糊(例如“he”缺乏明确先行词),这些影响了语篇连贯性。
  • 该模型在新闻摘要和长文档摘要任务中均表现出一致的性能提升,表明其对领域变化具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。