Skip to main content
QUICK REVIEW

[论文解读] GRETEL: Graph Contrastive Topic Enhanced Language Model for Long Document Extractive Summarization

Qianqian Xie, Jimin Huang|arXiv (Cornell University)|Aug 21, 2022
Topic Modeling被引用 15
一句话总结

GRETEL 提出了一种图对比主题增强的语言模型,通过整合层次化 Transformer 编码与图对比学习,提升了长文档抽取式摘要的效果。通过利用全局文档上下文和黄金摘要监督,该模型捕捉到更具连贯性、主题相关性的句子表征,在通用和生物医学数据集上均取得了优于当前最先进方法的 ROUGE 分数。

ABSTRACT

Recently, neural topic models (NTMs) have been incorporated into pre-trained language models (PLMs), to capture the global semantic information for text summarization. However, in these methods, there remain limitations in the way they capture and integrate the global semantic information. In this paper, we propose a novel model, the graph contrastive topic enhanced language model (GRETEL), that incorporates the graph contrastive topic model with the pre-trained language model, to fully leverage both the global and local contextual semantics for long document extractive summarization. To better capture and incorporate the global semantic information into PLMs, the graph contrastive topic model integrates the hierarchical transformer encoder and the graph contrastive learning to fuse the semantic information from the global document context and the gold summary. To this end, GRETEL encourages the model to efficiently extract salient sentences that are topically related to the gold summary, rather than redundant sentences that cover sub-optimal topics. Experimental results on both general domain and biomedical datasets demonstrate that our proposed method outperforms SOTA methods.

研究动机与目标

  • 为解决现有预训练语言模型(PLMs)在捕捉长文档中长距离依赖关系与全局语义方面的局限性。
  • 通过引入黄金摘要监督,弥合无监督主题推断与真实全局语义之间的语义鸿沟。
  • 通过融合 PLM 的局部上下文表征与全局一致的主题表征,提升抽取式摘要的质量。
  • 通过过滤由高频词主导而非主题相关性内容的句子,减少冗余。
  • 通过层次化 Transformer 编码实现对长文档的有效建模,无需截断。

提出的方法

  • 采用层次化 Transformer 编码器(HTE)捕捉长文档的完整上下文表征,保留长距离依赖关系。
  • 集成图对比主题模型(GCTM),通过对比句子与文档表征与黄金摘要语义的关系,学习主题表征。
  • 使用监督对比学习,将与黄金摘要语义相似度高的句子和文档表征拉近。
  • 将 GCTM 的全局主题表征与 PLM 的局部上下文表征融合,以指导关键句子的选择。
  • 通过交叉注意力与对比损失的组合,端到端训练模型,以优化抽取式摘要性能。
  • 利用文档级与句子级的主题表征,提升最终摘要的语义连贯性与主题相关性。

实验结果

研究问题

  • RQ1在主题建模中引入黄金摘要监督,能否提升所抽取句子与文档真实全局语义的一致性?
  • RQ2在长文档摘要任务中,图对比学习与 PLMs 结合时,如何提升主题表征的质量?
  • RQ3与传统的基于词袋(BOW)的主题模型相比,层次化 Transformer 编码在建模长距离依赖关系方面有多大的提升?
  • RQ4对比主题学习的引入是否能减少抽取式摘要中由高频词主导的冗余句子选择?
  • RQ5GRETEL 在 ROUGE 分数以及所选句子在长文档中的位置分布方面,与当前最先进方法相比表现如何?

主要发现

  • GRETEL 在通用领域与生物医学领域的长文档摘要数据集上均达到最先进性能,ROUGE 分数优于现有最先进方法。
  • 模型所选句子与黄金摘要的主题对齐性更高,生成摘要的语义相似度与连贯性更优。
  • GRETEL 的句子选择分布于文档的各个部分,包括后半部分,表明其对长上下文的建模能力优于偏好早期句子的模型。
  • GRETEL 所选句子的位置分布最接近黄金摘要,表明其能更全面地覆盖文档中的关键信息。
  • 所选句子的主导主题在语义上与黄金摘要相关,如 'treatment'(治疗)、'joints'(关节)、'infected'(感染的),证实了基于主题的显著性检测能力。
  • 在 PubMed-Long 上的案例研究显示,与 BERTSum 相比,GRETEL 生成的摘要更具连贯性与信息量,主题连贯性更强,冗余更少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。