Skip to main content
QUICK REVIEW

[论文解读] GoSum: Extractive Summarization of Long Documents by Reinforcement Learning and Graph Organized discourse state

Junyi Bian, Xiaodi Huang|arXiv (Cornell University)|Nov 18, 2022
Topic Modeling被引用 4
一句话总结

GoSum 提出了一种新颖的长篇科学文献可提取摘要模型,通过将强化学习与异质图神经网络结合,以编码分层语篇结构。通过将句子和章节建模为具有语篇感知边的节点,GoSum 在 PubMed 和 arXiv 数据集上实现了最先进(SOTA)的 ROUGE 分数,表明语篇层次结构显著提升了摘要质量。

ABSTRACT

Extracting summaries from long documents can be regarded as sentence classification using the structural information of the documents. How to use such structural information to summarize a document is challenging. In this paper, we propose GoSum, a novel graph and reinforcement learning based extractive model for long-paper summarization. In particular, GoSum encodes sentence states in reinforcement learning by building a heterogeneous graph for each input document at different discourse levels. An edge in the graph reflects the discourse hierarchy of a document for restraining the semantic drifts across section boundaries. We evaluate GoSum on two datasets of scientific articles summarization: PubMed and arXiv. The experimental results have demonstrated that GoSum achieve state-of-the-art results compared with strong baselines of both extractive and abstractive models. The ablation studies further validate that the performance of our GoSum benefits from the use of discourse information.

研究动机与目标

  • 解决长篇科学文献中可提取摘要的挑战,传统模型在内存开销和复杂语篇结构方面存在困难。
  • 通过利用强化学习获取更优的训练信号,克服依赖贪心搜索生成的次优、非确定性标签的可提取模型局限。
  • 将分层语篇信息(如章节边界和标题)整合到句子表征中,以减少文档各章节之间的语义漂移。
  • 开发一种基于图的方法,高效捕捉局部句子上下文与全局文档结构,实现对长输入的线性可扩展性。
  • 证明语篇感知建模相较于基线模型,在科学文献数据集上的可提取摘要性能有显著提升。

提出的方法

  • 构建一个异质图,其中每个句子和章节均为节点,边表示语篇层次结构,以编码结构性关系。
  • 使用图神经网络(GNN)编码包含局部句子特征、全局文档上下文和抽取历史的句子状态。
  • 将摘要任务建模为强化学习中的序列决策过程,其中选择一个句子即为基于当前状态的动作。
  • 使用基于 ROUGE 分数的奖励函数进行强化学习训练,通过多次采样标签序列实现数据增强。
  • 通过逐步污染章节信息实施课程学习,以评估模型鲁棒性及语篇结构的重要性。
  • 使用策略网络预测句子选择概率,通过基于黄金摘要 ROUGE 分数的奖励信号,利用策略梯度方法进行优化。

实验结果

研究问题

  • RQ1基于图结构的语篇层次表示能否提升长篇科学文献的可提取摘要性能?
  • RQ2将强化学习与 GNN 结合,相较于监督学习或非图基线模型,性能提升程度如何?
  • RQ3语篇信息(尤其是章节标题与层次结构)在多大程度上促进摘要质量的提升?
  • RQ4当语篇结构存在不准确或损坏(如缺少或错误分配的章节标题)时,模型对这些错误的敏感程度如何?
  • RQ5在强化学习训练过程中,增加采样标签序列的数量是否能带来更好的泛化能力与性能提升?

主要发现

  • GoSum 在 PubMed 和 arXiv 数据集上均达到最先进性能,PubMed 上的 ROUGE-1、ROUGE-2 和 ROUGE-L 分数分别为 49.83、23.56 和 45.10,arXiv 上则为 48.61、20.53 和 42.80。
  • 将章节标题替换为“section #id”后,性能出现轻微但可测量的下降——PubMed 上 ROUGE-1、ROUGE-2 和 ROUGE-L 分别下降 0.20、0.11 和 0.12,表明章节标题语义提供了边际但有用的信息信号。
  • 当章节归属信息被污染时,性能显著下降,尤其在高污染率下,证实语篇层次结构对 GoSum 成功至关重要。
  • 消融实验证明,模型性能对准确的语篇结构最为敏感,而不仅限于章节标题;当章节边界被破坏时,性能下降更为剧烈。
  • 使用多个采样标签序列(top-k)进行强化学习训练可显著提升性能:top-4 采样可达到 49.64 的 ROUGE-1 分数,接近完整 RL 模型的 49.83。
  • 若移除奖励机制(将所有奖励设为 1),性能略有下降,证实基于奖励的反馈在训练过程中对区分高质量摘要至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。