Skip to main content
QUICK REVIEW

[论文解读] SEAL: Segment-wise Extractive-Abstractive Long-form Text Summarization

Yao Zhao, Mohammad Saleh|arXiv (Cornell University)|Jun 18, 2020
Topic Modeling参考文献 37被引用 13
一句话总结

SEAL 提出了一种用于长文本摘要的逐段抽取式-生成式 Transformer 模型,通过评分子网络动态选择稀疏的输入片段,在降低计算成本的同时提升性能。该模型在长文本摘要基准测试中取得最先进结果,包括一个全新的 100K token 数据集(Search2Wiki),并通过显式注意力追踪增强了可解释性。

ABSTRACT

Most prior work in the sequence-to-sequence paradigm focused on datasets with input sequence lengths in the hundreds of tokens due to the computational constraints of common RNN and Transformer architectures. In this paper, we study long-form abstractive text summarization, a sequence-to-sequence setting with input sequence lengths up to 100,000 tokens and output sequence lengths up to 768 tokens. We propose SEAL, a Transformer-based model, featuring a new encoder-decoder attention that dynamically extracts/selects input snippets to sparsely attend to for each output segment. Using only the original documents and summaries, we derive proxy labels that provide weak supervision for extractive layers simultaneously with regular supervision from abstractive summaries. The SEAL model achieves state-of-the-art results on existing long-form summarization tasks, and outperforms strong baseline models on a new dataset/task we introduce, Search2Wiki, with much longer input text. Since content selection is explicit in the SEAL model, a desirable side effect is that the selection can be inspected for enhanced interpretability.

研究动机与目标

  • 为解决输入序列长达 100,000 个 token 的长文本生成式摘要挑战,标准模型在计算和内存方面面临限制。
  • 通过在单一端到端模型中联合训练抽取式和生成式组件,提升摘要性能,避免分阶段训练。
  • 通过在解码过程中显式且可检查地选择输入片段,增强模型的可解释性。
  • 在现有长文本数据集(如 arXiv、PubMed)以及一个新且规模更大的数据集 Search2Wiki 上评估模型,其输入序列显著更长。
  • 证明在长输入上,动态稀疏注意力机制相比截断或压缩方法能实现更优性能。

提出的方法

  • 模型将长输入文档划分为固定长度的片段,并通过共享编码器独立处理每个片段。
  • 一个带有代理抽取标签弱监督的评分子网络,识别每个摘要段最相关的片段。
  • 门控机制为每个摘要段仅选择前 k 个片段,实现在解码器中的稀疏注意力。
  • 解码器仅对选定片段使用完整的自注意力和交叉注意力机制,并由真实生成式摘要提供监督。
  • 训练过程中,模型优化组合损失:来自代理标签的抽取损失与来自真实摘要的生成损失。
  • 在每个段落的评分输入中引入先前已解码的 token,实现在解码过程中动态、上下文感知的片段选择。

实验结果

研究问题

  • RQ1统一的端到端模型能否在超过 10,000 个 token 的长输入序列上,联合优化抽取式与生成式摘要?
  • RQ2与截断或压缩方法相比,动态稀疏注意力机制在长文本摘要中是否能提升性能与效率?
  • RQ3来自代理抽取标签的弱监督能否有效引导内容选择,而无需真实抽取标注?
  • RQ4与软注意力机制相比,该模型的可解释性如何,特别是在输入片段与摘要段之间的可追溯性方面?
  • RQ5该模型能否泛化到极长输入(如真实网络搜索结果),并在这些数据上超越现有基线模型?

主要发现

  • SEAL 模型在现有长文本摘要数据集(包括 arXiv 和 PubMed)上取得最先进结果,优于先前的抽取式与生成式模型。
  • 在新的 Search2Wiki 数据集上,输入序列长达 100,000 个 token,SEAL 显著优于强基线模型,证明其在超长输入上的可扩展性与有效性。
  • 当 $L_{seg}=16$,$L_{snpt}=64$,$L_{ext}=256$,且 $N_{snpt}=16$ 时,SEAL 在 CNN/DailyMail 上的 R1/R2 得分为 39.3/16.5,与使用 1024 个输入 token 的截断模型性能相当。
  • 可视化显示,该模型的注意力机制能清晰地将摘要段与特定输入片段关联,相比软注意力模型显著增强了可解释性。
  • 弱监督抽取头与端到端训练的结合,性能优于分别训练抽取式与生成式组件的方法。
  • 该模型的动态选择机制使其能够自适应地为每个摘要段选择相关片段,从而同时提升效率与相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。