Skip to main content
QUICK REVIEW

[论文解读] SEQ^3: Differentiable Sequence-to-Sequence-to-Sequence Autoencoder for Unsupervised Abstractive Sentence Compression

Christos Baziotis, Ion Androutsopoulos|arXiv (Cornell University)|Apr 7, 2019
Topic Modeling参考文献 38被引用 22
一句话总结

本文提出 SEQ^3,一种用于无监督抽象式句子压缩的可微分序列到序列再到序列自编码器,通过使用压缩的潜在序列作为输入与重建句子之间的桥梁。通过利用预训练语言模型先验和基于主题的损失函数,该方法在无需平行数据的情况下实现了最先进性能,在 Gigaword 和 DUC 基准测试中通过端到端梯度优化超越了先前的无监督方法。

ABSTRACT

Neural sequence-to-sequence models are currently the dominant approach in several natural language processing tasks, but require large parallel corpora. We present a sequence-to-sequence-to-sequence autoencoder (SEQ^3), consisting of two chained encoder-decoder pairs, with words used as a sequence of discrete latent variables. We apply the proposed model to unsupervised abstractive sentence compression, where the first and last sequences are the input and reconstructed sentences, respectively, while the middle sequence is the compressed sentence. Constraining the length of the latent word sequences forces the model to distill important information from the input. A pretrained language model, acting as a prior over the latent sequences, encourages the compressed sentences to be human-readable. Continuous relaxations enable us to sample from categorical distributions, allowing gradient-based optimization, unlike alternatives that rely on reinforcement learning. The proposed model does not require parallel text-summary pairs, achieving promising results in unsupervised sentence compression on benchmark datasets.

研究动机与目标

  • 为解决抽象式句子压缩中缺乏平行训练数据的问题,开发一种完全可微分的模型,避免依赖强化学习。
  • 通过引入一种序列到序列再到序列的架构,并以离散的潜在摘要作为中间表示,提升无监督句子压缩的效果。
  • 通过引入预训练语言模型作为潜在摘要序列的先验,提升摘要质量和人类可读性。
  • 通过引入基于主题的损失函数,稳定训练过程并减少早期采样阶段的方差,使压缩摘要与输入中的主题词对齐。
  • 证明端到端可微训练结合连续松弛方法可在句子压缩任务中超越基于强化学习的无监督模型。

提出的方法

  • SEQ^3 使用两个级联的编码器-解码器对:一个压缩器将输入句子映射为压缩的潜在摘要,一个重建器则从摘要中重建原始输入。
  • 模型采用注意力机制编码器-解码器架构,使用双向 LSTM 编码输入并生成摘要,同时利用全局注意力机制对齐源序列与目标序列的表示。
  • 通过 Gumbel-Softmax 技巧实现离散潜在变量的可微分松弛,支持基于梯度的优化,避免了强化学习带来的不稳定性。
  • 预训练语言模型作为潜在摘要序列的先验,通过语言建模损失鼓励生成语法正确且流畅的输出。
  • 引入基于主题的损失函数,使压缩摘要与输入中的主题指示词对齐,降低训练方差并提升语义一致性。
  • 模型通过组合重建损失、语言模型先验损失和主题对齐损失的复合损失函数进行端到端训练。

实验结果

研究问题

  • RQ1可微分的序列到序列再到序列自编码器是否能在无平行训练数据的情况下实现强大的无监督抽象式句子压缩性能?
  • RQ2在无监督设置下,使用预训练语言模型先验是否能提升生成摘要的流畅性和可读性?
  • RQ3基于主题的损失是否能在无监督条件下稳定训练并提升抽象压缩的语义一致性?
  • RQ4与基于强化学习的无监督模型相比,该模型在 ROUGE 分数和训练稳定性方面表现如何?
  • RQ5该模型在改写过程中在多大程度上保留了内容信息?其在抽取式与生成式行为之间如何实现平衡?

主要发现

  • 在 Gigaword 数据集上,SEQ^3 在所有 ROUGE 指标上均优于无监督的 Wang 和 Lee(2018)提出的预训练生成器,实现了无监督抽象式句子压缩的最先进结果。
  • 移除预训练语言模型先验会显著降低性能,尤其在 ROUGE-2 和 ROUGE-L 指标上,证实其在提升流畅性和词序合理性方面的重要作用。
  • 基于主题的损失对训练稳定性至关重要;若将其移除,将导致收敛困难和性能极差,表明其在训练初期起到了关键的引导作用。
  • 在 DUC-2003 和 DUC-2004 数据集上,SEQ^3 表现具有竞争力,尽管在 DUC-2003 上未超越前缀基线,表明其在处理某些输入类型时仍存在局限性。
  • 定性分析表明,SEQ^3 同时展现出抽取式与生成式行为:当重建更简单时,会复制早期词汇;而在适当情况下,也能对多词短语进行压缩并改写为单个内容词。
  • 该模型对分布偏移具有鲁棒性,即使未在 DUC 数据集上进行微调,也能从 Gigaword 训练数据良好泛化到 DUC 基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。