Skip to main content
QUICK REVIEW

[论文解读] Abstractive Document Summarization without Parallel Data

Nikola I. Nikolov, Richard H. R. Hahnloser|arXiv (Cornell University)|Jul 30, 2019
Topic Modeling参考文献 28被引用 5
一句话总结

该论文提出了一种无需平行文章-摘要对的摘要生成系统,仅使用示例摘要和不匹配的文章进行训练。该方法结合了无监督句子抽取模型与基于伪平行数据和回译生成的合成数据进行训练的句子抽象模型,在CNN/DailyMail数据集上表现具有竞争力,并在科学新闻稿生成任务中展现出良好前景,证明了其在低资源场景下的可行性。

ABSTRACT

Abstractive summarization typically relies on large collections of paired articles and summaries. However, in many cases, parallel data is scarce and costly to obtain. We develop an abstractive summarization system that relies only on large collections of example summaries and non-matching articles. Our approach consists of an unsupervised sentence extractor that selects salient sentences to include in the final summary, as well as a sentence abstractor that is trained on pseudo-parallel and synthetic data, that paraphrases each of the extracted sentences. We perform an extensive evaluation of our method: on the CNN/DailyMail benchmark, on which we compare our approach to fully supervised baselines, as well as on the novel task of automatically generating a press release from a scientific journal article, which is well suited for our system. We show promising performance on both tasks, without relying on any article-summary pairs.

研究动机与目标

  • 解决在缺乏或无法获取平行文章-摘要对的低资源环境下,抽象式摘要生成的挑战。
  • 开发一种仅依赖示例摘要和不匹配文章的系统,避免对昂贵平行语料库的依赖。
  • 实现在科学出版等领域的有效抽象式摘要生成,这些领域中的对齐数据有限。
  • 证明无监督抽取与数据增强抽象相结合的方法可在性能上媲美监督基线模型。
  • 探索一项新任务:在无平行训练数据的情况下,从科学期刊文章生成新闻稿。

提出的方法

  • 使用无监督抽取模型(如Lead或LexRank)从输入文章中识别关键句子。
  • 通过大规模基于嵌入的匹配方法,将摘要中的句子与不匹配文章中的句子对齐,构建伪平行句子对。
  • 在伪平行对上训练回译模型,从摘要句子生成合成的文章句子。
  • 在伪平行对与回译生成的合成数据组合上训练句子抽象模型(P_PM),以改写抽取的句子。
  • 将抽象模型应用于重述选定句子,生成更流畅、更紧凑且适配特定领域的摘要。
  • 将最终抽象后的句子作为输出摘要,实现无重复使用完整原文句子的抽象式压缩。

实验结果

研究问题

  • RQ1是否可以在不使用任何平行文章-摘要对的情况下,有效训练抽象式摘要模型?
  • RQ2基于伪平行和合成数据的系统在标准基准测试上与完全监督基线模型相比表现如何?
  • RQ3此类方法是否能泛化到低资源、特定领域任务,如从科学文章生成新闻稿?
  • RQ4无监督句子抽取与数据增强抽象相结合,能在多大程度上生成流畅且信息丰富的摘要?
  • RQ5在不同摘要生成任务中,监督方法与非平行方法之间的性能差距如何?

主要发现

  • 在CNN/DailyMail基准测试中,尽管未使用任何平行训练数据,该方法的性能与完全监督的LSTM抽象模型相比仍具有竞争力。
  • 在科学新闻稿生成任务中,该系统优于无监督抽取基线模型(Lead和LexRank),证明了抽象能力的优势。
  • 抽象模型能够有效压缩和重述句子,常将技术性表达替换为更适合新闻稿的通俗语言。
  • 在回译合成数据上训练的模型表现出保守的改写风格,保留了大部分原始句子结构,同时实现了有意义的压缩。
  • 抽取基线模型与理想抽取摘要(oracle)之间的性能差距较小,表明在低资源环境下,抽象式摘要对高质量结果至关重要。
  • 抽象模型的最终训练数据集包含860万组伪平行与合成句子对,实现了无需平行监督的有效预训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。