Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Sentence Compression using Denoising Auto-Encoders

Thibault Févry, Jason Phang|arXiv (Cornell University)|Sep 7, 2018
Natural Language Processing Techniques被引用 4
一句话总结

本文提出了一种完全无监督的句子压缩方法,采用去噪自编码器架构,通过在单语语料上对句子进行词语乱序和噪声注入来训练,然后重建原始句子。尽管未接触过原始句与压缩句的配对数据,该模型仍能生成语法正确且语义保留的摘要,其在人工评估中的表现与监督模型相当,但在ROUGE指标上表现较差。

ABSTRACT

In sentence compression, the task of shortening sentences while retaining the original meaning, models tend to be trained on large corpora containing pairs of verbose and compressed sentences. To remove the need for paired corpora, we emulate a summarization task and add noise to extend sentences and train a denoising auto-encoder to recover the original, constructing an end-to-end training regime without the need for any examples of compressed sentences. We conduct a human evaluation of our model on a standard text summarization dataset and show that it performs comparably to a supervised baseline based on grammatical correctness and retention of meaning. Despite being exposed to no target data, our unsupervised models learn to generate imperfect but reasonably readable sentence summaries. Although we underperform supervised models based on ROUGE scores, our models are competitive with a supervised baseline based on human evaluation for grammatical correctness and retention of meaning.

研究动机与目标

  • 开发一种无需原始句与压缩句配对数据的句子压缩模型。
  • 探究去噪自编码器是否能通过在单语语料上进行无监督预训练,学习到句子压缩能力。
  • 在无法访问目标摘要的情况下,评估模型在语法正确性和语义保留方面的表现。
  • 研究句子嵌入对模型输出质量及ROUGE得分的影响。
  • 通过与人工评估对比,评估ROUGE作为摘要质量指标的局限性。

提出的方法

  • 该模型使用去噪自编码器架构,基于单一单语语料中句子的损坏版本进行训练。
  • 通过词语乱序和随机标记噪声对输入句子进行破坏,以模拟‘噪声’输入。
  • 模型通过从损坏输入中重建原始句子,隐式学习压缩能力。
  • 通过控制目标输出长度对模型进行条件化,从而生成不同压缩程度的摘要。
  • 使用句子嵌入(如InferSent)对模型进行条件化,尽管这在人工评估中带来了权衡。
  • 训练为端到端的完全无监督过程,仅依赖单一单语语料,无需并行数据。

实验结果

研究问题

  • RQ1去噪自编码器是否能在无任何配对训练样本的情况下,学习到有效的句子压缩?
  • RQ2在人工评估中,无监督模型在语法正确性和语义保留方面的表现与监督基线相比如何?
  • RQ3使用句子嵌入对模型进行条件化,是否能提升或降低压缩输出的质量?
  • RQ4ROUGE得分在多大程度上与人工对摘要质量的判断相关?
  • RQ5模型能否通过学习去噪损坏句子,生成有意义且语法正确的摘要?

主要发现

  • 无监督去噪自编码器模型生成的压缩句子语法正确且保留原始语义,在人工评估中与监督基线表现相当。
  • 尽管在ROUGE指标上表现较差,特别是在F1分数上,但当使用句子嵌入时,人工评估者认为该模型的输出比监督模型更准确、更自然。
  • 引入InferSent句子嵌入虽提升了ROUGE得分,但显著降低了人工评估中对语法和语义保留的评分。
  • 通过控制目标输出长度,模型可生成不同长度的摘要,从而实现对压缩程度的控制。
  • 模型通过从乱序和噪声输入中恢复结构,学习到句子压缩,表明去噪可隐式学习压缩模式。
  • 发现ROUGE得分难以作为人工评估的可靠代理,常与可理解性或语义保真度不相关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。