Skip to main content
QUICK REVIEW

[论文解读] Headline Generation: Learning from Decomposed Document Titles.

Oleg Vasilyev, Tom Grek|arXiv (Cornell University)|Apr 17, 2019
Topic Modeling参考文献 14被引用 9
一句话总结

本文提出了一种新颖的标题生成方法,将标题生成任务重新构架为基于深度神经网络的序列式问答任务,该网络在150万份文档-标题配对数据上进行训练,且标题词汇可分解。在双盲评估中,人类评价认为该模型生成的标题与人工撰写的标题相当或更优,表明其在自动标题生成任务中表现强劲。

ABSTRACT

We propose a novel method for generating titles for unstructured text documents. We reframe the problem as a sequential question-answering task. A deep neural network is trained on document-title pairs with decomposable titles, meaning that the vocabulary of the title is a subset of the vocabulary of the document. To train the model we use a corpus of millions of publicly available document-title pairs: news articles and headlines. We present the results of a randomized double-blind trial in which subjects were unaware of which titles were human or machine-generated. When trained on approximately 1.5 million news articles, the model generates headlines that humans judge to be as good or better than the original human-written headlines in the majority of cases.

研究动机与目标

  • 通过将标题生成重新构架为序列式问答任务,以改进自动标题生成。
  • 利用大规模、公开可用的文档-标题配对数据(标题词汇可分解)进行训练。
  • 开发一种模型,其生成的标题在人类评价中被认为与人工撰写的标题相当或更优。
  • 在双盲人类评估设置下评估模型生成的标题,以确保评估无偏见。

提出的方法

  • 该模型将标题生成视为序列式问答任务,其中标题中的每个词均基于对文档的上下文理解进行预测。
  • 使用数百万份文档-标题配对数据对深度神经网络进行训练,其中标题的词汇是文档词汇的子集(即可分解标题)。
  • 训练语料库由公开可用的新闻文章及其对应标题组成,支持大规模预训练。
  • 模型使用注意力机制,将相关文档内容与标题生成步骤对齐。
  • 该架构经过优化,以生成流畅、简洁且信息丰富的标题,准确反映文档的核心内容。
  • 评估通过随机双盲试验进行,人类标注者在不知晓来源的情况下评估标题质量。

实验结果

研究问题

  • RQ1在可分解文档-标题配对数据上进行训练的神经网络,能否生成在人类感知中与人工标题相当或更优的标题?
  • RQ2与标准序列到序列模型相比,序列式问答任务框架在标题生成方面有何改进?
  • RQ3该模型在仅使用可分解标题监督的情况下,能在多大程度上泛化到多样化的新闻文章并生成高质量标题?
  • RQ4在双盲人类评估设置下,该模型的性能是否依然稳健?

主要发现

  • 在大多数情况下,人类评价认为模型生成的标题与人工撰写的标题相当或更优。
  • 在随机双盲试验中,人类评估者无法可靠地区分机器生成与人工撰写的标题。
  • 当在约150万篇新闻文章及其对应标题上进行训练时,该模型表现出强劲性能。
  • 使用可分解标题可实现有效监督,并提升训练稳定性和泛化能力。
  • 序列式问答方法相比基线方法,能生成更连贯、更符合上下文的标题。
  • 结果表明,基于大规模公开数据的端到端训练,可生成与人类表现相当的标题生成系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。