Skip to main content
QUICK REVIEW

[论文解读] Importance-Aware Learning for Neural Headline Editing

Qingyang Wu, Lei Li|arXiv (Cornell University)|Nov 25, 2019
Topic Modeling参考文献 16被引用 7
一句话总结

本文提出了一种神经标题编辑模型,通过预训练、针对标题生成的微调以及自注意力重要性感知(SIA)损失,在低资源环境下提升标题质量。通过降低易学习样本的权重并聚焦于更难的编辑任务,该模型减少了重复性,生成了更具专业性、更符合人类偏好的标题,优于基线方法。

ABSTRACT

Many social media news writers are not professionally trained. Therefore, social media platforms have to hire professional editors to adjust amateur headlines to attract more readers. We propose to automate this headline editing process through neural network models to provide more immediate writing support for these social media news writers. To train such a neural headline editing model, we collected a dataset which contains articles with original headlines and professionally edited headlines. However, it is expensive to collect a large number of professionally edited headlines. To solve this low-resource problem, we design an encoder-decoder model which leverages large scale pre-trained language models. We further improve the pre-trained model's quality by introducing a headline generation task as an intermediate task before the headline editing task. Also, we propose Self Importance-Aware (SIA) loss to address the different levels of editing in the dataset by down-weighting the importance of easily classified tokens and sentences. With the help of Pre-training, Adaptation, and SIA, the model learns to generate headlines in the professional editor's style. Experimental results show that our method significantly improves the quality of headline editing comparing against previous methods.

研究动机与目标

  • 为解决低资源标题编辑挑战,构建一个高质量的专业编辑中文标题数据集。
  • 通过预训练语言模型和多阶段训练,在低资源设置下提升标题生成质量。
  • 通过一种新型损失函数,优先关注更难的样本,减少生成标题中的重复性和通用模式。
  • 开发一种能够学习专业编辑风格细微差别的模型,适用于真实世界社交媒体应用。

提出的方法

  • 模型采用基于Transformer的编码器-解码器架构,编码器使用中文BERT,解码器使用自定义中文-GPT。
  • 采用三阶段训练流程:在大规模中文语料上进行预训练,在标题生成任务上进行微调,最后在PHED数据集上进行精调。
  • 自注意力重要性感知(SIA)损失通过为频繁编辑的词元和句子分配较低重要性,动态降低易样本的权重。
  • SIA损失函数定义为加权交叉熵损失,其中权重根据样本难度学习得到,难度更高的样本获得更高权重。
  • 模型在PHED数据集上进行微调,该数据集包含来自社交媒体文章的20,994对专业编辑后的标题对。
  • 通过将标题生成作为辅助任务,提升模型泛化能力,使其归纳偏差与编辑任务更一致。

实验结果

研究问题

  • RQ1在小规模、经专业筛选的数据集上微调时,预训练序列到序列模型能否有效生成高质量标题?
  • RQ2引入中间标题生成微调任务在多大程度上提升了标题编辑任务的性能?
  • RQ3自注意力重要性感知(SIA)损失在多大程度上减少了低资源标题编辑中的重复性并提升了生成质量?
  • RQ4SIA损失是否有效优先学习更难的样本,从而在复杂编辑任务上取得更好性能?
  • RQ5在真实世界偏好设置下,该模型的性能与人工撰写的原始标题相比如何?

主要发现

  • 采用SIA损失的模型相比无SIA的基线模型,人类偏好率提高了17.4%。
  • 在仅比较不同标题时,人类评估者对SIA模型的偏好度比非SIA模型高出23.0%,证实SIA在减少重复性方面的有效性。
  • 在人类评估中,该模型生成的标题比原始作者标题更受青睐107%,表明其与专业编辑风格高度一致。
  • SIA模型有效减少了通用模式和重复现象,该结论得到自动指标(BLEU-4、ROUGE-L)和人工评估的双重验证。
  • 微调阶段显著提升了性能,完整模型(PAS)在人类偏好度上比原始标题基线高出57.4%。
  • 即使仅使用20,994个样本的小型数据集,三阶段训练流程(预训练、微调、SIA精调)仍实现了标题编辑质量的最先进水平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。