Skip to main content
QUICK REVIEW

[论文解读] Neural CRF Model for Sentence Alignment in Text Simplification

Chao Jiang, Mounica Maddela|arXiv (Cornell University)|May 5, 2020
Text Readability and Simplification参考文献 54被引用 4
一句话总结

本文提出一种神经条件随机场(CRF)模型,用于文本简化中的单语句对齐,结合微调后的 BERT 以计算语义相似性,并利用 CRF 解码来利用句子顺序和编辑模式。该方法在先前工作的基础上实现了超过 5 个 F1 分数点的提升,并由此构建了两个新的、更高品质的数据集(Newsela-Auto 和 Wiki-Auto),进而训练了一个以 BERT 初始化的 Transformer 模型,在文本简化性能上达到了新的 SOTA 水平。

ABSTRACT

The success of a text simplification system heavily depends on the quality and quantity of complex-simple sentence pairs in the training corpus, which are extracted by aligning sentences between parallel articles. To evaluate and improve sentence alignment quality, we create two manually annotated sentence-aligned datasets from two commonly used text simplification corpora, Newsela and Wikipedia. We propose a novel neural CRF alignment model which not only leverages the sequential nature of sentences in parallel documents but also utilizes a neural sentence pair model to capture semantic similarity. Experiments demonstrate that our proposed approach outperforms all the previous work on monolingual sentence alignment task by more than 5 points in F1. We apply our CRF aligner to construct two new text simplification datasets, Newsela-Auto and Wiki-Auto, which are much larger and of better quality compared to the existing datasets. A Transformer-based seq2seq model trained on our datasets establishes a new state-of-the-art for text simplification in both automatic and human evaluation.

研究动机与目标

  • 为解决现有文本简化数据集质量差、规模小的问题,这些数据集通常基于表面层面的相似性度量构建,难以捕捉语义上的重述现象。
  • 开发一种更精确的句子对齐方法,以同时捕捉并行复杂-简单文本对中的语义相似性与序列结构。
  • 通过大规模应用所提出的对齐模型,构建新的、高质量的文本简化训练数据集。
  • 在新构建的数据集上训练一个 SOTA 水平的文本简化模型,并在自动评估与人工评估中评估其性能。
  • 通过创建首个高质量、人工标注的数据集(Newsela-Manual 与 Wiki-Manual),实现对单语句子对齐的系统性研究。

提出的方法

  • 该模型采用神经 CRF 框架,联合建模句子对齐,利用并行文档中句子之间的序列依赖关系。
  • 采用微调后的 BERT 模型计算句子对的密集语义表征,以捕捉超出词汇重叠的重述与语义等价关系。
  • 首先应用段落级对齐算法,利用语义相似性与邻近性对齐对应段落,再进行句子级对齐。
  • CRF 层施加结构约束,如单调性、一对一或一对多对齐,以确保合理的编辑操作(如拆分与扩展)得以实现。
  • 模型在人工标注的 Newsela-Manual 与 Wiki-Manual 数据集上进行端到端训练,以学习对齐模式。
  • 训练完成的模型随后被大规模应用于 1,882 个 Newsela 文章集与 138,095 对 Wikipedia 文章,以构建 Newsela-Auto 与 Wiki-Auto 数据集。

实验结果

研究问题

  • RQ1结合基于 BERT 的语义相似性与序列建模的神经 CRF 模型,是否能在单语句子对齐任务中超越现有的基于表面相似性的方法?
  • RQ2所提出的对齐模型在多大程度上提升了文本简化训练数据的质量与多样性?
  • RQ3在新构建的数据集上训练基于 Transformer 的文本简化模型,是否能在自动评估与人工评估中均取得性能提升?
  • RQ4该模型在捕捉重述方面的能力,与在现有低质量数据集上训练的模型相比如何?
  • RQ5所提出的对齐方法是否能有效扩展至大规模、真实世界中的文本简化语料?

主要发现

  • 所提出的神经 CRF 模型在基准评估中,相较于所有先前的单语句子对齐方法,F1 分数提升超过 5 个点。
  • 当在新构建的 Newsela-Auto 数据集上训练以 BERT 初始化的 Transformer 模型时,SARI 分数相比在原始 Newsela 数据集上训练的模型提升了 3.4 个百分点。
  • 在 Newsela-Auto 数据集上训练的 Transformer 模型,其生成结果中的重述与删除操作比在原始 Newsela 数据集上训练的模型多出 25%,表明生成内容的语言多样性更高。
  • 新构建的数据集 Newsela-Auto(666,645 对句子)与 Wiki-Auto(488,332 对句子)的规模分别为各自现有对应数据集的 4.7 倍与 1.6 倍。
  • 人工评估显示,基于新数据集训练的模型在流畅性、语义完整性与整体质量方面均显著优于当前 SOTA 系统。
  • 对 50 个 Newsela 文章集与 500 个 Wikipedia 文章对(即 Newsela-Manual 与 Wiki-Manual)进行人工标注,首次提供了高质量的基准数据集,用于训练与评估句子对齐模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。