Skip to main content
QUICK REVIEW

[论文解读] Simple-QE: Better Automatic Quality Estimation for Text Simplification

Reno Kriz, Marianna Apidianaki|arXiv (Cornell University)|Dec 22, 2020
Text Readability and Simplification参考文献 22被引用 6
一句话总结

该论文提出 Simple-QE,一种基于 BERT 的文本简化质量评估模型,可在无需人工参考文本的情况下预测流畅性、充分性和复杂性。通过适配 Sum-QE 框架并引入原始句子特征,Simple-QE 在系统输出上与人类判断的相关性达到高水平(r=0.650),并在复杂性预测方面优于基线模型,尤其在文档级别表现突出(r=0.964)。

ABSTRACT

Text simplification systems generate versions of texts that are easier to understand for a broader audience. The quality of simplified texts is generally estimated using metrics that compare to human references, which can be difficult to obtain. We propose Simple-QE, a BERT-based quality estimation (QE) model adapted from prior summarization QE work, and show that it correlates well with human quality judgments. Simple-QE does not require human references, which makes the model useful in a practical setting where users would need to be informed about the quality of generated simplifications. We also show that we can adapt this approach to accurately predict the complexity of human-written texts.

研究动机与目标

  • 开发一种不依赖人工参考文本的文本简化质量评估模型。
  • 改进 BLEU 和 SARI 等依赖参考文本的指标,这些指标与文本简化特有的质量维度相关性较差。
  • 将基于 BERT 的质量评估方法从摘要任务(Sum-QE)适配至文本简化任务。
  • 实现在实际简化系统和人工简化工作流中质量评估的实用化部署。
  • 探索模型预测人类撰写文本复杂性(包括文档级别)的能力。

提出的方法

  • 将多任务 BERT 基础的 Sum-QE 模型适配为预测简化文本中的三种语言质量:流畅性、充分性和复杂性。
  • 在回归头上微调 BERT,利用人工标注的判断预测流畅性、充分性和复杂性的连续得分。
  • 引入原始复杂句子的数值特征(如句子长度、句法树高度)以及系统输出特征以提升预测性能。
  • 采用单任务(S-1)和多任务(M-1、M-3)训练设置,其中 M-3 在共享模型中联合学习全部三项质量得分。
  • 应用长度加权平均方法,将子文档级别的预测结果合并,以实现文档级别的复杂性估计。
  • 在自动简化输出以及 Newsela 语料库和 Wikipedia 中的人工简化文本上评估模型。

实验结果

研究问题

  • RQ1能否在无需人工参考文本的情况下,将基于摘要任务训练的 BERT 质量评估模型有效适配至文本简化任务?
  • RQ2Simple-QE 在自动生成的简化文本中,与人类对流畅性、充分性和复杂性的判断相关性如何?
  • RQ3模型能否准确预测人类撰写简化文本的复杂性,尤其是在文档级别?
  • RQ4引入数值特征(如句子长度、句法树高度)在多大程度上提升了预测性能?
  • RQ5模型在域外文本(如 Wikipedia 文章)上的泛化能力如何?

主要发现

  • Simple-QE 在系统生成的简化文本上与人类判断的相关性达到:流畅性 r=0.650,充分性 r=0.538,复杂性 r=0.436。
  • 多任务模型(M-3 All)优于单任务和其他基线模型,表明联合学习质量维度可提升性能。
  • 在 Newsela 语料库的句子级别复杂性预测中,Simple-QE S-1 的相关性达到 0.726,优于基于特征的基线模型(如 LinReg: 0.574)。
  • 在文档级别,Simple-QE S-1 与人类复杂性判断的相关性达到 0.964,显著优于最佳基线模型(LinReg: 0.919)。
  • 模型在域外文本上具有良好的泛化能力,在平行的简易版与标准版 Wikipedia 文档中,复杂性预测的皮尔逊相关系数达到 0.729。
  • 句子长度是最具预测力的特征,但通过 BERT 微调将该特征与其他特征结合,其性能显著优于仅使用线性模型的情况。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。