Skip to main content
QUICK REVIEW

[论文解读] Encoder-Decoder Models Can Benefit from Pre-trained Masked Language Models in Grammatical Error Correction

Masahiro Kaneko, Masato Mita|arXiv (Cornell University)|May 3, 2020
Natural Language Processing Techniques参考文献 36被引用 7
一句话总结

本文提出了一种新颖的方法,通过在 GEC 特定数据上微调预训练的掩码语言模型(MLM),例如 BERT,来增强编码器-解码器模型在语法错误修正(GEC)任务中的表现。随后,将该模型的上下文表示作为额外特征引入 GEC 模型中。该方法,特别是 BERT-fuse GED(在语法错误检测任务上微调),在 BEA-2019 和 CoNLL-2014 基准测试中达到了最先进性能,优于标准初始化和特征融合方法。

ABSTRACT

This paper investigates how to effectively incorporate a pre-trained masked language model (MLM), such as BERT, into an encoder-decoder (EncDec) model for grammatical error correction (GEC). The answer to this question is not as straightforward as one might expect because the previous common methods for incorporating a MLM into an EncDec model have potential drawbacks when applied to GEC. For example, the distribution of the inputs to a GEC model can be considerably different (erroneous, clumsy, etc.) from that of the corpora used for pre-training MLMs; however, this issue is not addressed in the previous methods. Our experiments show that our proposed method, where we first fine-tune a MLM with a given GEC corpus and then use the output of the fine-tuned MLM as additional features in the GEC model, maximizes the benefit of the MLM. The best-performing model achieves state-of-the-art performances on the BEA-2019 and CoNLL-2014 benchmarks. Our code is publicly available at: https://github.com/kanekomasahiro/bert-gec.

研究动机与目标

  • 解决预训练 MLM(如 BERT)在语法正确的文本上进行训练,而与 GEC 语料库中典型的错误输入分布之间存在的差距。
  • 探究标准的 MLM 集成方法(如初始化或特征融合)是否能有效提升 GEC 性能。
  • 提出并评估一种新方法:在将 MLM 表示作为特征引入 GEC 模型之前,先在 GEC 数据上对其进行微调。
  • 确定针对特定任务的 MLM 微调是否能增强其在序列到序列 GEC 模型中的实用性。

提出的方法

  • 使用语法错误检测(GED)任务在 GEC 语料库上微调预训练的 BERT 模型,以使其表示适应包含错误的输入分布。
  • 将微调后 BERT 模型最后一层的上下文表示作为额外输入特征,输入到编码器-解码器 GEC 模型中。
  • 将该方法(BERT-fuse GED)与标准方法进行比较:BERT 初始化(BERT-init)和使用预训练 BERT 的特征融合(BERT-fuse)。
  • 此外,还评估了一种子方法:直接在 GEC 修正任务上微调 BERT(BERT-fuse mask),以进行对比。
  • 通过 R2L 重排序技术组合表现最佳的模型,以进一步提升性能。
  • 使用 ERRANT 工具包评估不同错误类型下的性能,包括时态、冠词、介词和标点符号错误。

实验结果

研究问题

  • RQ1预训练的掩码语言模型(如 BERT)能否提升编码器-解码器模型在语法错误修正任务中的性能?
  • RQ2在 GEC 特定数据上微调预训练 MLM 是否能带来优于其原始预训练状态的性能提升?
  • RQ3在不同错误类型下,BERT-fuse GED 的 F0.5 分数与 BERT-init 和 BERT-fuse 相比如何?
  • RQ4将微调后的 BERT 表示作为额外特征,是否能带来优于直接使用 BERT 参数进行模型初始化的性能提升?
  • RQ5结合 BERT-fuse GED 方法与集成及重排序技术,能否在标准 GEC 基准测试中实现最先进性能?

主要发现

  • BERT-fuse GED 方法(在语法错误检测任务上微调 BERT 后,再将其表示作为特征使用)在所有评估数据集上均优于 BERT-init 和 BERT-fuse。
  • BERT-fuse GED 模型在 BEA-2019 和 CoNLL-2014 基准测试中达到了最先进性能,当使用模型集成时,F0.5 分数提升了 0.2 分。
  • 微调后的 BERT 表示在隐藏空间中能清晰区分正确与错误的词语使用,而原始 BERT 则无法实现这种分离。
  • 该方法在所有主要错误类型中均提升了性能,包括 VERB:TENSE、DET、PREP 和 PUNCT,F0.5 分数提升范围为 1.3 至 4.4 分。
  • 隐藏表示的可视化结果证实,微调后的 BERT 学会了编码语法错误信息,为正确和错误的词语使用形成了明确的聚类。
  • BERT-fuse GED 模型始终优于 BERT-fuse mask,表明 GED 专用微调能更有效地将 MLM 的表示与 GEC 任务对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。