Skip to main content
QUICK REVIEW

[论文解读] Evaluating the Capability of Large-scale Language Models on Chinese Grammatical Error Correction Task

Fanyi Qu, Tang, Chenming|arXiv (Cornell University)|Jul 8, 2023
Natural Language Processing TechniquesComputer Science被引用 3
一句话总结

本研究在四个中文语法错误修正(GEC)数据集上评估了三种大语言模型(ChatGPT、ChatGLM-6B 和 LLaMA-7B),发现尽管这些模型在语言流畅性生成方面表现良好,但由于过度修正和对数据分布的敏感性,其性能仍落后于当前最先进(SOTA)模型。关键发现是:模型在不同数据集上的表现差异显著,其在学习者生成的错误上表现优异,但在母语者考试类错误上表现不佳,凸显了在错误检测与修正策略上需进行针对性优化的必要性。

ABSTRACT

Large-scale language models (LLMs) has shown remarkable capability in various of Natural Language Processing (NLP) tasks and attracted lots of attention recently. However, some studies indicated that large language models fail to achieve promising result beyond the state-of-the-art models in English grammatical error correction (GEC) tasks. In this report, we aim to explore the how large language models perform on Chinese grammatical error correction tasks and provide guidance for future work. We conduct experiments with 3 different LLMs of different model scale on 4 Chinese GEC dataset. Our experimental results indicate that the performances of LLMs on automatic evaluation metrics falls short of the previous sota models because of the problem of over-correction. Furthermore, we also discover notable variations in the performance of LLMs when evaluated on different data distributions. Our findings demonstrates that further investigation is required for the application of LLMs on Chinese GEC task.

研究动机与目标

  • 评估大规模语言模型(LLMs)在中文语法错误修正(GEC)任务中的表现。
  • 探究模型规模与架构如何影响不同数据分布下LLMs在GEC任务中的表现。
  • 识别基于LLM的GEC系统中系统性问题,如过度修正和数据分布偏差。
  • 使用标准化指标在多样化的中文GEC数据集上,将LLMs与当前最先进(SOTA)的GEC模型进行对比。
  • 为提升LLMs在低资源和特定领域GEC应用中的表现提供可操作的见解。

提出的方法

  • 在四个中文GEC数据集(NLPCC、MuCGEC、FCGEC 和 NaCGEC)上评估了三种LLM:GPT-3.5-turbo、ChatGLM-6B 和 LLaMA-7B。
  • 针对每种模型的指令微调风格,应用了不同但语义一致的提示,以确保任务定义的一致性。
  • 采用词级别和字符级别的F0.5、精确率和召回率指标,并使用MaxMatch(M²)和ChERRANT评分器进行评估。
  • 实验中,ChatGPT使用温度=0.6,ChatGLM-6B 和 LLaMA-7B 在 4× NVIDIA 3080 Ti GPU 上进行推理。
  • 分析了两类数据:学习者生成的错误(NLPCC、MuCGEC)和母语者考试类错误(FCGEC、NaCGEC)的模型行为。
  • 通过对比不同模型规模和数据分布下的结果,分离出性能差异与错误模式。
Figure 1: The prompt for three LLMs.
Figure 1: The prompt for three LLMs.

实验结果

研究问题

  • RQ1与当前最先进(SOTA)模型相比,大语言模型在中文GEC任务中的表现如何?(基于标准评估指标)
  • RQ2模型规模在多大程度上影响LLMs在中文GEC任务中的表现?
  • RQ3测试集的数据分布(如学习者错误与母语者错误)在多大程度上影响LLMs在GEC中的表现?
  • RQ4基于LLM的中文GEC系统中,过度修正的性质及其影响是什么?
  • RQ5为何在基于LLM的GEC评估中,字符级别指标始终显著低于词级别指标?

主要发现

  • LLMs(包括GPT-3.5-turbo)的表现落后于SOTA模型,在NLPCC上仅取得29.60的F0.5(SOTA为42.11),在MuCGEC上为36.61(SOTA为50.59)。
  • 过度修正是主要问题:LLMs频繁修改原本正确或语境恰当的短语,导致语义漂移,尤其在母语者测试集上更为明显。
  • 性能因数据分布而异显著:LLMs在学习者生成的错误上表现更好(如MuCGEC上F0.5为36.61),但在母语者考试类错误上表现较差(如NaCGEC上F0.5仅为11.20)。
  • ChatGPT的召回率高于较小模型(如NLPCC上为33.92 vs. 7.98),表明其错误检测能力更强,但精确率较低(28.69 vs. 17.63),暗示存在过度修正问题。
  • 字符级别指标显著低于词级别指标(如NLPCC上为19.33 vs. 29.60 F0.5),这一差异此前未被报道,且尚不完全清楚其成因。
  • LLMs与SOTA模型之间的性能差距在母语者考试数据中发现的复杂结构错误上最为显著,表明其在更高阶语法现象上的泛化能力有限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。