Skip to main content
QUICK REVIEW

[论文解读] YACLC: A Chinese Learner Corpus with Multidimensional Annotation

Yingying Wang, Cunliang Kong|arXiv (Cornell University)|Dec 30, 2021
Natural Language Processing Techniques被引用 10
一句话总结

本文介绍了YACLC,这是一个大规模中文学习者语料库,具有多维标注,包括语法错误更正和语感提升。该语料库通过定制的众包平台构建,每句话由10名标注员处理,共包含469,000次修订,覆盖32,124个学习者书写的句子,为推进中文第二语言习得和自动语法错误纠正研究提供了高质量、意图保持不变的标注数据。

ABSTRACT

Learner corpus collects language data produced by L2 learners, that is second or foreign-language learners. This resource is of great relevance for second language acquisition research, foreign-language teaching, and automatic grammatical error correction. However, there is little focus on learner corpus for Chinese as Foreign Language (CFL) learners. Therefore, we propose to construct a large-scale, multidimensional annotated Chinese learner corpus. To construct the corpus, we first obtain a large number of topic-rich texts generated by CFL learners. Then we design an annotation scheme including a sentence acceptability score as well as grammatical error and fluency-based corrections. We build a crowdsourcing platform to perform the annotation effectively (https://yaclc.wenmind.net). We name the corpus YACLC (Yet Another Chinese Learner Corpus) and release it as part of the CUGE benchmark (http://cuge.baai.ac.cn). By analyzing the original sentences and annotations in the corpus, we found that YACLC has a considerable size and very high annotation quality. We hope this corpus can further enhance the studies on Chinese International Education and Chinese automatic grammatical error correction.

研究动机与目标

  • 为解决中文作为第二语言(CFL)学习者缺乏大规模、高质量、带有详细错误标注的语料库的问题。
  • 通过提供丰富、标注详尽的训练数据,提升中文自动语法错误纠正(GEC)模型的准确性和流畅度。
  • 通过支持教师和研究人员系统分析学习者错误,促进中文国际教育的发展。
  • 开发一种可扩展、高质量的多维标注框架,用于学习者生成的中文文本的多维更正。

提出的方法

  • 从lang-8平台收集32,124个学习者书写的句子,代表主题丰富、自然生成的第二语言产出。
  • 设计一种多维标注方案,区分语法更正(最小编辑)和语感更正(更自然的表达改进)。
  • 构建一个带有可视化界面、热键操作和双标签机制(G表示语法,F表示语感)的定制众包平台,以确保标注的一致性与效率。
  • 应用四种核心操作——添加、删除、替换和重排——实现精确的词级别修订,以词作为最小标注单元。
  • 通过去重相同修订和将最终语料库整理为JSON格式,完成标注后处理,以便公开发布。
  • 使用Cohen's Kappa系数(平均值为0.38)评估标注质量,以衡量可接受度评分的标注者间一致性。

实验结果

研究问题

  • RQ1如何构建一个具有多维错误标注的大规模、高质量中文学习者语料库?
  • RQ2学习者生成的中文句子中,语法更正与语感更正的分布特征和性质如何?
  • RQ3多位标注员对学习者句子可接受度的判断一致性如何?更正的一致性程度如何?
  • RQ4众包标注平台能否有效支持中文学习者文本的细粒度、多维更正?

主要发现

  • YACLC包含32,124个原始句子,共469,000次修订,平均每句14.6次修订,表明标注密度高且覆盖全面。
  • 语料库包含331,292次语法更正和137,708次语感更正,语法更正的分布比语感更正更为均衡。
  • 可接受度评分的平均标注者间一致性(Cohen's Kappa)达到0.38,表明标注员之间具有一致的公平程度。
  • 该语料库作为CUGE基准的一部分发布,确保了其在中文第二语言习得和自动语法错误纠正研究中的可及性。
  • 标注方案在有效保持原始学习者意图的同时,实现了语法正确性与母语语感的精确、最小化编辑。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。