[论文解读] YACLC: A Chinese Learner Corpus with Multidimensional Annotation
本文介绍了YACLC,这是一个大规模中文学习者语料库,具有多维标注,包括语法错误更正和语感提升。该语料库通过定制的众包平台构建,每句话由10名标注员处理,共包含469,000次修订,覆盖32,124个学习者书写的句子,为推进中文第二语言习得和自动语法错误纠正研究提供了高质量、意图保持不变的标注数据。
Learner corpus collects language data produced by L2 learners, that is second or foreign-language learners. This resource is of great relevance for second language acquisition research, foreign-language teaching, and automatic grammatical error correction. However, there is little focus on learner corpus for Chinese as Foreign Language (CFL) learners. Therefore, we propose to construct a large-scale, multidimensional annotated Chinese learner corpus. To construct the corpus, we first obtain a large number of topic-rich texts generated by CFL learners. Then we design an annotation scheme including a sentence acceptability score as well as grammatical error and fluency-based corrections. We build a crowdsourcing platform to perform the annotation effectively (https://yaclc.wenmind.net). We name the corpus YACLC (Yet Another Chinese Learner Corpus) and release it as part of the CUGE benchmark (http://cuge.baai.ac.cn). By analyzing the original sentences and annotations in the corpus, we found that YACLC has a considerable size and very high annotation quality. We hope this corpus can further enhance the studies on Chinese International Education and Chinese automatic grammatical error correction.
研究动机与目标
- 为解决中文作为第二语言(CFL)学习者缺乏大规模、高质量、带有详细错误标注的语料库的问题。
- 通过提供丰富、标注详尽的训练数据,提升中文自动语法错误纠正(GEC)模型的准确性和流畅度。
- 通过支持教师和研究人员系统分析学习者错误,促进中文国际教育的发展。
- 开发一种可扩展、高质量的多维标注框架,用于学习者生成的中文文本的多维更正。
提出的方法
- 从lang-8平台收集32,124个学习者书写的句子,代表主题丰富、自然生成的第二语言产出。
- 设计一种多维标注方案,区分语法更正(最小编辑)和语感更正(更自然的表达改进)。
- 构建一个带有可视化界面、热键操作和双标签机制(G表示语法,F表示语感)的定制众包平台,以确保标注的一致性与效率。
- 应用四种核心操作——添加、删除、替换和重排——实现精确的词级别修订,以词作为最小标注单元。
- 通过去重相同修订和将最终语料库整理为JSON格式,完成标注后处理,以便公开发布。
- 使用Cohen's Kappa系数(平均值为0.38)评估标注质量,以衡量可接受度评分的标注者间一致性。
实验结果
研究问题
- RQ1如何构建一个具有多维错误标注的大规模、高质量中文学习者语料库?
- RQ2学习者生成的中文句子中,语法更正与语感更正的分布特征和性质如何?
- RQ3多位标注员对学习者句子可接受度的判断一致性如何?更正的一致性程度如何?
- RQ4众包标注平台能否有效支持中文学习者文本的细粒度、多维更正?
主要发现
- YACLC包含32,124个原始句子,共469,000次修订,平均每句14.6次修订,表明标注密度高且覆盖全面。
- 语料库包含331,292次语法更正和137,708次语感更正,语法更正的分布比语感更正更为均衡。
- 可接受度评分的平均标注者间一致性(Cohen's Kappa)达到0.38,表明标注员之间具有一致的公平程度。
- 该语料库作为CUGE基准的一部分发布,确保了其在中文第二语言习得和自动语法错误纠正研究中的可及性。
- 标注方案在有效保持原始学习者意图的同时,实现了语法正确性与母语语感的精确、最小化编辑。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。