Skip to main content
QUICK REVIEW

[论文解读] GitHub Typo Corpus: A Large-Scale Multilingual Dataset of Misspellings and Grammatical Errors

Masato Hagiwara, Masato Mita|arXiv (Cornell University)|Nov 28, 2019
Natural Language Processing Techniques参考文献 25被引用 17
一句话总结

本文介绍了 GitHub Typo Corpus,这是一个大规模多语言数据集,包含来自 GitHub 提交记录的超过 350,000 个拼写错误编辑和 6400 万个字符,覆盖 15 种以上语言。通过仅使用三个特征的简单逻辑回归分类器,作者在区分真实拼写错误编辑与语义编辑方面实现了 90% 的 F1 分数,表明现有拼写检查器表现欠佳(F1 ≈ 0.5),从而确立了该数据集作为拼写与语法错误纠正研究的丰富且真实的基准。

ABSTRACT

The lack of large-scale datasets has been a major hindrance to the development of NLP tasks such as spelling correction and grammatical error correction (GEC). As a complementary new resource for these tasks, we present the GitHub Typo Corpus, a large-scale, multilingual dataset of misspellings and grammatical errors along with their corrections harvested from GitHub, a large and popular platform for hosting and sharing git repositories. The dataset, which we have made publicly available, contains more than 350k edits and 65M characters in more than 15 languages, making it the largest dataset of misspellings to date. We also describe our process for filtering true typo edits based on learned classifiers on a small annotated subset, and demonstrate that typo edits can be identified with F1 ~ 0.9 using a very simple classifier with only three features. The detailed analyses of the dataset show that existing spelling correctors merely achieve an F-measure of approx. 0.5, suggesting that the dataset serves as a new, rich source of spelling errors that complement existing datasets.

研究动机与目标

  • 为自然语言处理中的拼写纠正和语法错误纠正(GEC)解决缺乏大规模、真实数据集的问题。
  • 克服类似维基百科等合成或噪声数据集的局限性,这些数据集通常包含非词汇性编辑和破坏性内容。
  • 在真实软件开发环境中,开发一种可扩展的方法来识别真实的拼写错误编辑。
  • 创建一个公开可用的高质量多语言数据集,补充现有资源并反映自然的人类错误模式。
  • 在大规模、真实世界错误的现实数据集上评估现有拼写检查器的性能。

提出的方法

  • 利用元数据和提交信息从 GitHub 提交历史中收集拼写错误编辑。
  • 使用 1,000 个编辑的少量标注子集过滤非语言编辑(例如代码更改)。
  • 仅使用三个特征——编辑长度、编辑类型和编辑位置——训练一个逻辑回归分类器,以区分拼写错误编辑与语义编辑。
  • 在保留的测试集上使用训练好的分类器,实现 90% 的 F1 分数来分类真实拼写错误编辑。
  • 使用 ERRANT 工具包分析编辑类型,将错误分类为拼写、拼写规范、标点和语法错误。
  • 在该语料库上评估现有拼写检查器(Aspell 和 Enchant),以基准测试其在真实世界错误上的表现。

实验结果

研究问题

  • RQ1仅使用极少特征的简单分类器能否有效区分 GitHub 提交历史中真实拼写错误编辑与语义编辑?
  • RQ2真实世界软件开发中的拼写与语法错误分布与合成或基于维基百科的数据集相比有何不同?
  • RQ3现有开源拼写检查器(如 Aspell、Enchant)在大规模真实世界拼写错误数据集上的表现如何?
  • RQ4GitHub Typo Corpus 在多语言和代码混用文本方面在多大程度上反映了多样的语言模式?
  • RQ5该数据集是否揭示了当前拼写检查器未能捕捉的错误模式,从而表明需要改进的纠错模型?

主要发现

  • GitHub Typo Corpus 包含超过 350,000 个拼写错误编辑和超过 6400 万个字符,涵盖 15 种以上语言,是迄今为止最大的多语言拼写错误数据集。
  • 仅使用三个特征的简单逻辑回归分类器在识别真实拼写错误编辑方面实现了约 0.9 的 F1 分数。
  • 现有拼写检查器(如 Aspell 和 Enchant)在该数据集上的 F1 测量值仅为约 0.5,表明仍有显著的改进空间。
  • 该数据集包含多样的错误类型,包括拼写、拼写规范、标点和语法错误,其中非英语语言(如中文和日语)中存在显著的英文术语混用错误。
  • 频繁的原子编辑包括简单的插入和删除(例如添加 's' 或删除 'e'),以及中文和日语中的助词误用等语法错误。
  • 该数据集表明,许多错误出现在代码相关术语中(例如 'Gemfile'、'GB-18030'),表明现实世界错误通常涉及技术术语和多语言混合语境。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。