Skip to main content
QUICK REVIEW

[论文解读] Mining Naturally-occurring Corrections and Paraphrases from Wikipedia's Revision History

Aurélien Max, Guillaume Wisniewski|arXiv (Cornell University)|Feb 25, 2022
Wikis in Education and Collaboration参考文献 10被引用 55
一句话总结

WiCoPaCo 是一个由维基百科修订的本地编辑重写的大型语料库,可用于拼写纠错与改写生成的研究与应用。它提供带有丰富元数据的就地修改对,起始于一个以法语为重点的数据集。

ABSTRACT

Naturally-occurring instances of linguistic phenomena are important both for training and for evaluating automatic processes on text. When available in large quantities, they also prove interesting material for linguistic studies. In this article, we present a new resource built from Wikipedia's revision history, called WiCoPaCo (Wikipedia Correction and Paraphrase Corpus), which contains numerous editings by human contributors, including various corrections and rewritings. We discuss the main motivations for building such a resource, describe how it was built and present initial applications on French.

研究动机与目标

  • 创建一个来自维基百科修订的局部发生重写的大型资源,以用于 NLP 应用。
  • 使拼写纠错、改写生成等相关任务的研究与评估成为可能。
  • 提供元数据和上下文,以支持监督学习和评估。
  • 展示在法语上的初步应用以说明数据的实用性。

提出的方法

  • 通过使用最长公共子序列计算连续版本之间的差异来提取局部修改。
  • 将重写跨度限制在最多七个词,并对文本进行规范化处理(去维基化、分词)。
  • 应用手工筛选规则,移除改变含义或仅标点的编辑,并记录完整段落上下文。
  • 存储上下文、原始和修改后的跨段落,以及维基百科标识符(包括用户信息);排除机器人编辑。
  • 输出带有唯一修改标识符以供注释和复用的 XML。
  • 在法语数据上演示拼写纠错和改写生成分析的应用。

实验结果

研究问题

  • RQ1维基百科的修订历史是否能产生适用于 NLP 任务的大规模、自然发生的改写?
  • RQ2在语料库中主导的局部改写类型(拼写纠错、改写等)是什么?如何对其进行特征化?
  • RQ3WiCoPaCo 作为拼写纠错和改写生成的资源在实际应用中有多大效果?
  • RQ4该方法是否可在其他语言和 wiki 上复现,以构建多语言资源?

主要发现

  • WiCoPaCo 在上下文中包含 408,816 条修改。
  • 该资源支持多样的重写类型,包括拼写纠错、改写和意义改变。
  • 就法语而言,语料库能够进行拼写错误分析和形态-句法重写模式研究。
  • 候选生成源的组合显著提升了拼写纠错候选覆盖率(Hunspell、频繁的编辑模式和语料库派生的编辑)。
  • 在拼写纠错实验中,分别提取了非单词错误和真实单词错误,数量为 72,493 和 74,100。
  • 当将多种方法结合使用时,拼写纠错候选评估的覆盖率最佳,非单词错误达到 96.8%,真实单词错误达到 92.6%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。