Skip to main content
QUICK REVIEW

[论文解读] UA-GEC: Grammatical Error Correction and Fluency Corpus for the Ukrainian Language

Oleksiy Syvokon, Olena Nahorna|arXiv (Cornell University)|Mar 31, 2021
Text Readability and Simplification被引用 13
一句话总结

本文介紹了 UA-GEC,這是首個針對烏克蘭語的專業標註語法錯誤修正與流暢度語料庫,包含來自不同母語及非母語寫作者的 20,715 節句子。該語料庫透過線上提交方式收集,並由專業校對員進行校正,涵蓋語法、拼寫、標點符號與流暢度錯誤,平均錯誤率為 7.1%,並以 CC-BY 4.0 授權公開發行,以促進低資源、詞形豐富語言的自然語言處理研究。

ABSTRACT

We present a corpus professionally annotated for grammatical error correction (GEC) and fluency edits in the Ukrainian language. To the best of our knowledge, this is the first GEC corpus for the Ukrainian language. We collected texts with errors (20,715 sentences) from a diverse pool of contributors, including both native and non-native speakers. The data cover a wide variety of writing domains, from text chats and essays to formal writing. Professional proofreaders corrected and annotated the corpus for errors relating to fluency, grammar, punctuation, and spelling. This corpus can be used for developing and evaluating GEC systems in Ukrainian. More generally, it can be used for researching multilingual and low-resource NLP, morphologically rich languages, document-level GEC, and fluency correction. The corpus is publicly available at https://github.com/grammarly/ua-gec

研究动机与目标

  • 解決烏克蘭語語法錯誤修正(GEC)領域缺乏高品質、專業標註之訓練與評估資料的問題。
  • 支援多語言與低資源自然語言處理研究,特別是針對烏克蘭語等詞形豐富語言。
  • 促進針對烏克蘭語量身訂做的 GEC 與流暢度修正系統之開發與評估。
  • 提供涵蓋多種寫作領域與語言程度的多樣化、具代表性資料集。

提出的方法

  • 透過線上表單從 492 名貢獻者收集帶有錯誤的文本,包含來自不同寫作領域的母語與非母語使用者。
  • 貢獻者提交未經校對的作文、翻譯與個人文字,以保留自然產生的錯誤。
  • 專業校對員針對語法、拼寫、標點符號與流暢度錯誤進行修正,著重於讓文本聽起來更自然,符合母語者習慣。
  • 透過使用互不重疊的作者集合,將語料庫分為訓練集(18,225 節句子)與測試集(2,490 節句子),以確保資料獨立性。
  • 測試集經過兩輪獨立標註,以評估標註者之間的一致性並提升修正品質。
  • 最終語料庫共包含 23,496 筆標註,分屬五類錯誤,平均錯誤率為 7.1%。

实验结果

研究问题

  • RQ1母語與非母語使用者所撰寫的烏克蘭語書面文本中,錯誤類型的分佈為何?
  • RQ2烏克蘭語 GEC 的標註者之間一致性與其他語言相比如何,特別是在流暢度與結構修正方面?
  • RQ3非母語使用者在烏克蘭語中對特定錯誤類型(如借詞、搭配錯誤或標點符號濫用)的貢獻程度為何?
  • RQ4UA-GEC 中的錯誤率與錯誤類型分佈與其他語言的既有 GEC 語料庫相比如何?
  • RQ5公開可用且經專業標註的語料庫是否能顯著提升烏克蘭語 GEC 系統的開發與評估?

主要发现

  • UA-GEC 語料庫包含來自 1,011 範文本的 20,715 節句子,訓練集與測試集的平均錯誤率為 7.1%。
  • 標點符號錯誤最為常見(每千詞 28.3 起),其次為拼寫(14.8)、流暢度(16.9)與語法(11.3)。
  • 流暢度錯誤佔所有錯誤的 20.8%(共 5,561 筆),其中相當大一部分源自非母語使用者的借詞與非標準表達。
  • 在第二輪校對後未修改的句子中,標註者之間的一致性為 64%,顯示即使在流暢度修正這類複雜任務中,仍具高度一致性。
  • 該語料庫是烏克蘭語領域首個同類語料庫,並已公開於 https://github.com/grammarly/ua-gec,採用 CC-BY 4.0 授權,有利於未來低資源與詞形豐富語言的自然語言處理研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。