Skip to main content
QUICK REVIEW

[论文解读] KIND: an Italian Multi-Domain Dataset for Named Entity Recognition

Teresa Paccosi, Alessio Palmero Aprosio|arXiv (Cornell University)|Dec 30, 2021
Topic Modeling被引用 4
一句话总结

本文介紹了 KIND,一個多語言義大利命名實體辨識(NER)資料集,包含超過一百萬個詞符,其中包含六百萬個手動標註的範例,涵蓋新聞、文學與政治演說。這是迄今為止最大規模的義大利語黃金標準 NER 資源,可支援低資源環境下 NLP 模型的訓練與評估,並透過 GitHub 以 CC BY-NC 4.0 授權免費提供。

ABSTRACT

In this paper we present KIND, an Italian dataset for Named-entity recognition. It contains more than one million tokens with annotation covering three classes: person, location, and organization. The dataset (around 600K tokens) mostly contains manual gold annotations in three different domains (news, literature, and political discourses) and a semi-automatically annotated part. The multi-domain feature is the main strength of the present work, offering a resource which covers different styles and language uses, as well as the largest Italian NER dataset with manual gold annotations. It represents an important resource for the training of NER systems in Italian. Texts and annotations are freely downloadable from the Github repository.

研究动机与目标

  • 解決目前缺乏高品質、手動標註之義大利語 NER 資料集,以支援 NLP 模型的訓練與評估。
  • 建立一個多語言、多領域的資源,以捕捉義大利語不同文本風格與類型之間的語言差異。
  • 提供一個免費可取得的高品質資料集,以支援義大利語 NLP 的研究與發展,特別是在低資源環境下。
  • 透過納入文學與政治演說等多樣化領域,擴展現有 NER 資源,不僅僅侷限於新聞領域。
  • 透過一個平衡且多領域的語料庫,支援發展具強健性與領域泛化能力的義大利語 NER 系統。

提出的方法

  • 資料集是基於公開可取得、授權較為寬鬆的文本所建立,包括 Wikinews 文章、義大利小說與政治人物阿爾多·莫羅及阿爾基德·德·加斯佩里的講稿。
  • 由專家語言學家對新聞、文學與政治演說中六百萬個詞符進行手動標註,涵蓋三種實體類型:人物(PER)、組織(ORG)與地點(LOC)。
  • 使用半自動化流程對阿爾多·莫羅著作中的約四百萬個詞符進行標註,透過既有標註經轉換規則與指引進行映射。
  • 標註過程在各領域間遵循一致的指引,確保即使在風格差異下,實體標記亦具有一致性。
  • 文本來自可信的公開來源:Wikinews(CC BY 2.5)、Liber Liber(公共領域),以及義大利政治人物的官方檔案。
  • 資料集以 CC BY-NC 4.0 授權釋出(德·加斯佩里文本為 CC BY-NC-SA 4.0),允許非商業用途的研究與分發,並透過 GitHub 提供。

实验结果

研究问题

  • RQ1能否建立一個大規模、多語言且多領域的義大利語 NER 資料集,並具備高品質的黃金標準標註?
  • RQ2在 KIND 上訓練的 NER 模型,在新聞、文學與政治演說等多樣化領域中的表現如何?
  • RQ3納入非新聞領域(如文學與政治演說)在多大程度上能提升義大利語 NER 系統的強健性與泛化能力?
  • RQ4半自動化標註流程在應用於歷史性或正式政治文本時,其標註品質的保留程度如何?
  • RQ5KIND 是否能作為評估與改進多語言與低資源義大利語 NLP 系統的基準?

主要发现

  • KIND 包含超過一百萬個詞符,其中六百萬個為手動標註,涵蓋三個領域:新聞(308,622 個詞符)、文學(192,448 個詞符)與政治演說(543,240 個詞符)。
  • 手動標註部分包含 10,665 名人物、14,955 家組織與 15,013 個地點實體,且在各領域間分布均衡。
  • 此語料庫為迄今為止最大規模的黃金標準義大利語 NER 資料集,超越先前基準如 I-CAB(18 萬字)與 MEANTIME(480 篇文章)。
  • 阿爾多·莫羅著作的半自動化標註(392,604 個詞符)達到了高度一致性,使正式政治演說得以在極少人力投入下納入資料集。
  • 資料集免費提供,授權為 CC BY-NC 4.0,完整文本與標註可透過 GitHub 倉儲取得,支援可重現性與社群使用。
  • 納入文學與政治演說擴展了義大利語 NER 資源的語言多樣性,使模型能超越新聞語言進行泛化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。