Skip to main content
QUICK REVIEW

[论文解读] CLUENER2020: Fine-grained Named Entity Recognition Dataset and Benchmark for Chinese

Liang Xu, Tong Yu|arXiv (Cornell University)|Jan 13, 2020
Topic Modeling参考文献 12被引用 48
一句话总结

本文介绍 CLUENER2020,一个具有十类实体的细粒度中文命名实体识别数据集,并提供基线和人工表现分析以促进未来研究。

ABSTRACT

In this paper, we introduce the NER dataset from CLUE organization (CLUENER2020), a well-defined fine-grained dataset for named entity recognition in Chinese. CLUENER2020 contains 10 categories. Apart from common labels like person, organization, and location, it contains more diverse categories. It is more challenging than current other Chinese NER datasets and could better reflect real-world applications. For comparison, we implement several state-of-the-art baselines as sequence labeling tasks and report human performance, as well as its analysis. To facilitate future work on fine-grained NER for Chinese, we release our dataset, baselines, and leader-board.

研究动机与目标

  • 定义一个具有多样实体类别的细粒度中文 NER 数据集。
  • 提供一个基准和基线模型,以在中文 NER 任务中实现公平比较。
  • 分析中文细粒度 NER 的难度和在现实场景中的适用性。

提出的方法

  • 组装并标注一个具有超出常见标签的 10 个实体类别的中文 NER 数据集。
  • 将若干最先进的基线模型实现为序列标注任务。
  • 在 CLUENER2020 数据集上评估基线和人工表现。
  • 向社区发布数据集、基线和排行榜。

实验结果

研究问题

  • RQ1与更粗粒度的标签相比,中文细粒度 NER 的优势和挑战是什么?
  • RQ2在 CLUENER2020 数据集的多个实体类别上,现代序列标注基线的性能如何?
  • RQ3在这一中文细粒度 NER 任务中,人工表现与自动化基线的对比如何?

主要发现

  • CLUENER2020 提供了覆盖十个类别的定义明确的细粒度中文 NER 数据集。
  • 在该数据集上评估基线模型以建立有竞争力的基准。
  • 报告了人工表现,以将模型性能置于专家标注的背景之中。
  • 数据集、基线和排行榜的发布旨在促进未来的工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。