Skip to main content
QUICK REVIEW

[논문 리뷰] CLUENER2020: Fine-grained Named Entity Recognition Dataset and Benchmark for Chinese

Liang Xu, Tong Yu|arXiv (Cornell University)|2020. 01. 13.
Topic Modeling참고 문헌 12인용 수 48
한 줄 요약

본 논문은 CLUENER2020을 소개하며, 10개 엔티티 범주를 갖는 세밀한 중국어 NER 데이터셋과 향후 연구를 촉진하기 위한 베이스라인 및 인간 성능 분석을 제공합니다.

ABSTRACT

In this paper, we introduce the NER dataset from CLUE organization (CLUENER2020), a well-defined fine-grained dataset for named entity recognition in Chinese. CLUENER2020 contains 10 categories. Apart from common labels like person, organization, and location, it contains more diverse categories. It is more challenging than current other Chinese NER datasets and could better reflect real-world applications. For comparison, we implement several state-of-the-art baselines as sequence labeling tasks and report human performance, as well as its analysis. To facilitate future work on fine-grained NER for Chinese, we release our dataset, baselines, and leader-board.

연구 동기 및 목표

  • 다양한 엔티티 범주를 포함하는 세밀한 중국어 NER 데이터셋을 정의한다.
  • 중국어 NER에서 공정한 비교를 위한 벤치마크와 베이스라인 모델을 제공한다.
  • 중국어의 세밀한 NER의 어려움과 실제 적용 가능성을 분석한다.

제안 방법

  • 일반 라벨을 넘어 10개의 엔티티 범주를 갖춘 중국어 NER 데이터셋을 수집하고 주석한다.
  • 여러 가지 최첨단 베이스라인 모델을 시퀀스 표기(sequence labeling) 작업으로 구현한다.
  • CLUENER2020 데이터셋에서 베이스라인과 인간 성능을 평가한다.
  • 데이터셋, 베이스라인, 그리고 리더보드를 커뮤니티에 공개한다.

실험 결과

연구 질문

  • RQ1중국어의 세밀한 NER가 더 거친 라벨과 비교할 때의 이점과 도전 과제는 무엇인가?
  • RQ2다중 엔티티 범주에 걸쳐 CLUENER2020 데이터셋에서 현대적인 시퀀스 표기 베이스라인은 어떻게 성능을 나타내는가?
  • RQ3이 세밀한 중국어 NER 작업에서 인간 성능은 자동 베이스라인과 어떻게 비교되는가?

주요 결과

  • CLUENER2020은 열 가지 범주를 다루는 잘 정의된 세밀한 중국어 NER 데이터셋을 제공한다.
  • 베이스라인 모델들이 경쟁력 있는 벤치마크를 확립하기 위해 데이터셋에서 평가된다.
  • 전문가 라벨링과의 맥락에서 모델 성능을 비교하기 위해 인간 성능이 보고된다.
  • 향후 연구를 촉진하기 위해 데이터셋, 베이스라인, 그리고 리더보드가 공개된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.