Skip to main content
QUICK REVIEW

[논문 리뷰] The Annotation Guideline of LST20 Corpus

Prachya Boonkwan, Vorapon Luantangsrisuk|arXiv (Cornell University)|2020. 08. 12.
Natural Language Processing Techniques인용 수 11
한 줄 요약

이 논문은 316만 단어, 288,020개의 명명된 실체, 248,962개의 절, 74,180개의 문장이 포함된 대규모 다층적 태국어 어휘자료인 LST20의 어노테이션 가이드라인을 제시한다. 이는 단어 분할, 품사 태깅, 명명된 실체, 절 경계, 문장 경계의 다섯 가지 어노테이션 계층을 포함하며, CoNLL-2003 형식으로 구성되어 있어 공동 신경망 모델 훈련을 가능하게 하며, 태국어가 자연어처리 연구를 위한 언어학적으로 풍부한 언어임을 입증한다.

ABSTRACT

This report presents the annotation guideline for LST20, a large-scale corpus with multiple layers of linguistic annotation for Thai language processing. Our guideline consists of five layers of linguistic annotation: word segmentation, POS tagging, named entities, clause boundaries, and sentence boundaries. The dataset complies to the CoNLL-2003-style format for ease of use. LST20 Corpus offers five layers of linguistic annotation as aforementioned. At a large scale, it consists of 3,164,864 words, 288,020 named entities, 248,962 clauses, and 74,180 sentences, while it is annotated with 16 distinct POS tags. All 3,745 documents are also annotated with 15 news genres. Regarding its sheer size, this dataset is considered large enough for developing joint neural models for NLP. With the existence of this publicly available corpus, Thai has become a linguistically rich language for the first time.

연구 동기 및 목표

  • 태국어 처리를 위한 대규모 다층적 언어학적 어휘자료를 구축하기 위해.
  • 태국어에 대한 풍부한 언어학적 자원의 부족을 보완하기 위해 표준화되고 고품질의 어노테이션을 제공하기 위해.
  • 태국어의 하류 NLP 작업을 위한 공동 신경망 모델 개발을 지원하기 위해.
  • 태국어 텍스트의 다양한 언어학적 계층에서 일관되고 재현 가능한 어노테이션을 가능하게 하기 위해.
  • 태국어의 언어학적 자원 환경을 향상시켜, NLP 지원이 강력한 언어로 위치시키기 위해.

제안 방법

  • 어휘자료는 3,745편의 뉴스 기사에서 구성되었으며, 각 기사에 대해 15개의 고유한 뉴스 장르가 할당되었다.
  • 다섯 가지 언어학적 어노테이션 계층이 적용되었는데, 단어 분할, 품사(POS) 태깅(16개 태그), 명명된 실체 인식, 절 경계 탐지, 문장 경계 탐지이다.
  • 기존 NLP 도구 및 모델과의 호환성을 확보하기 위해 CoNLL-2003 형식을 따르는 어노테이션 방식을 사용하였다.
  • 어노테이터 간 일致성과 일관성을 확보하기 위해 어노테이션 가이드라인을 상세히 개발하였다.
  • 다양한 뉴스 장르를 포함하도록 데이터셋을 정제하여, 강력한 NLP 모델 훈련을 위한 대표성과 유용성을 높였다.
  • 어노테이터 간 일致성 수준을 모니터링하여 모든 언어학적 계층에서 고품질의 어노테이션을 확보하였다.

실험 결과

연구 질문

  • RQ1일致된 어노테이션 기준을 갖춘 대규모 다층적 언어학적 어휘자료를 어떻게 체계적으로 태국어에 대해 구축할 수 있는가?
  • RQ2다양한 언어학적 계층에서 고품질이고 재현 가능한 어노테이션을 보장하기 위해 필요한 어노테이션 가이드라인은 무엇인가?
  • RQ3단일 어휘자료가 태국어에서 여러 NLP 작업을 위한 공동 신경망 모델 훈련을 얼마나 잘 지원할 수 있는가?
  • RQ4장르 수준의 메타데이터 포함이 하류 NLP 응용 프로그램을 위한 언어학적 어휘자료의 유용성을 어떻게 향상시키는가?
  • RQ5종합적인 NLP 모델 개발을 지원하는 완전히 어노테이션 처리된 태국어 어휘자료의 규모와 언어학적 커버리지 범위는 어느 정도인가?

주요 결과

  • LST20 어휘자료는 3,164,864개의 단어, 288,020개의 명명된 실체, 248,962개의 절, 74,180개의 문장을 포함하여 대규모 신경망 모델 훈련에 적합하다.
  • 어휘자료는 16개의 고유한 품사 태그를 포함하여 태국어 텍스트에 대해 세밀한 구문론적 어노테이션을 제공한다.
  • 모든 3,745개의 문서가 15개의 다른 뉴스 장르로 어노테이션 처리되어 어휘자료의 다양성과 대표성을 높였다.
  • CoNLL-2003 형식의 사용으로 기존 NLP 툴킷 및 훈련 파이프라인과 직접 통합이 가능하다.
  • 이 어휘자료는 연구 및 개발를 위한 공개 가능한 언어학적으로 풍부한 자원을 확립함으로써 태국어 NLP 분야에서의 중대한 발전을 이룬다.
  • 표준화된 어노테이션 가이드라인은 모든 언어학적 계층과 어노테이터 간 일관성과 재현 가능성을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.