Skip to main content
QUICK REVIEW

[논문 리뷰] Multilingual Open Text Release 1: Public Domain News in 44 Languages

Chester Palen-Michel, June Kim|arXiv (Cornell University)|2022. 01. 14.
Natural Language Processing Techniques인용 수 6
한 줄 요약

이 논문은 2001–2002년 동안 공공 영역에 속하는 뉴스 웹사이트에서 수집된 44개 언어로 된 280만 건의 뉴스 기사와 100만 건의 짧은 스니펫을 포함한, 공개 이용이 가능하고 자유 라이선스가 부여된 Multilingual Open Text (MOT) Release 1을 소개한다. 이 코퍼스는 특정 저자원 언어에 대해 신뢰할 수 있는 문장 분할 및 토큰화를 포함하여 철저히 정제되어 있으며, 저자원 언어에서 NLP 모델을 훈련하고 평가하는 데 높은 품질과 확장성을 제공하는 자원이다.

ABSTRACT

We present Multilingual Open Text (MOT), a new multilingual corpus containing text in 44 languages, many of which have limited existing text resources for natural language processing. The first release of the corpus contains over 2.8 million news articles and an additional 1 million short snippets (photo captions, video descriptions, etc.) published between 2001--2022 and collected from Voice of America's news websites. We describe our process for collecting, filtering, and processing the data. The source material is in the public domain, our collection is licensed using a creative commons license (CC BY 4.0), and all software used to create the corpus is released under the MIT License. The corpus will be regularly updated as additional documents are published.

연구 동기 및 목표

  • 저자원 언어의 자연어 처리(NLP) 분야에서 고품질로 공개 가능한 텍스트 데이터의 부족 문제를 해결하기 위해.
  • 일관성 있고 품질이 높은 데이터를 확보하기 위해 단일 확립된 뉴스 소스에서부터 신뢰할 수 있는 자유 라이선스를 가진 다국어 코퍼스를 구축하기 위해.
  • 저자원 언어에서 문장 분할 및 토큰화의 지원을 향상시키기 위해 언어별 도구와 맞춤형 모델을 활용하기 위해.
  • 하류 작업(NLP 작업)인 언어 식별, 텍스트 분류, 명명된 실체 인식 등을 지원하는 확장성 있고 정기적으로 업데이트되는 자원을 제공하기 위해.
  • 저자원 언어에서 다국어 모델 훈련 및 반평행 또는 주석이 달린 데이터셋 제작의 기초 자료를 제공하기 위해.

제안 방법

  • 2001년에서 2022년 사이에 게시된 공공 영역 콘텐츠에 중점을 두고 Voice of America의 다국어 뉴스 웹사이트에서 텍스트를 수집하였다.
  • 게시 일자 및 소스 URL과 같은 메타데이터를 유지하는 가용성 있는 크래빙 파이프라인을 구현하였다.
  • 저자원 언어에서 신뢰할 수 있는 토큰화 및 문장 분할을 위해 PyThaiNLP, amseg, Stanza와 같은 언어별 도구를 사용하였다.
  • 다국어 모델에서 잘 지원되지 않는 언어에 대해 MOT의 문단 구분 기반으로 맞춤형 Ersatz 모델을 훈련시켰다.
  • 데이터 품질 확보 및 비텍스트 또는 저품질 콘텐츠 제거를 위해 필터링 및 중복 제거를 적용하였다.
  • 코퍼스는 CC BY 4.0 하에 배포되었으며, 모든 처리 소프트웨어는 재현성과 재사용을 위해 MIT 라이선스 하에 오픈소스로 공개되었다.

실험 결과

연구 질문

  • RQ1단일의 자유 라이선스가 부여된 뉴스 소스에서 대규모 고품질 다국어 코퍼스를 구축하여 저자원 언어의 NLP를 지원할 수 있는가?
  • RQ2기존 NLP 도구가 제한된 저자원 언어에서 신뢰할 수 있는 문장 분할 및 토큰화를 어떻게 달성할 수 있는가?
  • RQ3정제된, 소스 기반 코퍼스가 저자원 언어의 데이터 품질과 일관성 측면에서 웹 크롤링 코퍼스를 얼마나 뛰어나게 할 수 있는가?
  • RQ4자유 라이선스가 부여된 공개 가능한 코퍼스가 저자원 언어의 연구자 및 어원어 사용자들이 NLP 연구에 진입하는 데 장벽을 낮출 수 있는가?
  • RQ5도메인 특화 텍스트에서 훈련된 맞춤형 Ersatz 모델이 저자원 언어에서 문장 분할에 얼마나 효과적인가?

주요 결과

  • MOT Release 1 코퍼스는 44개 언어로 280만 건 이상의 뉴스 기사와 100만 건의 짧은 스니펫을 포함하며, 하우사, 오로모, 티그린야, 킨야르와다와 같은 저자원 언어가 상당 부분을 차지한다.
  • 아مهر릭어 및 티그린야어에 대해 amseg, 태국어에 대해 PyThaiNLP와 같은 전용 도구를 사용하여 18개 언어에서 신뢰할 수 있는 문장 분할 및 토큰화를 달성하였다.
  • 게시 시간 메타데이터와 소스 URL이 포함되어 있어 반평행 텍스트 제작 및 시계열 분석에 활용 가능할 수 있다.
  • MOT의 문단 구분에서 훈련된 맞춤형 Ersatz 모델이 다국어 모델에서 잘 지원되지 않는 언어의 문장 분할 성능을 향상시켰다.
  • 코퍼스는 CC BY 4.0 하에, 모든 처리 소프트웨어는 MIT 라이선스 하에 배포되어 연구의 광범위한 접근성과 재사용을 보장한다.
  • 다국어 모델인 Ersatz가 지파이어 문자(예: 아مهر릭어/티그린야어) 및 그리스 문장 부호를 사용하는 언어에서 한계를 보임을 확인하여 언어별 도구의 사용이 정당화됨을 밝혔다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.