Skip to main content
QUICK REVIEW

[논문 리뷰] NusaCrowd: Open Source Initiative for Indonesian NLP Resources

Samuel Cahyawijaya, Holy Lovenia|arXiv (Cornell University)|2022. 12. 19.
Natural Language Processing Techniques인용 수 9
한 줄 요약

NusaCrowd는 137개의 인도네시아어 NLP 데이터셋과 118개의 데이터 로더를 집계하고 표준화하는 협업형 오픈소스 이니셔티브로, 인도네시아어 및 지역 언어를 대상으로 자연어 이해(NusaNLU)와 생성(NusaNLG)을 위한 첫 번째 제로샷 벤치마크를 제공하며, 동시에 자원이 부족한 인도네시아어 언어를 대상으로 한 첫 번째 多어성 음성 인식(ASR) 벤치마크(NusaASR)를 제공한다. 이는 이전까지 비공개였던 14개의 데이터셋을 처음으로 공개로 전환했으며, 텍스트, 음성, 이미지 모odal리티에서 19개 언어에 걸쳐 100개 이상의 데이터셋을 지원한다.

ABSTRACT

We present NusaCrowd, a collaborative initiative to collect and unify existing resources for Indonesian languages, including opening access to previously non-public resources. Through this initiative, we have brought together 137 datasets and 118 standardized data loaders. The quality of the datasets has been assessed manually and automatically, and their value is demonstrated through multiple experiments. NusaCrowd's data collection enables the creation of the first zero-shot benchmarks for natural language understanding and generation in Indonesian and the local languages of Indonesia. Furthermore, NusaCrowd brings the creation of the first multilingual automatic speech recognition benchmark in Indonesian and the local languages of Indonesia. Our work strives to advance natural language processing (NLP) research for languages that are under-represented despite being widely spoken.

연구 동기 및 목표

  • 산산이 흩어져 있고 문서화되지 않으며 비공개인 인도네시아어 NLP 자원들을 통합함으로써 자원 부족과 분산 문제를 해결한다.
  • 라벨이 부족하고 언어 다양성이 제한된 탓에 인도네시아어 및 지역 언어가 NLP 연구에서 부족하게 다뤄지는 문제를 해결한다.
  • 표준화된 고품질의 벤치마크를 구축함으로써 인도네시아어 NLP를 위한 제로샷 및 피처샷 전이 학습을 가능하게 한다.
  • 정제된 음성 코퍼스를 활용하여 인도네시아어 및 현지 언어를 대상으로 한 다어성 자동 음성 인식(ASR)을 발전시킨다.
  • 이전까지 비공개였던 데이터셋을 공개하고, 인도네시아어 NLP 자원을 위한 지속 가능한 공동체 주도의 인프라를 구축함으로써 오픈 사이언스를 촉진한다.

제안 방법

  • 학술 기관, 정부 기관, 비공개 리포지토리 등 다양한 출처에서 137개의 데이터셋을 체계적으로 수집하고 정제하였다.
  • NusaCrowd 데이터 허브에서 표준화된 데이터 로더를 구현하여 다양한 NLP 프레임워크와 모델 간의 상호운용성을 확보하였다.
  • 현지어 사용자와 NLP 전문가를 활용한 수동 및 자동 품질 평가를 수행하여 데이터셋의 신뢰성과 일관성을 확보하였다.
  • 12개의 인도네시아어 및 지역 언어에서 40개의 NLU 및 40개의 NLG 과제를 포함하는 NusaNLU 및 NusaNLG 벤치마크를 구축하여 제로샷 평가를 가능하게 하였다.
  • 10개의 인도네시아어 언어에서 약 800시간의 다어성 음성 데이터를 활용해 NusaASR 벤치마크를 구축하여 단일어 및 다어성 ASR 모델 훈련을 지원하였다.
  • 장기적인 접근성과 공동체 기여를 보장하기 위해 NusaCatalogue와 NusaCrowd 데이터 허브를 오픈소스 플랫폼으로 공개하였다.

실험 결과

연구 질문

  • RQ1어떻게 분산되어 있고 비공개인 인도네시아어 NLP 자원들을 표준화되고 접근 가능한 공동체 유지 플랫폼으로 통합할 수 있는가?
  • RQ2저자원 인도네시아어 및 지역 언어에서 자연어 이해 및 생성을 위한 제로샷 전이 학습은 어느 정도 가능해질 수 있는가?
  • RQ3텍스트, 음성, 이미지 모달리티에서 기존 인도네시아어 NLP 데이터셋의 품질과 다양성은 어떠한가?
  • RQ4정제된 공개 음성 코퍼스를 활용해 인도네시아어 및 지역 언어를 대상으로 한 다어성 ASR 벤치마크를 구축할 수 있는가?
  • RQ5최신의 다어성 모델은 새로 도입된 인도네시아어 NLP 과제를 위한 제로샷 벤치마크에서 어떻게 성능을 발휘하는가?

주요 결과

  • NusaCrowd는 137개의 데이터셋과 118개의 표준화된 데이터 로더를 성공적으로 통합하여, 지금까지 가장 큰 중앙집중식 인도네시아어 NLP 자원 레포지토리로 구축되었다.
  • 이 이니셔티브는 이전까지 비공개였던 14개의 데이터셋을 처음으로 공개로 전환하여, 자원이 부족한 언어의 자원 기반을 크게 확장하였다.
  • NusaNLU 벤치마크는 12개 언어에서 40개의 NLU 과제를 포함하여 저자원 언어에 초점을 맞춘 다어성 모델의 제로샷 평가를 가능하게 하였다.
  • NusaNLG 벤치마크는 12개 언어에서 40개의 자연어 생성 과제를 포함하여 인도네시아어 및 지역 언어에서 생성 모델의 평가를 지원하였다.
  • NusaASR 벤치마크는 10개의 인도네시아어 언어에서 약 800시간의 음성 데이터를 포함하여 다어성 ASR 모델 개발을 지원하였다.
  • 수집된 데이터셋에 대한 종합적 분석을 통해 데이터 품질, 크기, 언어 커버리지 측면에서 심각한 격차가 확인되었으며, 이는 표준화된 정제 과정과 공동체 참여의 필요성을 강조하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.