Skip to main content
QUICK REVIEW

[논문 리뷰] NusaCrowd: A Call for Open and Reproducible NLP Research in Indonesian Languages

Samuel Cahyawijaya, Alham Fikri Aji|arXiv (Cornell University)|2022. 07. 21.
Software Engineering Research인용 수 4
한 줄 요약

NusaCrowd는 인도네시아어 자연어 처리(NLP)를 위한 중앙집중식, 개방형, 재현 가능한 이니셔티브를 제안하며, NusaCatalogue라는 정제된 데이터셋 레지스트리와 표준화된 데이터로더(NusaCrowd Data Hub)를 통해 데이터셋을 집계한다. 커뮤니티 기반 기여—데이터셋 설명서 제출, 데이터로더 구현, 비공개 데이터셋 공개—를 통해 자원이 부족한 인도네시아어 NLP 연구 분야에서 데이터 부족과 분산 문제를 해결하고, 협업과 재현 가능성을 증진시킨다.

ABSTRACT

At the center of the underlying issues that halt Indonesian natural language processing (NLP) research advancement, we find data scarcity. Resources in Indonesian languages, especially the local ones, are extremely scarce and underrepresented. Many Indonesian researchers do not publish their dataset. Furthermore, the few public datasets that we have are scattered across different platforms, thus makes performing reproducible and data-centric research in Indonesian NLP even more arduous. Rising to this challenge, we initiate the first Indonesian NLP crowdsourcing effort, NusaCrowd. NusaCrowd strives to provide the largest datasheets aggregation with standardized data loading for NLP tasks in all Indonesian languages. By enabling open and centralized access to Indonesian NLP resources, we hope NusaCrowd can tackle the data scarcity problem hindering NLP progress in Indonesia and bring NLP practitioners to move towards collaboration.

연구 동기 및 목표

  • 특히 현지 언어를 대상으로 한 인도네시아어 NLP 데이터셋의 심각한 부족성과 분산 문제를 해결하기 위해.
  • 인도네시아어 NLP 연구에서 공개적이고 탐색 가능하며 재사용 가능한 데이터셋이 부족한 문제를 해결하기 위해.
  • 데이터 탐색 가능성, 상호운용성, 재현 가능성 향상을 위해 중앙집중식이고 개방형 플랫폼을 구축하기 위해.
  • 구조화된 기여 경로와 투명한 평가 시스템을 통해 커뮤니티 협업을 촉진하기 위해.
  • 기여 포인트와 인정을 통해 비공개 데이터셋 공개를 유도함으로써 데이터 공유를 장려하기 위해.

제안 방법

  • 데이터셋 메타데이터(데이터셋 설명서)를 NusaCatalogue라는 검색 가능한 웹 포털에 정제하여 호스팅하며, 이는 데이터셋 프레임워크를 모델로 삼는다.
  • GitHub를 통해 각 데이터셋에 대한 표준화된 프로그래밍 기반 데이터로더 스크립트를 구현하여 일관되고 재현 가능한 데이터 접근을 보장한다.
  • 자동 검사와 제출물의 수동 검토를 조합한 하이브리드 평가 시스템을 통해 품질을 확보한다.
  • 기여를 유도하기 위해 기여 포인트 제도를 도입하며, 데이터셋 설명서 제출, 데이터로더 개발, 비공개 데이터셋 공개에 대해 포인트를 부여한다.
  • 원본 라이선스를 유지하고 직접 소스 리포지토리 및 논문 링크를 연결하여 데이터 무결성을 유지한다.
  • 시간 제한이 있는 커뮤니티 주도형 운동으로서 2022년 6월 25일부터 11월 18일까지 진행되며, 주간 진행 상황 추적과 ACL 2023에 최종 논문 제출을 목표로 한다.

실험 결과

연구 질문

  • RQ1중앙집중식, 커뮤니티 기반의 정제 방식을 통해 인도네시아어 NLP의 데이터 부족과 분산 문제를 어떻게 완화할 수 있는가?
  • RQ2표준화된 개방형 플랫폼이 인도네시아어 NLP 데이터셋의 탐색 가능성과 재현 가능성 향상에 어느 정도 기여하는가?
  • RQ3기여 포인트 제도가 연구자들이 비공개 또는 활용도가 낮은 NLP 데이터셋을 공유하도록 유도하는 데 어떤 영향을 미치는가?
  • RQ4협업적이고 개방적인 프레임워크가 다양한 인도네시아어 언어와 기관 간 산산이 흩어진 NLP 자원을 효과적으로 통합할 수 있는가?
  • RQ5표준화된 데이터로더와 메타데이터는 인도네시아어 NLP 연구의 상호운용성 향상과 진입 장벽 감소에 어떻게 기여하는가?

주요 결과

  • NusaCrowd는 NusaCatalogue와 NusaCrowd Data Hub를 통해 인도네시아어 NLP 데이터셋을 위한 중앙집중식, 개방형 플랫폼을 성공적으로 구축하였다.
  • 이니셔티브는 다양한 인도네시아어 언어를 대상으로 커뮤니티 기반 기여—데이터셋 설명서 제출 및 데이터로더 구현—를 가능하게 하였다.
  • 투명한 기여 포인트 제도를 구현하여 데이터셋 설명서 제출, 데이터로더 개발, 비공개 데이터셋 공개에 대해 포인트를 부여하였다.
  • 원본 라이선스를 유지하고 소스 리포지토리 및 논문 링크를 직접 연결함으로써 데이터 무결성을 유지하였다.
  • 운동은 최종 기여 매트릭스와 ACL 2023에 제출된 논문으로 끝을 맺었으며, 자원이 부족한 환경에서 대규모 협업 기반 NLP 데이터 정제의 가능성을 입증하였다.
  • Slack, WhatsApp, GitHub를 통한 커뮤니티 형성으로 기여자 커뮤니티가 지속적으로 성장하고 있으며, 지속 가능한 참여 잠재력이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.