Skip to main content
QUICK REVIEW

[논문 리뷰] IndoNLU: Benchmark and Resources for Evaluating Indonesian Natural Language Understanding

Bryan Wilie, Karissa Vincentio|arXiv (Cornell University)|2020. 09. 11.
Topic Modeling참고 문헌 32인용 수 192
한 줄 요약

IndoNLU는 12개 과제로 구성된 최초의 대형 인도네시아어 NLU 벤치마크, 새로운 자기지도 학습 Indo4B 코퍼스, 그리고 IndoBERT/IndoBERT-lite 기반선들을 도입하고, 재현 가능한 평가를 위한 벤치마크 프레임워크와 리더보드를 제공합니다.

ABSTRACT

Although Indonesian is known to be the fourth most frequently used language over the internet, the research progress on this language in the natural language processing (NLP) is slow-moving due to a lack of available resources. In response, we introduce the first-ever vast resource for the training, evaluating, and benchmarking on Indonesian natural language understanding (IndoNLU) tasks. IndoNLU includes twelve tasks, ranging from single sentence classification to pair-sentences sequence labeling with different levels of complexity. The datasets for the tasks lie in different domains and styles to ensure task diversity. We also provide a set of Indonesian pre-trained models (IndoBERT) trained from a large and clean Indonesian dataset Indo4B collected from publicly available sources such as social media texts, blogs, news, and websites. We release baseline models for all twelve tasks, as well as the framework for benchmark evaluation, and thus it enables everyone to benchmark their system performances.

연구 동기 및 목표

  • 인도네시아어 NLP의 자원 부족 문제를 해결하기 위해 다양한 다중 작업 벤치마크를 제공한다.
  • 인도네시아어에 맞춘 언어 모델을 훈련하기 위한 크고 정제된 인도네시아어 사전 학습 데이터셋(Indo4B)을 구축한다.
  • 기준 모델 솔루션(IndoBERT 및 IndoBERT-lite)을 제공하고 이를 다국어 기반선과 비교하여 강력한 벤치마크를 설정한다.
  • 투명성과 커뮤니티 참여를 촉진하기 위해 재현 가능한 벤치마크 프레임워크와 접근 가능한 리더보드를 제공한다.

제안 방법

  • 포멀한 인도네시아어와 구어체를 아우르는 단일 문장 및 문장 쌍 입력을 포함한 12개의 NLU 작업을 구성하며, 분류 및 시퀀스 표기를 포함한다.
  • Indo4B에서 128- 및 512토큰 시퀀스 길이를 모두 사용하고 TPUv3-8에서의 2단계 학습으로 단일언어 인도네시아어 BERT 계열(IndoBERT 및 IndoBERT-lite) 모델을 사전 학습한다.
  • 다양한 베이스라인(Scratch, fastText 변형, Multilingual BERT, XLM-R, XLM-MLM)을 모든 작업에 대해 미세조정하고 분류 및 시퀀스 표기에 대해 매크로 F1을 사용하여 평가한다.
  • 재현 가능한 비교를 가능하게 하도록 작업 분할을 표준화하고 IndoNLU 결과에 대한 공개 리더보드를 공개한다.
  • 인도네시아어 데이터를 최대한 잘 다루기 위한 전처리 및 어휘 선택(SentencePiece with BPE, 인도네시아어 특화 처리, Twitter 데이터에 대한 개인정보 마스킹)을 제공한다.

실험 결과

연구 질문

  • RQ1모델과 도메인 전반에 걸친 평가를 표준화하기 위해 다양한 다중 작업 인도네시아어 NLU 벤치마크를 확립할 수 있는가?
  • RQ2단일언어 인도네시아어 모델(IndoBERT/IndoBERT-lite)이 인도네시아어 NLU 작업에서 다국어 모델보다 우수한가, 어떤 설정에서 그렇는가?
  • RQ3Indo4B가 더 크지만 노이즈가 많은 코퍼스(CC-ID 등)와 비교하여 단어 임베딩 사전학습에 어떤 차이가 있으며, 다운스트림 작업에 미치는 영향은 무엇인가?
  • RQ4인도네시아어 NLU 모델에서 모델 크기, 속도(FLOPs), 정확도 간의 트레이드오프는 무엇인가?
  • RQ5입력 시퀀스 길이를 늘리면 시퀀스 표기 작업의 성능이 향상되는가?

주요 결과

  • IndoBERT-LARGE 및 XLM-R-LARGE가 분류 작업에서 최고 성능을 달성하고; XLM-R-LARGE 및 IndoBERT-LARGE가 시퀀스 라벨링 작업에서 선두를 달린다.
  • 사전 학습된 맥락 모델이 대부분의 작업에서 Scratch 및 워드 임베딩 기반선보다 우수하여 인도네시아어에 대한 사전 학습의 가치를 보여준다.
  • IndoBERT 모델은 분류 작업에서 다국어 기반선보다 자주 우수하며, IndoBERT-lite는 더 작은 크기에서 경쟁력 있는 결과를 제공한다.
  • Indo4B는 CC-ID 기반 데이터세트보다 작지만 CC-ID에서 학습된 fastText보다 더 나은 다운스트림 성능을 얻는다.
  • 다국어 모델은 차용된 외국어 용어를 다루는 덕분에 특정 시퀀스 표기 작업에서 탁월하지만, 단일언어 모델은 문장 수준 의미에서 우수하다.
  • 더 긴 입력 시퀀스(512 토큰)가 시퀀스 표기 작업의 성능을 향상시키며, 확장된 문맥의 이점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.