Skip to main content
QUICK REVIEW

[논문 리뷰] IndoLEM and IndoBERT: A Benchmark Dataset and Pre-trained Language Model for Indonesian NLP

Fajri Koto, Afshin Rahimi|arXiv (Cornell University)|2020. 11. 02.
Topic Modeling참고 문헌 50인용 수 32
한 줄 요약

논문은 IndoLEM을 발표하는데, 이는 일곱 가지 작업을 포함한 포괄적인 인도네시아어 NLP 벤치마크이며 IndoBERT는 IndoLEM 작업에서 기준선 및 다국어 모델에 비해 최첨단 성능을 달성하는 단일 언어 인도네시아어 BERT 모델이다.

ABSTRACT

Although the Indonesian language is spoken by almost 200 million people and the 10th most spoken language in the world, it is under-represented in NLP research. Previous work on Indonesian has been hampered by a lack of annotated datasets, a sparsity of language resources, and a lack of resource standardization. In this work, we release the IndoLEM dataset comprising seven tasks for the Indonesian language, spanning morpho-syntax, semantics, and discourse. We additionally release IndoBERT, a new pre-trained language model for Indonesian, and evaluate it over IndoLEM, in addition to benchmarking it against existing resources. Our experiments show that IndoBERT achieves state-of-the-art performance over most of the tasks in IndoLEM.

연구 동기 및 목표

  • 다양한 작업(형태-문법, 의미론, 담화)을 포함하는 표준화되고 포괄적인 인도네시아어 NLP 벤치마크 데이터셋을 제공한다.
  • 대규모 인도네시아어 코퍼스에서 학습된 단일 언어 인도네시아어 BERT 모델(IndoBERT)을 출시한다.
  • IndoBERT를 다국어 모델 및 기존의 인도네시아어 자원과 비교하여 최첨단 기준선을 확립한다.

제안 방법

  • IndoLEM 소개: 형식적-문법/시퀀스 라벨링, 의미론, 담화의 세 가지 범주에 걸친 일곱 가지 NLP 작업과 표준화된 분할 및 측정치를 제시한다.
  • IndoBERT 개발: 위키피디아, 뉴스, 웹 코퍼스에서 2억 20M 단어의 인도네시아어로 학습된 BERT-스타일 언어 모델로, 12겹층, 768-숨김 아키텍처와 인도네시아어 WordPiece 어휘를 사용한다.
  • IndoLEM에서 BiLSTM과 fastText 임베딩 및 다른 BERT 모델(mBERT, MalayBERT) 등 기본선과 대조하여 IndoBERT를 평가한다.
  • IndoBERT를 BiAffine 의존 구문 분석기에 통합하고 UD-Indo-GSD 및 UD-Indo-PUD 데이터셋에서 평가한다.
  • 인도네시아어 트위터 데이터를 기반으로 두 개의 담화 작업(다음 트윗 예측 및 트윗 순서 배열)을 만들어 담화 응집성을 평가한다.
  • 각 작업에 대해 교차 검증, F1, 정확도, ROUGE, Spearman ρ 등 자세한 평가 방법을 제공한다.

실험 결과

연구 질문

  • RQ1일관된 분할과 여러 작업에 걸친 측정치를 제공하는 표준화된 인도네시아어 벤치마크(IndoLEM)가 인도네시아어 NLP의 발전을 촉진할 수 있는가?
  • RQ2단일 언어 인도네시아어 BERT 모델(IndoBERT)이 다양한 NLP 작업에서 기존 다국어 및 인도네시아어 기반 기준선을 능가하는가?
  • RQ3IndoBERT 표현이 IndoLEM의 형태-문법, 의미론, 담화 작업 전반의 성능에 어떤 영향을 미치는가?
  • RQ4담화 관련 작업(다음 트윗 예측, 트윗 순서 배열)이 IndoBERT의 다른 모델 대비 이점을 드러내는가?
  • RQ5표준 구문 분석기에 문맥 임베딩을 통합하는 것이 인도네시아어 의존 구문 분석에 어떤 영향을 미치는가?

주요 결과

  • IndoBERT는 대부분의 IndoLEM 작업에서 기준선 및 경쟁 BERT 모델에 비해 최첨단 성능을 달성한다.
  • IndoBERT는 naiv̈e 베이즈 대비 감정 분석에서 +13.2 F1, mBERT 대비 +7.5로 감정 분석에서 다른 모델보다 더 큰 향상을 보이고, 요약에서는 ~1–2 ROUGE 포인트의 향상을 보인다.
  • IndoBERT는 POS 태깅 및 NER에서 BERT 기반 모델 중 최상의 결과를 보이며, BiAffine 파서를 사용한 UD-Indo-GSD 의존 구문 분석에서도 강한 향상을 보인다.
  • UD-Indo-PUD에서 mBERT가 IndoBERT보다 의존 구문 분석에서 더 우수한 성능을 보이고 있어 데이터셋 특성과 번역 품질 문제를 시사한다.
  • 담화 작업에서 IndoBERT는 Next Tweet Prediction에서 가장 높은 정확도와 Tweet Ordering에서 가장 높은 Spearman ρ를 달성했으며, 인간 성능(오라클)과 관찰된 차이가 언급된다.
  • IndoLEM은 새로운 담화 작업과 함께 크고 표준화된 인도네시아어 벤치마크를 제공하여 재현 가능한 평가와 인도네시아어 NLP의 진전을 촉진한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.