Skip to main content
QUICK REVIEW

[論文レビュー] IndoLEM and IndoBERT: A Benchmark Dataset and Pre-trained Language Model for Indonesian NLP

Fajri Koto, Afshin Rahimi|arXiv (Cornell University)|Nov 2, 2020
Topic Modeling参考文献 50被引用数 32
ひとこと要約

要約: 本論文は、7つのタスクを備えた包括的なインドネシア語NLPベンチマーク IndoLEM と、IndoLEM のタスクで既存のベースラインや多言語モデルと比較して最先端の結果を達成する単言語インドネシア語 BERT モデル IndoBERT を公開します。

ABSTRACT

Although the Indonesian language is spoken by almost 200 million people and the 10th most spoken language in the world, it is under-represented in NLP research. Previous work on Indonesian has been hampered by a lack of annotated datasets, a sparsity of language resources, and a lack of resource standardization. In this work, we release the IndoLEM dataset comprising seven tasks for the Indonesian language, spanning morpho-syntax, semantics, and discourse. We additionally release IndoBERT, a new pre-trained language model for Indonesian, and evaluate it over IndoLEM, in addition to benchmarking it against existing resources. Our experiments show that IndoBERT achieves state-of-the-art performance over most of the tasks in IndoLEM.

研究の動機と目的

  • 多様なタスク(形態統語、意味、談話)を含む標準化された包括的なインドネシア語NLPベンチマークデータセットを提供する。
  • 大規模なインドネシア語コーパスで訓練された単言語インドネシア語BERTモデル(IndoBERT)を公開する。
  • IndoBERTを多言語モデルや既存のインドネシア語リソースと比較し、最先端のベースラインを確立する。

提案手法

  • IndoLEMの導入:3つのカテゴリ(形態統語/シーケンスラベリング、意味、談話)にまたがる7つのNLPタスク、標準化されたスプリットと指標を提供する。
  • IndoBERTの開発:Wikipedia、ニュース、ウェブコーポスからの2億2千万語を用いて訓練された、12層・768隠れ層のBERT風インドネシア語モデル、Indonesian WordPiece語彙を使用。
  • IndoBERTをBiLSTM + fastText 埋め込み、他のBERTモデル(mBERT、MalayBERT)などのベースラインと比較してIndoLEM上で評価する。
  • IndoBERTをBiAffine依存解析器に統合し、UD-Indo-GSDおよびUD-Indo-PUDデータセットで評価する。
  • インドネシア語ツイッターデータに基づく2つの談話タスク(Next Tweet PredictionとTweet Ordering)を作成し、談話的一貫性を評価する。
  • 各タスクの詳細な評価手法を提供する(交差検証、F1、精度、ROUGE、Spearman ρ)。

実験結果

リサーチクエスチョン

  • RQ1標準化されたインドネシア語ベンチマーク(IndoLEM)は、複数タスクにわたる同一の分割と指標を提供することで、インドネシア語NLPの進展を促進できるか。
  • RQ2単言語インドネシア語BERTモデル(IndoBERT)は、多言語モデルや既存のインドネシア語ベースラインを多様なNLPタスクで上回るか。
  • RQ3IndoBERTの表現は、IndoLEMの形態統語・意味・談話タスクの性能にどのように影響するか。
  • RQ4談話関連タスク(Next Tweet Prediction、Tweet Ordering)は、他のモデルに対してIndoBERTの利点を示すか。
  • RQ5標準的なパーサーへ文脈埋め込みを統合することで、インドネシア語依存構文解析の影響はどうなるか。

主な発見

  • IndoBERTは、ほとんどのIndoLEMタスクでベースラインや競合するBERTモデルと比較して最先端の性能を達成。
  • IndoBERTは感情分析と要約で他のモデルよりも大きく改善し、感情分析で Naive Bayes に対して +13.2 F1、mBERT に対して +7.5、要約で約1–2 ROUGEポイントの改善。
  • IndoBERTはBERTベースのモデルの中でPOS taggingとNERで最良の結果を出し、BiAffineパーサーを用いたUD-Indo-GSDの依存解析で強力な改善を示す。
  • UD-Indo-PUDではmBERTがIndoBERTを上回り、データセット特有の影響とUD-Indo-PUDの翻訳品質の問題を浮き彫りに。
  • 談話タスクでは、Next Tweet Predictionで最も高い正解率、Tweet Orderingで最も高いSpearman ρを、テストしたモデルの中でIndoBERTが達成し、人間の性能(oracle)と観測されたギャップも言及。
  • IndoLEMは大規模で標準化されたインドネシア語ベンチマークと新規の談話タスクを提供し、インドネシア語NLPの再現可能な評価と進展を促進する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。