Skip to main content
QUICK REVIEW

[論文レビュー] SIB-200: A Simple, Inclusive, and Big Evaluation Dataset for Topic Classification in 200+ Languages and Dialects

David Ifeoluwa Adelani, Hannah Liu|arXiv (Cornell University)|Sep 14, 2023
Natural Language Processing TechniquesComputer Science被引用数 3
ひとこと要約

SIB-200 は、205 語および方言におけるトピック分類のための大規模かつオープンソースのベンチマークデータセットであり、Flores-200 の並列コーパスに含まれる英語文をアノテートし、204 語の他の言語へラベルを拡張することで構築されたものである。評価では、高リソース言語と低リソース言語の間で顕著な性能格差が明らかになった。特に、ニロチック語族やアトランティック=コンゴ語族など、代表が不足している語族およびアフリカ、アメリカ、オセアニア、東南アジアの言語において顕著であった。

ABSTRACT

Despite the progress we have recorded in the last few years in multilingual natural language processing, evaluation is typically limited to a small set of languages with available datasets which excludes a large number of low-resource languages. In this paper, we created SIB-200 -- a large-scale open-sourced benchmark dataset for topic classification in 200 languages and dialects to address the lack of evaluation dataset for Natural Language Understanding (NLU). For many of the languages covered in SIB-200, this is the first publicly available evaluation dataset for NLU. The dataset is based on Flores-200 machine translation corpus. We annotated the English portion of the dataset and extended the sentence-level annotation to the remaining 203 languages covered in the corpus. Despite the simplicity of this task, our evaluation in full-supervised setting, cross-lingual transfer setting and prompting of large language model setting show that there is still a large gap between the performance of high-resource and low-resource languages when multilingual evaluation is scaled to numerous world languages. We found that languages unseen during the pre-training of multilingual language models, under-represented language families (like Nilotic and Altantic-Congo), and languages from the regions of Africa, Americas, Oceania and South East Asia, often have the lowest performance on our topic classification dataset. We hope our dataset will encourage a more inclusive evaluation of multilingual language models on a more diverse set of languages. https://github.com/dadelani/sib-200

研究の動機と目的

  • 多様で低リソースの言語における自然言語理解(NLU)の包括的かつ大規模な評価データセットの不足を解消すること。
  • 英語、フランス語、中国語など高リソース言語にとどまらない、包括的な多言語評価を可能にするベンチマークの構築。
  • 特に代表が不足している言語を対象に、言語系統や地理的地域ごとのモデル性能を体系的分析すること。
  • 事前学習におけるドメイン多様性と言語カバレッジの多様性が、クロスリンガル転移およびゼロショット一般化に与える影響を調査すること。
  • 205 語の標準化されたオープンデータセットを提供することで、多言語モデルの公平な評価を促進すること。

提案手法

  • Flores-200 の多言語並列コーパス(205 語)を用いて SIB-200 を構築した。
  • 英語部分の Flores-200 を、単純かつ一貫性のあるラベル付けスキームを用いてトピックラベルでアノテートした。
  • 自動バックトランスレーションとアライメントを用いて、文レベルのトピックラベルを 204 語の非英語言語へ拡張した。
  • モデル評価を、完全な教師あり微調整、クロスリンガル転移、GPT-4 を用いたゼロショットプロンプティングの 3 モードで実施した。
  • 合成データを用いた多言語言語適応的微調整(MAFT)を適用し、以前に未確認の言語における性能を向上させた。
  • 言語系統、地域、事前学習露出度ごとに言語をグループ化し、系統的な格差を特定するための性能比較を実施した。
Figure 1: Heatmap of the performance by Region in each Joshi’s class.
Figure 1: Heatmap of the performance by Region in each Joshi’s class.

実験結果

リサーチクエスチョン

  • RQ1トピック分類におけるモデル性能は、205 語のうち特に低リソースおよび代表が不足している言語でどのように変動するか?
  • RQ2事前学習中に登場しなかった言語は、多言語 NLU タスクにおいてどの程度性能劣化を受けるか?
  • RQ3ドメイン多様性を増やさずに言語数を増やした場合、ゼロショット一般化が劣化する可能性はどの程度か?
  • RQ4合成データを用いた多言語言語適応的微調整(MAFT)は、10MB 未満の単語語彙データを有する低リソース言語の性能を顕著に向上させることができるか?
  • RQ5GPT-4 に対するプロンプティングと比較して、高リソース言語からのゼロショット転移は、205 語の多様な言語群においてどの程度効果的か?

主な発見

  • 特にニロチック語族やアトランティック=コンゴ語族など、代表が不足している言語系統に属する言語は、SIB-200 において平均正解率が 60% を下回り、最も低い性能を示した。
  • ゼロショット評価において、GPT-4 は 205 語のうち 132 語(64.7%)で 70% 未満の正解率を示し、低リソース言語への一般化能力の低さが明らかになった。
  • 英語のみで微調整された XLM-R モデルからのゼロショット転移では、81 語(全言語の 39.3%)で 70% 未満の正解率を示し、クロスリンガル転移の限界が顕在化した。
  • 合成データを用いた MAFT により、以前に未確認のアフリカ諸語の平均正解率が最大 +5% 向上した。これは、低リソース言語への適応の可能性を示している。
  • ドメイン多様性が限定的であるにもかかわらず、100 語で事前学習された XLM-R は、500 語で事前学習された Glot-500 よりも優れた性能を示した。これは、事前学習におけるドメインの混合の重要性を強調している。
  • アフリカ、アメリカ、オセアニア、東南アジアの言語は、常に性能が低く、特に事前学習または微調整データに含まれていない場合には顕著に劣化した。
Figure 2: Fully supervised Model Performance . We group languages by whether they and their scripts are seen in the pre-training corpus of XLM-R. Languages are ordered by the XLM-R performance in every group.
Figure 2: Fully supervised Model Performance . We group languages by whether they and their scripts are seen in the pre-training corpus of XLM-R. Languages are ordered by the XLM-R performance in every group.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。