Skip to main content
QUICK REVIEW

[論文レビュー] MEGAVERSE: Benchmarking Large Language Models Across Languages, Modalities, Models and Tasks

Sanchit Ahuja, Divyanshu Aggarwal|arXiv (Cornell University)|Nov 13, 2023
Natural Language Processing Techniques被引用数 4
ひとこと要約

MEGAV ERS E は、81言語(低リソースのアフリカ言語を含む)にまたがる22のデータセットを含む包括的な多言語・多モodalベンチマークを提供し、GPT-4、PaLM2、LLaVA-v1.5 などの最先端の大規模言語モデル(LLM)の評価を目的としている。GPT-4 は特に低リソース言語において他のモデルを上回る性能を示した一方で、データセットの汚染や ROUGE-L 以外のより良い評価指標の必要性といった重要な問題が浮き彫りになった。

ABSTRACT

There has been a surge in LLM evaluation research to understand LLM capabilities and limitations. However, much of this research has been confined to English, leaving LLM building and evaluation for non-English languages relatively unexplored. Several new LLMs have been introduced recently, necessitating their evaluation on non-English languages. This study aims to perform a thorough evaluation of the non-English capabilities of SoTA LLMs (GPT-3.5-Turbo, GPT-4, PaLM2, Gemini-Pro, Mistral, Llama2, and Gemma) by comparing them on the same set of multilingual datasets. Our benchmark comprises 22 datasets covering 83 languages, including low-resource African languages. We also include two multimodal datasets in the benchmark and compare the performance of LLaVA models, GPT-4-Vision and Gemini-Pro-Vision. Our experiments show that larger models such as GPT-4, Gemini-Pro and PaLM2 outperform smaller models on various tasks, notably on low-resource languages, with GPT-4 outperforming PaLM2 and Gemini-Pro on more datasets. We also perform a study on data contamination and find that several models are likely to be contaminated with multilingual evaluation benchmarks, necessitating approaches to detect and handle contamination while assessing the multilingual performance of LLMs.

研究の動機と目的

  • 英語以外の言語への多言語 LLM 評価を拡張するため、低リソースのアフリカ言語を含む 6 つの新規データセット(2 つは多モーダル)を追加する。
  • GPT-3.5-Turbo、GPT-4、PaLM2、Llama2(3 バリエーション)、LLaVA-v1.5 といった最先端の LLM を、多様なタスクと言語でベンチマーク化する。
  • 既存のベンチマークでは非英語および多モーダル能力の包括的評価が不足している問題に対処する。
  • 特に低リソース言語や非ラテン文字を使用する言語において性能の格差が生じる原因を特定し、データセット汚染などの問題を浮き彫りにする。
  • 今後の研究を支援するため、コードとデータを公開する。

提案手法

  • MEGA ベンチマークスイートに 6 つの新規データセット(2 つは多モーダル)を統合し、81 言語にまたがる 22 データセットをカバーする MEGAV ERS E を構築する。
  • 標準化されたプロンプト戦略を用いて、5 つの最先端 LLM(GPT-4、PaLM2、Llama2(3 バージョン)、GPT-3.5-Turbo、LLaVA-v1.5)を評価する。
  • 多言語タスクには単一言語プロンプトを採用し、画像キャプション作成および視覚的推論タスクにおける多モーダル性能を評価する。
  • 生成および分類タスクには、正確性、ROUGE-L、chrF++ といった標準指標を用いるが、ROUGE-L が要約品質評価に限界を示すことを特定する。
  • GPT-4 に対して MEGA データセットの汚染分析を実施したが、新規データセットや PaLM2 や Llama2 といったモデルについては実施しなかった。
  • 再現可能性および多言語・多モーダル LLM 評価分野における今後の研究を促進するため、すべてのコードと評価スクリプトを公開する。
Figure 11: Results for XNLI across all languages and models for monolingual prompting
Figure 11: Results for XNLI across all languages and models for monolingual prompting

実験結果

リサーチクエスチョン

  • RQ1GPT-4 や PaLM2、Llama2 といった代表的な LLM は、低リソースのアフリカ言語を含む 81 言語において、どの程度の性能を示すか?
  • RQ2LLaVA-v1.5 などの多モーダルモデルは、画像キャプション作成や視覚的推論を含む多言語多モーダルタスクにおいて、どのように性能を発揮するか?
  • RQ3ラテン文字以外の文字を使用する言語や低リソース環境において、モデルの性能格差はどの程度持続するか?
  • RQ4ROUGE-L や chrF++ といった標準評価指標は、生成品質をどれほど的確に反映しているか、特に低リソース環境では?
  • RQ5データセット汚染は、非英語の評価において性能スコアの上昇を引き起こす要因となり、その影響はどの程度か?

主な発見

  • GPT-4 は、特に低リソース言語や非ラテン文字を使用する言語において、PaLM2 や Llama モデルを上回る性能を示した。
  • PaLM2 は XNLI、PAWS-X、Belebele で GPT-4 を上回ったが、11 個のコア多言語タスクのうち 7 個(TyDiQA や XQuaD を含む)で GPT-4 がリードした。
  • Llama2 モデルは、インド系言語およびアフリカ系言語において特に低い性能を示し、微調整なしでは実用化に不適切であることが示された。
  • ROUGE-L スコアは要約品質の評価に不十分であり、多くの妥当な出力が低スコアとなることが判明した。特に低リソース環境で顕著だった。
  • LLaVA-v1.5 は高リソース言語における画像キャプション作成では良好な性能を示したが、視覚的推論タスクでは困難を示し、多言語にまたがる多モーダル推論のギャップが浮き彫りになった。
  • データセット汚染は依然として深刻な問題であり、特に非英語のベンチマークで顕著である。今後の研究では汚染の検出と防止を最優先事項とするべきである。
Figure 12: Results for Indic-XNLI across all languages for monolingual prompting
Figure 12: Results for Indic-XNLI across all languages for monolingual prompting

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。