Skip to main content
QUICK REVIEW

[论文解读] MEGAVERSE: Benchmarking Large Language Models Across Languages, Modalities, Models and Tasks

Sanchit Ahuja, Divyanshu Aggarwal|arXiv (Cornell University)|Nov 13, 2023
Natural Language Processing Techniques被引用 4
一句话总结

MEGAV ERS E 引入了一个全面的多语言和多模态基准,涵盖 81 种语言的 22 个数据集,包括低资源的非洲语言,用于评估最先进的 LLM,如 GPT-4、PaLM2 和 LLaVA-v1.5。结果显示,GPT-4 在大多数任务中表现优于其他模型,尤其在低资源语言上表现突出,同时揭示了数据集污染等关键问题,并强调了在 ROUGE-L 之外需要更优的评估指标。

ABSTRACT

There has been a surge in LLM evaluation research to understand LLM capabilities and limitations. However, much of this research has been confined to English, leaving LLM building and evaluation for non-English languages relatively unexplored. Several new LLMs have been introduced recently, necessitating their evaluation on non-English languages. This study aims to perform a thorough evaluation of the non-English capabilities of SoTA LLMs (GPT-3.5-Turbo, GPT-4, PaLM2, Gemini-Pro, Mistral, Llama2, and Gemma) by comparing them on the same set of multilingual datasets. Our benchmark comprises 22 datasets covering 83 languages, including low-resource African languages. We also include two multimodal datasets in the benchmark and compare the performance of LLaVA models, GPT-4-Vision and Gemini-Pro-Vision. Our experiments show that larger models such as GPT-4, Gemini-Pro and PaLM2 outperform smaller models on various tasks, notably on low-resource languages, with GPT-4 outperforming PaLM2 and Gemini-Pro on more datasets. We also perform a study on data contamination and find that several models are likely to be contaminated with multilingual evaluation benchmarks, necessitating approaches to detect and handle contamination while assessing the multilingual performance of LLMs.

研究动机与目标

  • 通过包含 6 个新数据集(包括低资源非洲语言和两个多模态数据集)来扩展多语言 LLM 评估,超越英语的局限。
  • 在多样化任务和语言上对最先进的 LLM(GPT-3.5-Turbo、GPT-4、PaLM2、Llama2(3 个变体)和 LLaVA-v1.5)进行基准测试。
  • 解决现有基准中对非英语和多模态能力缺乏全面评估的问题。
  • 识别性能差异,特别是针对低资源和非拉丁字母语言,并突出数据集污染等问题。
  • 发布代码和数据,以支持未来在多语言和多模态 LLM 评估方面的研究。

提出的方法

  • 通过整合六个新数据集(包括两个多模态数据集)扩展 MEGA 基准套件,形成 MEGAV ERS E,覆盖 22 个数据集中的 81 种语言。
  • 使用标准化的提示策略,对五种 SOTA LLM(GPT-4、PaLM2、Llama2(三个版本)、GPT-3.5-Turbo 和 LLaVA-v1.5)进行评估。
  • 在多语言任务中使用单语言提示,并在图像字幕生成和视觉推理任务上评估多模态性能。
  • 使用标准指标(如准确率、ROUGE-L 和 chrF++)评估生成和分类任务,同时指出 ROUGE-L 在摘要任务中的局限性。
  • 对 GPT-4 的 MEGA 数据集进行污染分析,但未对新数据集或 PaLM2 和 Llama2 等模型进行此类分析。
  • 发布所有代码和评估脚本,以支持多语言和多模态 LLM 评估的可复现性和进一步研究。
Figure 11: Results for XNLI across all languages and models for monolingual prompting
Figure 11: Results for XNLI across all languages and models for monolingual prompting

实验结果

研究问题

  • RQ1领先的 LLM(如 GPT-4、PaLM2 和 Llama2)在 81 种语言(包括低资源非洲语言)上的表现如何?
  • RQ2多模态模型(如 LLaVA-v1.5)在多语言多模态任务(如图像字幕生成和视觉推理)上的表现如何?
  • RQ3在非拉丁字母语言和低资源环境下,模型性能差异在多大程度上仍然存在?
  • RQ4标准评估指标(如 ROUGE-L 和 chrF++)在多大程度上能反映实际生成质量,尤其是在低资源环境下?
  • RQ5数据集污染在非英语评估中如何导致性能分数虚高?

主要发现

  • GPT-4 在大多数多语言任务中表现优于 PaLM2 和 Llama 模型,尤其在低资源语言和非拉丁字母语言上表现更优。
  • PaLM2 在 XNLI、PAWS-X 和 Belebele 任务上优于 GPT-4,但 GPT-4 在 11 个核心多语言任务中的 7 个上表现领先,包括 TyDiQA 和 XQuaD。
  • Llama2 模型在印度语和非洲语言上的表现尤其差,表明其在未微调的情况下缺乏部署准备。
  • ROUGE-L 评分不足以评估摘要质量,因为许多合理输出获得较低评分,尤其在低资源环境下。
  • LLaVA-v1.5 模型在高资源语言的图像字幕生成任务中表现良好,但在视觉推理任务中表现不佳,表明多模态推理在不同语言间存在差距。
  • 数据集污染仍是关键问题,尤其在非英语基准中,未来工作必须优先关注污染检测与预防。
Figure 12: Results for Indic-XNLI across all languages for monolingual prompting
Figure 12: Results for Indic-XNLI across all languages for monolingual prompting

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。