Skip to main content
QUICK REVIEW

[논문 리뷰] MEGAVERSE: Benchmarking Large Language Models Across Languages, Modalities, Models and Tasks

Sanchit Ahuja, Divyanshu Aggarwal|arXiv (Cornell University)|2023. 11. 13.
Natural Language Processing Techniques인용 수 4
한 줄 요약

MEGAV ERS E는 81개의 언어, 특히 자원이 부족한 아프리카 언어를 포함한 22개의 데이터셋을 포함하는 종합적인 다국어 및 다중모态 벤치마크를 소개한다. 이는 GPT-4, PaLM2, LLaVA-v1.5와 같은 최신 대규모 언어 모델(LM)을 평가하기 위해 제작되었다. GPT-4는 특히 자원이 부족한 언어에서 다른 모델들을 능가하는 것으로 나타났으며, 데이터셋 오염 문제와 ROUGE-L 이외의 평가 지표가 필요하다는 점을 드러냈다.

ABSTRACT

There has been a surge in LLM evaluation research to understand LLM capabilities and limitations. However, much of this research has been confined to English, leaving LLM building and evaluation for non-English languages relatively unexplored. Several new LLMs have been introduced recently, necessitating their evaluation on non-English languages. This study aims to perform a thorough evaluation of the non-English capabilities of SoTA LLMs (GPT-3.5-Turbo, GPT-4, PaLM2, Gemini-Pro, Mistral, Llama2, and Gemma) by comparing them on the same set of multilingual datasets. Our benchmark comprises 22 datasets covering 83 languages, including low-resource African languages. We also include two multimodal datasets in the benchmark and compare the performance of LLaVA models, GPT-4-Vision and Gemini-Pro-Vision. Our experiments show that larger models such as GPT-4, Gemini-Pro and PaLM2 outperform smaller models on various tasks, notably on low-resource languages, with GPT-4 outperforming PaLM2 and Gemini-Pro on more datasets. We also perform a study on data contamination and find that several models are likely to be contaminated with multilingual evaluation benchmarks, necessitating approaches to detect and handle contamination while assessing the multilingual performance of LLMs.

연구 동기 및 목표

  • 영어 외 다국어 평가를 확장하기 위해, 자원이 부족한 아프리카 언어와 다중모달 데이터셋 2개를 포함한 6개의 새로운 데이터셋을 포함한다.
  • GPT-3.5-Turbo, GPT-4, PaLM2, Llama2(3가지 버전), LLaVA-v1.5와 같은 최신 SOTA LLM을 다양한 작업과 언어에서 평가한다.
  • 기존 벤치마크에서 비영어 및 다중모달 능력에 대한 종합적인 평가 부족 문제를 해결한다.
  • 특히 자원이 부족한 언어나 비라틴 문자를 사용하는 언어에서의 성능 격차를 규명하고, 데이터셋 오염과 같은 문제를 드러낸다.
  • 향후 연구를 지원하기 위해 코드와 데이터를 공개한다.

제안 방법

  • MEGA 벤치마크 스위트를 확장하여, 다중모달 데이터셋 2개를 포함한 6개의 새로운 데이터셋을 통합하여 MEGAV ERS E를 구성하였으며, 22개의 데이터셋을 통해 총 81개 언어를 커버한다.
  • 표준화된 프롬프팅 전략을 사용하여 다섯 가지 SOTA LLM(GPT-4, PaLM2, Llama2(세 가지 버전), GPT-3.5-Turbo, LLaVA-v1.5)을 평가한다.
  • 다국어 작업에는 단일언어 프롬프팅을 적용하고, 이미지 캡션 및 추론 작업에서 다중모달 성능을 평가한다.
  • 정확도, ROUGE-L, chrF++와 같은 표준 지표를 생성 및 분류 작업에 사용하지만, ROUGE-L의 요약 평가 한계를 지적한다.
  • GPT-4에 대해 MEGA 데이터셋의 오염 분석을 수행했지만, 새로운 데이터셋이나 PaLM2, Llama2와 같은 모델에 대해서는 수행하지 않았다.
  • 모든 코드와 평가 스크립트를 공개하여 재현 가능성과 다국어 및 다중모달 LLM 평가 분야의 향후 연구를 지원한다.
Figure 11: Results for XNLI across all languages and models for monolingual prompting
Figure 11: Results for XNLI across all languages and models for monolingual prompting

실험 결과

연구 질문

  • RQ1GPT-4, PaLM2, Llama2와 같은 선도적 LLM은 자원이 부족한 아프리카 언어를 포함한 81개 언어에서 어떻게 성능을 보이는가?
  • RQ2LLaVA-v1.5와 같은 다중모달 모델은 이미지 캡션 및 시각적 추론과 같은 다국어 다중모달 작업에서 어떻게 비교적으로 성능을 내는가?
  • RQ3라틴 문자 외의 문자를 사용하는 언어나 자원이 부족한 환경에서 모델 성능 격차는 어느 정도 지속되는가?
  • RQ4ROUGE-L과 chrF++와 같은 표준 평가 지표는 요약 품질을 실제로 반영하는가, 특히 자원이 부족한 환경에서 어떻게 되는가?
  • RQ5데이터셋 오염은 비영어 언어 평가에서 성능 점수를 과도하게 높이는 데 어떤 역할을 하는가?

주요 결과

  • GPT-4는 대부분의 다국어 작업에서 PaLM2와 Llama 모델보다 뛰어나며, 특히 자원이 부족한 언어와 비라틴 문자 언어에서 두각을 나타낸다.
  • PaLM2는 XNLI, PAWS-X, Belebele에서 GPT-4를 앞서지만, GPT-4는 TyDiQA와 XQuaD를 포함한 11개의 핵심 다국어 작업 중 7개에서 선두를 차지한다.
  • Llama2 모델은 인도어 및 아프리카 언어에서 특히 성능이 열악하여, 미세조정 없이 배포하기에는 준비가 되어 있지 않음을 시사한다.
  • ROUGE-L 점수는 요약 품질 평가에 부적합하며, 많은 타당한 출력에도 낮은 점수를 받는 경향이 있으며, 특히 자원이 부족한 환경에서 두드러진다.
  • LLaVA-v1.5 모델은 자원이 풍부한 언어에서 이미지 캡션 작업에서는 잘 수행하지만, 시각적 추론 작업에서는 어려움을 겪어, 다양한 언어 간 다중모달 추론 능력의 격차를 드러낸다.
  • 데이터셋 오염은 여전히 심각한 문제이며, 특히 비영어 벤치마크에서 더욱 심각하며, 향후 연구에서는 오염 탐지 및 방지를 우선시해야 한다.
Figure 12: Results for Indic-XNLI across all languages for monolingual prompting
Figure 12: Results for Indic-XNLI across all languages for monolingual prompting

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.