Skip to main content
QUICK REVIEW

[논문 리뷰] Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier

John Dang, Shivalika Singh|arXiv (Cornell University)|2024. 12. 05.
Second Language Learning and TeachingArts and Humanities인용 수 3
한 줄 요약

Aya Expanse는 23개 언어에서 최고 성능을 기록하는 새로운 8B 및 32B 파라미터 다국어 언어 모델 패밀리를 소개한다. 이는 다국어 데이터 아르바이저, 선호도 기반 정렬, 모델 병합 기법을 융합하여 달성된다. 이 모델들은 Llama 3.1 70B와 같은 선도적인 오픈웨이트 모델을 능가하며, m-ArenaHard에서 54.0%의 승리율을 기록하고, 유사 크기의 모델들과의 비교에서 최대 76.6%의 승리율을 기록한다.

ABSTRACT

We introduce the Aya Expanse model family, a new generation of 8B and 32B parameter multilingual language models, aiming to address the critical challenge of developing highly performant multilingual models that match or surpass the capabilities of monolingual models. By leveraging several years of research at Cohere For AI and Cohere, including advancements in data arbitrage, multilingual preference training, and model merging, Aya Expanse sets a new state-of-the-art in multilingual performance. Our evaluations on the Arena-Hard-Auto dataset, translated into 23 languages, demonstrate that Aya Expanse 8B and 32B outperform leading open-weight models in their respective parameter classes, including Gemma 2, Qwen 2.5, and Llama 3.1, achieving up to a 76.6% win-rate. Notably, Aya Expanse 32B outperforms Llama 3.1 70B, a model with twice as many parameters, achieving a 54.0% win-rate. In this short technical report, we present extended evaluation results for the Aya Expanse model family and release their open-weights, together with a new multilingual evaluation dataset m-ArenaHard.

연구 동기 및 목표

  • 주로 저자원 언어 및 영어 외 언어에서의 단일 언어 모델과 다국어 모델 간의 지속적인 성능 격차를 해소한다.
  • 다양한 언어적 및 문화적 맥락에서의 정렬을 향상시켜 다국어 모델의 편향과 안전성 결함을 완화한다.
  • 토큰화 및 모델 효율성 최적화를 통해 저자원 언어의 추론 비용과 지연 시간을 줄인다.
  • 고품질의 다국어 지시 튜닝을 통해 언어 간 격차를 해소하고, 단일 언어 모델의 성능을 충족하거나 초월한다.
  • 오픈웨이트 모델과 새로운 다국어 평가 기준 m-ArenaHard를 통해 다국어 AI 분야의 연구 및 개발을 가속화한다.

제안 방법

  • 23개 언어에서 다양한 교사 모델 풀에서 지식을 추출하여 다국어 데이터 아르바이저 기법을 활용해 고품질의 다양한 훈련 데이터를 합성한다.
  • 다국어 선호도 최적화 및 안전성 튜닝을 인간의 선호 신호를 기반으로 다국어 맥락에서 적용하여 정렬성과 강건성을 향상시킨다.
  • 다양한 전문 모델을 병합하는 기법을 활용해 다국어 간 전이 성능과 성능을 향상시키며, 추론 비용을 증가시키지 않는다.
  • 다국어 지시 데이터셋을 기반으로 지도형 미세조정(SFT) 및 인간 피드백을 통한 강화학습(RLHF)을 통해 기본 모델을 미세조정한다.
  • 새로운 다국어 평가 기준인 m-ArenaHard를 활용하여 Arena-Hard-Auto 데이터셋을 23개 언어로 번역함으로써 종합적인 제로샷 평가를 수행한다.
  • 저자원 언어에서의 성능 향상을 위해 모델 아키텍처 및 훈련 레시피를 최적화하여 효율성과 확장성을 유지한다.

실험 결과

연구 질문

  • RQ1다국어 언어 모델이 저자원 언어를 포함한 다양한 언어에서 단일 언어 모델과 유사한 성능을 달성할 수 있는가?
  • RQ2데이터 아르바이저 및 모델 병합 기법이 다국어 일반화 능력 향상과 언어 가문 간 성능 격차 감소에 얼마나 기여하는가?
  • RQ3다국어 선호도 튜닝이 영어 외 언어에서 모델 정렬성, 안전성, 공정성에 어떤 영향을 미치는가?
  • RQ432B 파라미터 모델이 Llama 3.1 70B와 같은 2배 이상의 파라미터를 가진 모델을 초월할 수 있는가?
  • RQ5합성 데이터 컬렉션의 품질이 번역, 추론, 이해 평가 기준에서 다국어 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • Aya Expanse 8B는 m-ArenaHard에서 Gemma 2 9B 및 Qwen 2.5 7B와 같은 선도적인 오픈웨이트 모델들과의 23개 언어 비교에서 76.6%의 승리율을 기록한다.
  • Aya Expanse 32B는 파라미터 수가 두 배 이상 많은 Llama 3.1 70B를 능가하여 m-ArenaHard에서 54.0%의 승리율을 기록한다.
  • 다국어 초등학교 수학 벤치마크(MGSM)에서 Aya Expanse 8B는 67.0의 정확도를 기록하여 Aya 23 8B 대비 1.8배 향상되었고, 모든 8B급 모델을 앞선다.
  • Aya Expanse 32B는 MGSM에서 73.4의 정확도를 기록하여 Aya 23 35B 대비 19.7점 향상되었으며, Qwen 2.5 32B(59.7)와 Gemma 2 27B(61.5)를 모두 초월한다.
  • FLORES 번역 벤치마크에서 Aya Expanse 8B는 57.2 chrF++ 및 93.2 xCOMET 점수를 기록하여 Gemma 2 9B(57.0 chrF++, 91.8 xCOMET)를 0.2 chrF++ 및 1.4 xCOMET 높게 기록했으며, 이는 +2.9 BLEU에 해당한다.
  • Aya Expanse 32B는 번역 분야에서 최고 점수(58.8 chrF++ 및 93.5 xCOMET)를 기록하여, 32B 클래스에서 Llama 3.1 70B 및 Mixtral 8x22B를 모두 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.