[논문 리뷰] Aya 23: Open Weight Releases to Further Multilingual Progress
Aya 23는 23개 언어를 커버하는 8B 및 35B 다국어 모델의 오픈 가중치를 공개하여 깊이와 폭의 균형을 맞추고 Aya 101 및 경쟁 모델보다 판별적, 생성적 및 다국어 작업에서 성능을 향상시킵니다.
This technical report introduces Aya 23, a family of multilingual language models. Aya 23 builds on the recent release of the Aya model (Üstün et al., 2024), focusing on pairing a highly performant pre-trained model with the recently released Aya collection (Singh et al., 2024). The result is a powerful multilingual large language model serving 23 languages, expanding state-of-art language modeling capabilities to approximately half of the world's population. The Aya model covered 101 languages whereas Aya 23 is an experiment in depth vs breadth, exploring the impact of allocating more capacity to fewer languages that are included during pre-training. Aya 23 outperforms both previous massively multilingual models like Aya 101 for the languages it covers, as well as widely used models like Gemma, Mistral and Mixtral on an extensive range of discriminative and generative tasks. We release the open weights for both the 8B and 35B models as part of our continued commitment for expanding access to multilingual progress.
연구 동기 및 목표
- 영어를 넘어선 언어 커버리지를 확장하여 LLM의 데이터 부족과 다국어성을 해결한다.
- 사전 학습에서 더 많은 용량을 소수의 언어에 할당하는 영향력을 조사한다.
- 다국어 및 교차 언어 성능을 판별적, 생성적 및 수학적 추론 과제에서 평가한다.
제안 방법
- 기본 아키텍처: 병렬 어텐션/FFN, SwiGLU, 바이어스 없음, RoPE 위치 임베딩, 256k BPE 토크나이저를 갖춘 Cohere Command 계열의 디코더-전용 Transformer.
- 다국어 템플릿, 인간 주석, 번역 데이터 및 합성 데이터를 포함한 다국어 혼합 데이터 소스를 사용하여 1.63M 예시의 다국어 미세조정 세트를 생성하기 위한 지시문 미세조정.
- 훈련 설정: 13,200 업데이트 스텝, 8192 컨텍스트 길이, 코사인 LR 스케줄이 있는 Adam, 피크 LR 6e-4, 엔드 LR 6e-5, 배치 크기 64, 최대 128 pod 슬라이스를 가진 TPUv4.
- 모델 변형: 8B 모델은 Aya-23-8B, 대형 모델들은 Aya-23-35B로, 8B 모델에 Grouped Query Attention (GQA) 적용 및 더 큰 모델에는 표준 어텐션.
- 평가 프레임워크: 판별적 작업에 대해 Üstün 등(2024) 및 eval-harness를 따른 다국어 평가, 다국어 MMLU, MGSM, 번역 및 요약과 안전/편향 평가 포함.
실험 결과
연구 질문
- RQ1사전 학습 언어의 수를 늘려 더 넓은 다국어 모델링이 언어별 성능을 개선할 수 있는가?
- RQ2Aya 23 모델은 23개 언어에 대해 판별적, 생성적, 번역 및 수학적 추론 과제에서 어떻게 성능을 보이는가?
- RQ3다국어 환경에서 Aya 23 모델의 안전성 및 독성 프로파일은 강력한 기준선과 비교하여 어떤가?
- RQ4Aya 23의 오픈-가중치 공개가 다국어 NLP의 접근성 및 연구 진전에 의미 있게 기여하는가?
주요 결과
- Aya 23-35B는 평가된 모든 과제와 언어에서 최고 성능을 달성하며 Aya 101 및 경쟁 모델을 능가한다.
- Aya 23-8B는 소형 모델 중 다국어 성능에서 최고 수준으로, 판별적 과제에서 최대 14% 개선, 생성적 과제에서 최대 20% 개선, 다국어 MMLU에서 Aya 101에 비해 최대 41.6% 향상.
- Aya 23 모델은 다국어 수학적 추론에서 강력한 성능을 보이며 MGSM에서 Aya 101 대비 6.6배의 증가를 기록했다.
- 오픈 엔드 평가에서 Aya 23 모델은 GPT-4 심판 및 인간 평가에서 일관되게 베이스라인보다 선호되며 특히 비유럽 언어에서 두드러진 차이를 보인다.
- 안전성 분석에서 Aya-101-13B 대비 Aya 23의 유해한 응답이 감소했고, 더 큰 모델일수록 여러 언어에서 유해성 감소가 더 두드러졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.