[논문 리뷰] Extrapolating Large Language Models to Non-English by Aligning Languages
이 논문은 LLaMA-7B와 같은 대규모 언어 모델의 비영어 언어 능력을 향상시키기 위해 번역 및 다국어 지시 데이터를 사용하여 언어 간 의미 공간을 정렬하는 교차 언어 지시 튜닝(CoIT)과 다국어 지시 튜닝(MuIT)을 제안한다. 비영어 질문-응답 태스크에서 영어 튜닝된 Alpaca-7B 대비 평균 27.83% 향상되고 번역 태스크에서 18.89% 향상되었으며, m-LLaMA는 중간 레이어에서 강력한 다국어 지시 따르기 능력과 의미가 정렬된 표현을 보였다.
Existing large language models show disparate capability across different languages, due to the imbalance in the training data. Their performances on English tasks are often stronger than on tasks of other languages. In this paper, we empower pre-trained LLMs on non-English languages by building semantic alignment across languages. We start from targeting individual languages by performing cross-lingual instruction-tuning (CoIT) on LLaMA, i.e. tuning it with translation task data and cross-lingual general task data to obtain cross-lingual models (x-LLaMAs), and formulate underlying scaling laws to investigate the advantages of using scalable translation data. Then we perform multilingual instruction-tuning (MuIT) with mixed resources to build multilingual m-LLaMA. We also illustrate how we leverage the scaling laws to optimize data allocation in a resource-constrained setting. Experiment results on cross-lingual benchmarks XQUAD and MLQA show that x-LLaMAs surpass the English instruction-tuned counterpart (Alpaca) by an average of 27.83% across six non-English languages. Evaluation results on translation dataset Flores-101 show that x-LLaMAs outperform previous LLaMA-based models by an average of 18.89%. Encouragingly, m-LLaMA achieves comparable performance to x-LLaMAs on individual languages and demonstrates the ability to follow multilingual instructions. Further analysis on response content and representation space reveals the alignment of the multilingual semantic space within the middle layers of m-LLaMA.
연구 동기 및 목표
- 영어와 유사성이 낮은 비영어 언어에서의 대규모 언어 모델 성능 불균형 문제를 해결하기 위해.
- 광범위한 계속 학습 없이도 비영어 언어에서의 제로샷 및 피처샷 성능을 향상시키기 위해.
- 자원이 제한된 저자원 언어로 영어 언어 모델 능력을 확장할 수 있는 확장성 있고 데이터 효율적인 방법을 개발하기 위해.
- 자원 제약 조건 하에서 교차 언어 지시 튜닝의 스케일링 법칙을 수립하고 자원 할당을 최적화하기 위해.
- 다국어 지시 튜닝이 다국어 지시를 따르고 의미가 정렬된 다국어 응답을 생성할 수 있는 모델을 생성할 수 있음을 입증하기 위해.
제안 방법
- 번역 태스크와 교차 언어 일반 태스크에서 동시에 미세조정하여 언어별 x-LLaMA를 생성하는 교차 언어 지시 튜닝(CoIT)을 제안한다.
- 혼합 다국어 지시 데이터를 사용하여 단일 m-LLaMA 모델을 훈련시켜 다국어 지시 따르기 능력을 갖춘 모델을 개발한다.
- 자원 제약 조건 하에서 최적의 자원 할당을 안내하기 위해 데이터 양과 모델 성능 기반의 CoIT 스케일링 법칙을 수립한다.
- 고정된 데이터 예산 내에서 다국어 성능 평균을 최대화하기 위해 비선형 프로그래밍을 사용해 언어 간 자원 할당을 최적화한다.
- 표현 공간 분석과 응답 일관성 분석을 통해 m-LLaMA의 중간 레이어에서 특히 의미 정렬이 이루어졌는지 확인한다.
- 복잡성을 줄이기 위해 비영어 언어의 어휘 확장을 피하고, 바이트 수준 토크나이제이션과 교차 언어 정렬에 의존한다.
실험 결과
연구 질문
- RQ1번역 태스크와 일반 교차 언어 태스크에서의 공동 지시 튜닝이 비영어 언어에서의 대규모 언어 모델 성능을 크게 향상시킬 수 있는가?
- RQ2언어별 x-LLaMA의 성능은 영어 튜닝 모델인 Alpaca에 비해 비영어 벤치마크에서 어떻게 비교되는가?
- RQ3단일 다국어 모델(m-LLaMA)이 전용 x-LLaMA와 유사한 성능을 달성하면서도 다국어 지시 따르기 능력을 갖출 수 있는가?
- RQ4특히 중간 레이어에서 m-LLaMA의 의미 공간이 다국어 간에 얼마나 정렬되어 있는가?
- RQ5제안된 스케일링 법칙이 제한된 데이터 예산 하에서 다국어 지시 튜닝의 효율적 자원 할당을 안내할 수 있는가?
주요 결과
- x-LLaMA는 XQUAD 및 MLQA 벤치마크에서 6개의 비영어 언어에서 평균 27.83% 향상되어 Alpaca-7B를 초월한다.
- x-LLaMA는 Flores-101 번역 벤치마크에서 이전 LLaMA 기반 모델 대비 평균 18.89% 향상된 성능을 기록한다.
- m-LLaMA는 개별 언어에서 강력한 x-LLaMA와 유사한 성능을 달성하며, 다국어 지시 따르기 능력을 보였다.
- 분석 결과, m-LLaMA의 다국어 의미 공간은 중간 레이어에서 정렬되어 있음을 확인하여 효과적인 교차 언어 표현 학습이 이루어졌음을 시사한다.
- 스케일링 법칙 기반 최적화된 자원 할당은 균일한 할당보다 다국어 성능을 크게 향상시키며, 특히 높은 데이터 예산(예: 120만 토큰)에서 두드러진다.
- 비교적 스케일링 법칙을 통해 평행(번역) 데이터 사용이 의미 정렬을 달성하기 위해 단순한 단일 언어 계속 학습보다 훨씬 효율적임을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.