[논문 리뷰] Bactrian-X: Multilingual Replicable Instruction-Following Models with Low-Rank Adaptation
Bactrian-X는 52개 언어에서 340만 개의 지시-응답 쌍을 포함한 다국어 지시 따르기 데이터셋을 번역 및 응답 딜리게이션을 통해 구축한다. 저랭크 적응(LoRA)을 사용하여 기초 모델과 기존 지시 튜닝 모델보다 훨씬 우수한 제로샷 다국어 성능을 보이는 경량의 플러그인 어댑터를 훈련시켰으며, XCOPA, XWinograd 및 인간 평가를 포함한 다양한 벤치마크에서 BLOOMZ 및 Alpaca와 같은 모델들을 능가한다.
Instruction tuning has shown great promise in improving the performance of large language models. However, research on multilingual instruction tuning has been limited due to the scarcity of high-quality instruction-response datasets across different languages. To bridge this gap, we present Bactrian-X, a comprehensive multilingual parallel dataset of 3.4 million instruction-response pairs across 52 languages. Leveraging this dataset, we train a set of adapters using low-rank adaptation (LoRA), which are lightweight components that seamlessly integrate with large language models. These adapters have a substantially lower parameter count than the base model, making them easily replaceable and usable as plug-ins for different languages or language groups. Extensive experiments in various multilingual evaluation settings demonstrate that models derived from LoRA-based training over Bactrian-X outperform both the vanilla models and existing instruction-tuned models. The code and models are publicly available at https://github.com/mbzuai-nlp/bactrian-x
연구 동기 및 목표
- 지시 따르기 모델을 훈련하기 위한 고품질의 다국어 지시-응답 데이터셋 부족 문제를 해결하기 위해.
- 영어 외의 저자원 언어를 포함한 다국어 일반화 능력을 향상시키기 위해.
- 저랭크 적응(LoRA)을 사용한 파rameter 효율적인 미세조정 방법을 개발하여 최소한의 파라미터로 플러그인 방식의 언어별 적응을 가능하게 하기 위해.
- 제안된 다국어 데이터셋과 어댑터 기법의 효과성을 다양한 제로샷 다국어 NLP 작업에서 평가하기 위해.
- 연구를 가속화하기 위해 공개된 모델과 코드를 제공하기 위해.
제안 방법
- Bactrian-X 데이터셋은 Google Translate를 사용하여 Alpaca와 Dolly의 영어 지시어를 52개 언어로 번역하여 구축된다.
- 각 번역된 지시어에 대한 응답은 품질과 일관성을 확보하기 위해 출력 딜리게이션 기법을 사용한 GPT-4를 통해 생성된다.
- 저랭크 적응(LoRA)은 기초 모델(BLOOM 및 LLaMA)을 미세조정하기 위해 적용되며, 전체 모델에 비해 훨씬 적은 파라미터를 가진 학습 가능한 어댑터 행렬을 도입한다.
- LoRA 어댑터는 다국어 데이터셋에서 엔드 투 엔드로 훈련되어 다양한 언어나 언어 그룹에 대해 플러그인 방식으로 배포 가능하다.
- XCOPA, XStoryCloze, XWinograd, SentimentX 및 EXAMS와 같은 다국어 벤치마크를 통해 GPT-4와 인간 평가자들을 활용해 평가를 수행한다.
- 모든 데이터셋, 코드 및 훈련된 어댑터 가중치를 공개하여 재현 가능성을 확보한다.

실험 결과
연구 질문
- RQ1자동 번역 및 응답 딜리게이션을 통해 구축된 대규모 다국어 지시 따르기 데이터셋이 다양한 언어에서 고품질의 지시 튜닝을 달성할 수 있는가?
- RQ2저랭크 적응(LoRA)이 저자원 언어를 포함한 다국어 모델에 대해 효과적이고 파라미터 효율적인 지시 튜닝을 가능하게 하는가?
- RQ3Bactrian-X에서 LoRA로 미세조정된 모델은 기존의 베이스 모델 및 지시 튜닝 모델(BLOOMZ, Alpaca 등)과 비교해 제로샷 다국어 일반화에서 어떻게 성능을 내는가?
- RQ4기본 모델의 사전 훈련에서 볼 수 없었던 언어에 대해 제안된 모델은 얼마나 잘 일반화되는가?
- RQ5인간 평가 및 GPT-4 점수는 제안된 모델이 다양한 언어적 맥락과 작업 설정에서 우월함을 확인할 수 있는가?
주요 결과
- BX${}_{\text{BLOOM}}$와 BX${}_{\text{LLaMA}}$는 평가된 모든 다국어 벤치마크에서 기초 모델 및 지시 튜닝 대응 모델(BLOOMZ 및 Alpaca)을 모두 능가한다.
- 인간 평가에서 BX${}_{\text{BLOOM}}$는 아랍어에 대해 평균 순위 점수 86.7, 인도네시아어에 대해 80.0, 중국어에 대해 84.6을 기록하여 BLOOMZ 및 Alpaca를 뚜렷이 앞서 간다.
- BX${}_{\text{LLaMA}}$는 라카나어에 대해 최고 점수 92.1을 기록했고, 타갈로그어에 대해서도 81.7점을 기록했다—이러한 언어들은 BLOOM의 사전 훈련 기간에 포함되지 않았음에도 불구하고, 강력한 제로샷 일반화 능력을 보여준다.
- XCOPA, XWinograd 및 XStoryCloze에서 최고 성능을 기록했으며, 고자원 언어뿐 아니라 저자원 언어 모두에서 일관된 향상이 이루어졌다.
- GPT-4 평가 결과, 제안된 모델은 기준 모델보다 더 정확하고 논리적이고 지시어에 부합하는 응답을 생성함을 확인했다.
- Bactrian-X 데이터셋은 52개 언어에서 340만 개의 지시-응답 쌍을 포함하여, 현재까지 가장 큰 일반 목적의 다국어 지시 데이터셋이다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.