Skip to main content
QUICK REVIEW

[논문 리뷰] VinaLLaMA: LLaMA-based Vietnamese Foundation Model

Quan Nguyen, Huy Pham|arXiv (Cornell University)|2023. 12. 18.
Natural Language Processing Techniques인용 수 5
한 줄 요약

VinaLLaMA는 7B 파라미터를 가진 오픈 웨이트, 지시 훈련된 LLaMA-2 기반 기초 모델로, 8000억 토큰의 데이터(100만 개의 고품질 합성 샘플 및 다양한 공개 베트남어 데이터 포함)로 훈련되어, VLSP, VMLU, 베트남어 버전 비쿠나 벤치마크 등 주요 베트남어 벤치마크에서 최고 성능을 기록하며, 강력한 双어 능력과 추론 및 생성 작업에서의 SOTA 성과를 보이며, 베트남어 NLP의 새로운 기준을 설정한다.

ABSTRACT

In this technical report, we present VinaLLaMA, an open-weight, state-of-the-art (SOTA) Large Language Model for the Vietnamese language, built upon LLaMA-2 with an additional 800 billion trained tokens. VinaLLaMA not only demonstrates fluency in Vietnamese but also exhibits a profound understanding of Vietnamese culture, making it a truly indigenous model. VinaLLaMA-7B-chat, trained on 1 million high-quality synthetic samples, achieves SOTA results on key benchmarks, including VLSP, VMLU, and Vicuna Benchmark Vietnamese, marking a significant advancement in the Vietnamese AI landscape and offering a versatile resource for various applications.

연구 동기 및 목표

  • 베트남어 전용으로 최고 성능을 내는 오픈 소스 기초 모델을 개발하여, 베트남어를 위한 자체적이고 고품질의 LLM이 부족한 문제를 해결한다.
  • 문학, 뉴스 및 합성 데이터를 포함한 다양한 고품질의 베트남어 텍스트로 훈련하여, 베트남어 NLP의 언어적 및 문화적 유창성을 향상시킨다.
  • 주로 베트남어에 최적화되었음에도 불구하고, 강력한 양어(베트남어-영어) 능력을 유지하면서도, 베트남어 벤치마크에서 최고 성능을 달성한다.
  • HuggingFace에 모델을 공개하고 완전한 호환성을 확보함으로써, 베트남 AI 연구 분야의 광범위한 접근성과 협업을 가능하게 한다.
  • 저자원 언어를 위한 전문화된 고성능 언어 모델을 구축하는 데 있어 합성 데이터와 지시 훈련의 효과를 입증한다.

제안 방법

  • 인간의 반응과 유사한 출력을 유도하기 위해, 100만 개의 고품질 합성 지시 훈련 샘플을 사용해 LLaMA-2-7B를 피나이팅했다.
  • 약 8000억 토큰의 사전 훈련 데이터셋을 구성했으며, 이는 25만 권의 베트남어 책, 200만 개의 베트남어 뉴스 기사(VnExpress, BaoMoi), CulturaX의 베트남어 서브셋, 그리고 1000억 개의 영어 토큰을 포함한다.
  • 베트남어에 특화된 BKAI의 LLaMA-2-chat 토크나이저를 도입하여 토크나이제이션 효율성과 커버리지가 향상되었다.
  • 지시 데이터로의 지도 훈련 이전에, 공개 데이터와 합성 데이터를 조합한 데이터셋에서 계속적인 사전 훈련을 수행했다.
  • GPT-3.5와 GPT-4를 활용해 생성한 합성 데이터를 활용한 지시 훈련을 통해, 제로샷 및 피셔샷 일반화 능력이 향상되었다.
  • VLSP, VMLU, 비쿠나 벤치마크(베트남어), HuggingFace OpenLLM 리더보드 등 다양한 벤치마크에서 성능을 평가하여, 양어 능력을 점검했다.
Figure 2: The first stage of generating synthetic data for pretraining
Figure 2: The first stage of generating synthetic data for pretraining

실험 결과

연구 질문

  • RQ1목표 사전 훈련과 지시 훈련을 통해 LLaMA-2 기반 모델이 베트남어 NLP 벤치마크에서 최고 성능을 낼 수 있는가?
  • RQ2저자원 언어 모델(예: 베트남어 LLM)의 지시 따르기 및 추론 능력 향상에 있어 합성 데이터의 효과는 어떠한가?
  • RQ3다국어 사전 훈련 전략이 베트남어 중심 LLM에서 양어(베트남어-영어) 성능을 얼마나 향상시킬 수 있는가?
  • RQ4문화적으로 관련성이 높은 베트남어 데이터로 훈련된 기초 모델은 표면적 유창성 이상의 깊은 문화 이해를 보일 수 있는가?
  • RQ5추론, 지시 따르기, 제로샷 일반화 측면에서 VinaLLaMA는 다른 오픈 소스 베트남어 LLM과 비교해 어떤가?

주요 결과

  • VinaLLaMA-7B-chat는 VLSP, VMLU, Vicuna Benchmark Vietnamese 등 주요 베트남어 벤치마크에서 모두 최고 성능을 기록했다.
  • 비쿠나 벤치마크(베트남어)에서 VinaLLaMA-7B-chat는 모든 다섯 가지 과제에서 4.000의 점수를 기록하여, GPT-4와 동일한 성능을 보이며, 다른 오픈 소스 모델을 뛰어넘었다.
  • HuggingFace OpenLLM 리더보드에서 VinaLLaMA-7B-chat는 평균 점수 0.5227을 기록하여, LLaMA-2-7B-chat-hf(0.5074) 및 기타 오픈 모델을 압도했다.
  • GSM8K 수학 추론 벤치마크에서 VinaLLaMA-7B-chat는 5샷 점수 0.3002를 기록하여, LLaMA-2-7B-chat-hf(0.0735) 및 기타 모델을 크게 앞서갔다.
  • 모델는 영어 벤치마크에서도 높은 성능을 유지하며 강력한 양어 능력을 보였다. 이는 주로 베트남어에 최적화되었음에도 불구하고 성능 유지의 증거이다.
  • VinaLLaMA-7B-chat는 강화 학습 향상 기반 LLaMA-2 변형 모델조차도 수학 추론에서 뛰어난 성능을 보이며, 합성 데이터와 훈련 전략의 효과를 입증했다.
Figure 3: Our second stage of generating synthetic data for pretraining. Vietcuna-3B-v2 was deployed to save cost while maintaining the same performance with distillation from GPT-4
Figure 3: Our second stage of generating synthetic data for pretraining. Vietcuna-3B-v2 was deployed to save cost while maintaining the same performance with distillation from GPT-4

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.