Skip to main content
QUICK REVIEW

[논문 리뷰] SeaLLMs -- Large Language Models for Southeast Asia

Xuan-Phi Nguyen, Wenxuan Zhang|arXiv (Cornell University)|2023. 12. 01.
Topic Modeling인용 수 7
한 줄 요약

SeaLLMs는 동남아시아(Sea) 언어를 위해 특화된 대규모 언어 모델의 세트를 소개하며, Llama-2를 지속적 사전학습을 통해 확장된 Sea-중점 어휘, 하이브리드 다국어 지시 튜닝, 자기 선호 정렬을 통해 향상시킨다. 이 모델들은 자원이 적은 동남아시아 언어에서 최신 기술 수준의 성능을 달성하여, 태국어, Khmer어, 라오어, 버마어와 같은 비라틴 문자 언어에서 오픈소스 LLM 및 ChatGPT-3.5를 능가하며 영어에서도 뛰어난 성능을 유지한다.

ABSTRACT

Despite the remarkable achievements of large language models (LLMs) in various tasks, there remains a linguistic bias that favors high-resource languages, such as English, often at the expense of low-resource and regional languages. To address this imbalance, we introduce SeaLLMs, an innovative series of language models that specifically focuses on Southeast Asian (SEA) languages. SeaLLMs are built upon the Llama-2 model and further advanced through continued pre-training with an extended vocabulary, specialized instruction and alignment tuning to better capture the intricacies of regional languages. This allows them to respect and reflect local cultural norms, customs, stylistic preferences, and legal considerations. Our comprehensive evaluation demonstrates that SeaLLM-13b models exhibit superior performance across a wide spectrum of linguistic tasks and assistant-style instruction-following capabilities relative to comparable open-source models. Moreover, they outperform ChatGPT-3.5 in non-Latin languages, such as Thai, Khmer, Lao, and Burmese, by large margins while remaining lightweight and cost-effective to operate.

연구 동기 및 목표

  • 높은 자원이 있는 언어(예: 영어)에 편향된 대규모 언어 모델이 낮은 자원의 언어와 지역 언어를 희생시키는 문제를 해결하기 위해.
  • 태국어, 베트남어, 크메르어, 라오어, 버마어 등 동남아시아(Sea) 언어의 언어적·문화적 특성에 특화된 대규모 언어 모델 패밀리 개발을 위해.
  • 높은 자원 언어인 영어를 포함한 다국어 작업에서의 성능을 유지하면서도, 특히 자원이 적은 동남아시아 언어에서의 성능을 향상시키기 위해.
  • 현지 규범, 관습, 법적 프레임워크를 존중하는 경량이며 비용 효율적이고 문화적으로 민감한 AI 어시스턴트를 만들기 위해.
  • 특화된 튜닝과 자기지도 정렬이 지역 특화 언어 이해 및 생성 작업에서 일반 모델보다 뛰어난 성능을 낼 수 있음을 입증하기 위해.

제안 방법

  • Common Crawl, CC-News, 위키백과, 학술 출판물 등의 공공 자료에서 추출한 다국어 코퍼스를 활용하여 Llama-2를 지속적 사전학습하고, FastText를 사용해 동남아시아 언어에 특화된 필터링을 수행한 확장된 어휘를 적용한다.
  • 다국어 사전학습 데이터와 영어 중심의 지시 튜닝 데이터를 혼합하여 사용함으로써 다국어 능력과 지시 수행 능력 간 균형을 맞춘 하이브리드 튜닝을 수행한다.
  • 10개의 동남아시아 언어를 포함하는 균형 잡힌 맞춤형 다국어 지도 튜닝(SFT) 데이터셋을 활용해 특화된 지시 튜닝을 수행함으로써 제로샷 및 피셔샷 일반화 능력을 향상시킨다.
  • SeaLLM 모델 자체를 사용해 자기 선호 정렬 최적화를 수행함으로써 인간 평가자나 더 강력한 LLM을 사용한 보상 모델링에 의존하지 않는다.
  • 다단계 훈련 파이프라인을 사용: 지속적 사전학습 → 하이브리드 튜닝 → SFT → 자기 선호 정렬 최적화.
  • GPT-4를 심판으로 사용해 9개 언어와 5개 작업 유형(세계 지식, 독해력, 기계 번역 등)을 포함하는 종합 벤치마크(Sea-bench)에서 평가한다.
Figure 1 : Sea-bench ( Section 4.2 ) scores as evaluated by GPT-4 [ 38 ] for different models.Each radar chart compares scores as averaged across 5 categories (left) and 9 languages (right). Detailed breakdown by each category and language is given in Figure 7 in the Appendix.
Figure 1 : Sea-bench ( Section 4.2 ) scores as evaluated by GPT-4 [ 38 ] for different models.Each radar chart compares scores as averaged across 5 categories (left) and 9 languages (right). Detailed breakdown by each category and language is given in Figure 7 in the Appendix.

실험 결과

연구 질문

  • RQ1확장된 동남아시아 언어 코퍼스를 사용한 지속적 사전학습이 기반 Llama-2 모델 대비 자원이 적은 동남아시아 언어에서 성능을 크게 향상시킬 수 있는가?
  • RQ2하이브리드 및 특화된 지시 튜닝은 다양한 동남아시아 언어에서 다국어 지시 수행 능력을 어느 정도 향상시킬 수 있는가?
  • RQ3인간 평가 보상 데이터 없이 자기 선호 정렬 최적화를 통해 어시스턴트 스타일 작업에서 경쟁적인 성능을 달성할 수 있는가?
  • RQ4SeaLLM-13B는 비라틴 문자 동남아시아 언어, 특히 자원이 적은 환경에서 ChatGPT-3.5와 비교해 어떻게 성능을 낼 수 있는가?
  • RQ5문화적·법적 민감성을 반영한 튜닝이 실제 동남아시아 문화적 맥락에서의 어시스턴트 응용 프로그램에서 모델 행동을 어떻게 향상시키는가?

주요 결과

  • SeaLLM-13b-5L는 13B 파라미터 모델 중에서 세계 지식 벤치마크에서 최고 점수(63.20)를 기록했으며, Llama-2-13b(61.17) 및 기타 오픈소스 모델을 모두 압도했다.
  • 독해력 테스트에서 SeaLLM-13b-10L는 XQuAD 벤치마크에서 태국어에 대해 F1 점수 59.50을 기록했으며, Llama-2-13b(25.73)를 크게 앞서고 영어에서 ChatGPT-3.5의 성능(69.18)에 가까워졌다.
  • 기계 번역 분야에서 SeaLLM-13B는 Lao어 및 Khmer어를 포함한 자원이 적은 언어를 포함한 10개 번역 방향 중 8개에서 ChatGPT-3.5를 능가했으며, En→Lao 및 En→Khmer에서 더 높은 chrF++ 점수를 기록했다.
  • 동남아시아 언어 간 직접 번역에서, SeaLLM-13B는 10개 언어 조합 중 7개에서 ChatGPT-3.5보다 더 높은 chrF++ 점수를 기록했으며, 특히 자원이 적은 조합에서 뛰어난 성능을 보였다.
  • SeaLLM-13b-5L는 Sea-bench 어시스턴트 평가에서 55.23점의 점수를 기록했으며, 비라틴 문자 언어에서 ChatGPT-3.5를 능가했고 영어에서도 뛰어난 성능을 유지했다.
  • 자기 선호 정렬 최적화 방법을 통해 인간 평가자 제공의 선호 데이터 없이도 높은 성능을 달성했으며, 다국어 환경에서 자기지도 정렬의 가능성과 실현 가능성을 입증했다.
Figure 3 : Language composition of Pre-training and SFT data for SeaLLMs. The pre-training data has more balanced language ratios. However, the SFT data is dominantly English because of the abundance of open-source English data and the difficulty in acquiring SFT data in other languages.
Figure 3 : Language composition of Pre-training and SFT data for SeaLLMs. The pre-training data has more balanced language ratios. However, the SFT data is dominantly English because of the abundance of open-source English data and the difficulty in acquiring SFT data in other languages.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.