Skip to main content
QUICK REVIEW

[논문 리뷰] Typhoon: Thai Large Language Models

Kunat Pipatanakul, Phatrasek Jirabovonvisut|arXiv (Cornell University)|2023. 12. 21.
Natural Language Processing Techniques인용 수 6
한 줄 요약

Typhoon는 70억 파라미터를 가진 태국어 대규모 언어 모델로, Mistral-7B를 기반으로 타겟팅된 태국어 사전학습과 지시 훈련을 통해 미세조정되었으며, 오픈소스 태국어 벤치마크에서 최고 성능을 기록하고 있으며, 토크나이제이션에서 GPT-3.5의 성능을 따라가면서도 2.62배 더 효율적이다. 모델은 국립 시험을 기반으로 한 맞춤형 벤치마크인 ThaiExam을 통해 평가되었으며, 지시 따르기, 번역, 요약, 질의응답 작업에서 기존 오픈소스 모델들을 능가했다.

ABSTRACT

Typhoon is a series of Thai large language models (LLMs) developed specifically for the Thai language. This technical report presents challenges and insights in developing Thai LLMs, including data preparation, pretraining, instruction-tuning, and evaluation. As one of the challenges of low-resource languages is the amount of pretraining data, we apply continual training to transfer existing world knowledge from a strong LLM. To evaluate the Thai knowledge encapsulated in each model from the pretraining stage, we develop ThaiExam, a benchmark based on examinations for high-school students and investment professionals in Thailand. In addition, we fine-tune Typhoon to follow Thai instructions, and we evaluate instruction-tuned models on Thai instruction datasets as well as translation, summarization, and question-answering tasks. Experimental results on a suite of Thai benchmarks show that Typhoon outperforms all open-source Thai language models, and its performance is on par with GPT-3.5 in Thai while having only 7 billion parameters and being 2.62 times more efficient in tokenizing Thai text.

연구 동기 및 목표

  • 기존 다국어 및 영어 중심의 대규모 언어 모델에서 태국어가 부족하게 반영된 문제를 해결하기 위해, 태국어 전용 고성능 오픈소스 대규모 언어 모델을 개발하는 것.
  • 태국어 NLP 분야의 데이터 부족 문제를 해결하기 위해, 강력한 기본 모델에서 세계 지식을 전이하기 위해 정제된 태국어 코퍼스를 활용한 연속적 사전학습을 적용하는 것.
  • 실제 국립 시험을 기반으로 한 도메인 특화 벤치마크인 ThaiExam을 활용해 태국어 이해력과 지시 따르기 능력을 평가하는 것.
  • 현지 태국어 및 번역된 지시 데이터셋을 활용한 지시 훈련을 통해 정렬성과 제로샷 일반화 능력을 향상시키는 것.
  • 태국어 NLP 분야의 향후 연구 및 개발을 촉진하기 위해 Apache-2.0 라이선스 하에 Typhoon을 공개하는 것.

제안 방법

  • 정제된 중간 크기의 태국어 텍스트 코퍼스를 기반으로 Mistral-7B를 연속적으로 사전학습하여 도메인 특화 지식과 언어 이해력을 향상시키는 것.
  • 고등학교 및 투자 전문가 시험을 기반으로 한 ThaiExam을 개발하여 태국어 LLM의 사실적 지식 및 문화 지식을 평가하는 것.
  • 현지 태국어 및 번역된 지시 따르기 데이터셋을 활용해 Typhoon의 지시 훈련을 수행하여 제로샷 및 피처샷 정렬 능력을 향상시키는 것.
  • GPT-4를 심판으로 사용하여 LLM-재판 프레임워크(AlpacaEval, OASST, MT-Bench, Sea-bench)를 활용해 지시 따르기 성능을 측정하는 것.
  • 표준 NLP 작업에서의 제로샷 평가: 기계 번역(FLORES-200), 개괄적 요약(XLSum, CrossSum), 질의응답(XQuAD)을 표준 지표를 사용해 수행하는 것.
  • 신규 newmm 토크나이저를 사용해 태국어 토크나이제이션 효율성을 향상시켜 기존 모델 대비 2.62배 빠른 토크나이제이션을 달성하는 것.
Figure 1 : Performance of Typhoon and other open-source Thai large language models on Thai Examinations (left) and Thai instruction-following (right). Details about ThaiExam and Thai instruction-following evaluation are provided in Section 3.4 , and Section 4.2 , respectively.
Figure 1 : Performance of Typhoon and other open-source Thai large language models on Thai Examinations (left) and Thai instruction-following (right). Details about ThaiExam and Thai instruction-following evaluation are provided in Section 3.4 , and Section 4.2 , respectively.

실험 결과

연구 질문

  • RQ1중간 크기의 태국어 코퍼스를 대상으로 타겟팅된 사전학습을 통해 강력한 영어 중심의 LLM이 태국어에 효과적으로 적응할 수 있는가?
  • RQ2Typhoon은 기존 오픈소스 태국어 LLM들과 비교해, 특히 ThaiExam과 같은 시험 기반 벤치마크에서 도메인 특화 지식 평가에서 얼마나 잘 수행되는가?
  • RQ3현지 태국어 및 번역된 데이터셋을 활용한 지시 훈련이 번역, 요약, 질의응답 작업에서 제로샷 일반화 능력을 얼마나 향상시키는가?
  • RQ4Typhoon의 성능은 GPT-3.5와 비교해 태국어에서 지시 따르기 및 사실적 추론 측면에서 어떻게 비교되는가?
  • RQ5개선된 토크나이제이션 효율성이 태국어 NLP 응용 프로그램의 추론 속도 및 모델 배포에 어떤 영향을 미치는가?

주요 결과

  • Typhoon-7B-Instruct는 Thai AlpacaEval에서 49.05%의 승리 비율을 기록하여 모든 다른 오픈소스 태국어 LLM을 능가했으며, 이는 GPT-3.5의 성능을 그대로 따라가며 성과를 냈다.
  • 번역된 MT-Bench에서 Typhoon-7B-Instruct는 55.52%의 승리 비율을 기록하여 다시 한 번 모든 다른 오픈소스 모델을 능가했으며, GPT-3.5의 성능을 그대로 따라갔다.
  • 제로샷 NLP 작업에서 Typhoon-7B-Instruct는 FLORES-200 영어-태국어 번역에서 최고의 BLEU 점수 46.62를 기록했으며, XLSum(태국어-태국어 요약)에서 최고의 ROUGE-L 점수 14.51를 기록했다.
  • XQuAD에서 Typhoon-7B-Instruct는 0샷 설정에서 34.46%의 F1 점수를 기록하여 OpenThaiGPT와 SeaLLM-7B-Chat을 모두 능가했다.
  • Typhoon는 기본 Llama2 모델 대비 태국어 텍스트에서 2.62배 더 높은 토크나이제이션 효율성을 보였으며, 이는 추론 속도와 효율성 향상에 크게 기여했다.
  • Typhoon-7B-Instruct는 요약 및 질의응답 작업에서 강력한 제로샷 능력을 보였으며, 각각 ROUGE-L 점수 21.60과 17.32를 기록하여 모든 다른 오픈소스 모델을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.