Skip to main content
QUICK REVIEW

[논문 리뷰] A Technical Report for Polyglot-Ko: Open-Source Large-Scale Korean Language Models

Hyunwoong Ko, Kichang Yang|arXiv (Cornell University)|2023. 06. 04.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 정제된 1.2TB의 한국어 텍스트 데이터에서 863GB로 선별된 데이터를 기반으로 훈련된, 1.3B에서 12.8B 파라미터에 이르는 개방형 대규모 한국어 언어 모델인 Polyglot-Ko를 소개한다. 이 모델들은 KOBEST 벤치마크에서 경쟁적인 zero-shot 및 few-shot 성능을 기록했으며, 12.8B 파라미터 모델은 상용 사용을 위한 공개적으로 이용 가능한 가장 큰 한국어 모델로서, 한국어 NLP 분야의 발전 잠재력을 입증한다.

ABSTRACT

Polyglot is a pioneering project aimed at enhancing the non-English language performance of multilingual language models. Despite the availability of various multilingual models such as mBERT (Devlin et al., 2019), XGLM (Lin et al., 2022), and BLOOM (Scao et al., 2022), researchers and developers often resort to building monolingual models in their respective languages due to the dissatisfaction with the current multilingual models non-English language capabilities. Addressing this gap, we seek to develop advanced multilingual language models that offer improved performance in non-English languages. In this paper, we introduce the Polyglot Korean models, which represent a specific focus rather than being multilingual in nature. In collaboration with TUNiB, our team collected 1.2TB of Korean data meticulously curated for our research journey. We made a deliberate decision to prioritize the development of Korean models before venturing into multilingual models. This choice was motivated by multiple factors: firstly, the Korean models facilitated performance comparisons with existing multilingual models; and finally, they catered to the specific needs of Korean companies and researchers. This paper presents our work in developing the Polyglot Korean models, which propose some steps towards addressing the non-English language performance gap in multilingual language models.

연구 동기 및 목표

  • 비영어 언어, 특히 한국어에서 다국어 모델의 성능 격차를 해소하기 위해 전문화된 고품질의 단일언어 모델을 개발함으로써.
  • 한국의 연구자들과 전문가들에게 한국어 NLP 작업에 특화된 강력하고 접근성 있고 상용으로 사용 가능한 언어 모델을 제공함으로써.
  • 먼저 단일 언어에서 고품질의 훈련과 평가를 완벽히 구현함으로써 향후 다국어 모델의 기반을 마련함으로써.
  • 특화된 단일언어 모델이 한국어와 같이 자원이 적은 비영어 환경에서 다국어 모델보다 뛰어난 성능을 낼 수 있음을 입증함으로써.

제안 방법

  • Polyglot-Ko 모델들은 대규모 한국어 코퍼스에서 다음 토큰 예측을 최적화하기 위해 트랜스포머 아키텍처를 기반으로 하였다.
  • TUNiB에서 수집 및 정제한 1.2TB의 한국어 데이터셋은 뉴스, 블로그, 특허, 소셜 미디어 등 다양한 출처를 포함하였다.
  • 데이터셋은 문서의 구조를 유지하는 데 중점을 두고 863GB의 청소된 텍스트로 사전 처리되었지만, 이후 줄바꿈 처리 오류가 발견되었다.
  • 1.3B, 3.8B, 5.8B, 12.8B 파라미터를 가진 네 가지 모델이 다중 노드 훈련 인프라를 사용하여 점차 증가하는 파라미터 수로 훈련되었다.
  • 모델 평가는 여러 NLP 작업에서 zero-shot 및 few-shot 성능을 평가하는 KOBEST 벤치마크를 통해 수행되었다.
  • 특정한 불안정성 문제를 해결하기 위해, 특히 감성 분석 작업에서의 불안정성을 줄이기 위해 수정된 프롬프트가 개발되었다.
(a)
(a)

실험 결과

연구 질문

  • RQ1대규모 단일언어 한국어 언어 모델이 기존의 다국어 모델보다 한국어 NLP 작업에서 뛰어난 성능을 낼 수 있는가?
  • RQ2모델 크기(파라미터 수)가 한국어에서 zero-shot 및 few-shot 벤치마크 성능에 어떤 영향을 미치는가?
  • RQ3데이터 품질과 사전 처리가 자원이 적은 언어 환경에서 모델 성능과 신뢰성에 얼마나 큰 영향을 미치는가?
  • RQ4특화된 단일언어 모델이 동아시아어 및 라틴어계 언어군의 향후 다국어 모델에 실질적인 기반을 제공할 수 있는가?
  • RQ5프롬프트 엔지니어링을 통해 감성 및 否정 탐지 작업에서의 zero-shot 평가 불안정성을 어떻게 완화할 수 있는가?

주요 결과

  • Polyglot-Ko 모델들은 KOBEST 벤치마크에서 경쟁적인 성능을 기록했으며, 모델 크기가 1.3B에서 12.8B 파라미터로 증가함에 따라 성능이 지속적으로 향상되었다.
  • 12.8B 파라미터 모델은 상용 응용을 위한 공개적으로 이용 가능한 가장 큰 한국어 언어 모델로서, 한국어 NLP 생태계에 중요한 기여를 하였다.
  • 수정된 프롬프트는 SentiNeg 작업에서 zero-shot 성능을 크게 향상시켜, 기본 프롬프트에서 관찰된 불안정성을 줄였다.
  • 5.8B 및 12.8B 모델은 벤치마크의 네 가지 작업 전반에서 강력한 few-shot 성능을 보였으며, 강력한 few-shot 일반화 능력을 나타내었다.
  • 고품질의 데이터를 사용했음에도 불구하고, 줄바꿈을 잘못 제거하는 등의 데이터 사전 처리 오류로 인해 정보 손실이 발생했을 가능성이 있으며, 향후 버전에서 수정되어야 한다.
  • 더 큰 계산 자원을 사용할수록 성능 향상이 지속적으로 관찰되어, 한국어 언어 환경에서의 스케일링 법칙 트렌드를 확인하였다.
(b)
(b)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.