[논문 리뷰] GPT-SW3: An Autoregressive Language Model for the Nordic Languages
GPT-SW3는 스웨덴어, 노르웨이어, 데니시어, 아이슬란드어, 영어 등 다양한 언어로 구성된 3200억 토큰의 다국어 및 코드 데이터를 기반으로 훈련된 최초의 노르드어를 위한 네이티브 자동회귀 대규모 언어 모델이다. 12600만에서 400억 파라미터까지 다양하게 변형된 지침 튜닝 버전을 포함한 이 모델는 정제된 데이터 수집, 규정 준수 인식 처리, 국가 수준의 슈퍼컴퓨팅 인프라를 통해 개발되었으며, 다국어 및 저자원 노르드 게르만어를 위한 비공개 모델에 대한 투명하고 오픈 리서치 중심의 대안을 제공한다.
This paper details the process of developing the first native large generative language model for the Nordic languages, GPT-SW3. We cover all parts of the development process, from data collection and processing, training configuration and instruction finetuning, to evaluation and considerations for release strategies. We hope that this paper can serve as a guide and reference for other researchers that undertake the development of large generative models for smaller languages.
연구 동기 및 목표
- 노르드어(북게르만어) 언어를 위한 최초의 네이티브 대규모 언어 모델을 개발함으로써, 유럽의 소규모 언어에 대한 다국어 LLM의 부족을 해소하고자 한다.
- 노르드어를 위한 고품질, 다양한 텍스트 수집 시 데이터 부족 및 규제 과제(예: GDPR, 저작권)를 극복하고자 한다.
- 국가 수준의 슈퍼컴퓨팅 인프라(예: Berzelius, SNIC)를 활용하여 훈련을 수행함으로써 노르드어 연구의 접근성과 지속 가능성 확보를 목적으로 한다.
- 오픈 소스 및 투명한 리포지터리 전략을 통해 책임감 있는 AI 원칙을 고려한 균형 잡힌 접근 방식을 확립하고자 한다.
- 노르드어 NLP 커뮤니티가 문화적·언어적 다양성을 반영한 네이티브 LLM을 접근하고 검증하며 확장할 수 있도록 지원하고자 한다.
제안 방법
- 뉴스, 책, 코드 등 다양한 출처에서 유래한 약 3200억 토큰의 다국어 및 다언어 텍스트를 포함하는 정제된 데이터셋인 노르드 펠(의) 구축. 언어별 필터링 및 중복 제거를 수행함.
- 다국어 토크나이저를 사용하여 데이터를 처리하고, GDPR 및 저작권 규정 준수를 확보하기 위해 철저한 필터링 절차를 적용함.
- 국가 수준의 고성능 컴퓨팅(HPC) 인프라(Berzelius)를 통해 NeMo Megatron 프레임워크를 활용해 디코더 전용 트랜스포머 모델을 인과적 언어 모델링 기반으로 훈련함.
- 선택된 모델에 대해 지침 튜닝을 수행하여, 제로샷 및 패턴 기반 추론 능력을 향상시킴.
- 연구 목적에 한해 책임감 있는 접근을 보장하기 위해 수동 심사 및 수정된 BigScience RAIL 라이선스를 적용한 제한된 사전 배포 전략을 구현함.
- 실제 예술 전시회에서 Klara 챗봇을 통해 실생활 검증을 수행하여 7000건 이상의 사용자 상호작용을 수집함으로써 생성 품질 및 사회적 영향을 평가함.
실험 결과
연구 질문
- RQ1제한된 기존 훈련 데이터와 규제 제약 조건이 존재하는 노르드어를 위한 고품질 대규모 언어 모델을 어떻게 개발할 수 있는가?
- RQ2국가 수준의 LLM 추진 사업에서 데이터 개방성, 규정 준수(GDPR 등), 모델 접근성 간의 최적 균형은 무엇인가?
- RQ3상업용 클라우드 제공자에 의존하지 않고도 국가 수준의 HPC 인프라가 저자원 언어를 위한 400억 파라미터 LLM 훈련을 지원할 수 있는가?
- RQ4지침 튜닝은 여러 노르드어 언어 및 작업에서 노르드어 LLM의 제로샷 및 패턴 기반 성능을 어떻게 향상시킬 수 있는가?
- RQ5공적 및 문화적 맥락에서 생성형 LLM의 사회적 및 실용적 검증 경로는 무엇인가?
주요 결과
- GPT-SW3는 스웨덴어, 노르웨이어, 데니시어, 아이슬란드어, 영어 등 다섯 개의 노르드어 언어와 네 가지 프로그래밍 언어를 포함한 종합적인 3200억 토큰 데이터셋을 기반으로 훈련된 최초의 다국어 LLM이며, 12600만에서 400억 파라미터까지 다양한 크기의 모델을 포함한다.
- 노르드 펠 데이터셋은 GDPR 및 저작권 법률 준수를 철저히 준수하며, 다단계 필터링 및 중복 제거 파이프라인을 통해 성공적으로 구축되었다.
- 모델 세트는 벤치마크 평가와 실생활 배포를 통해 노르드어 전반에서 강력한 제로샷 및 패턴 기반 성능을 달성하였다.
- 공개 예술 전시회에서 Klara 챗봇을 배포하여 7000건 이상의 사용자 상호작용을 유도하였으며, 이는 뛰어난 생성 품질과 공적 참여도를 입증하였다.
- 제한된 사전 배포 전략을 통해 노르드어 NLP 연구자들에게 책임감 있는 접근을 가능하게 하였으며, 향후 완전한 오픈 릴리스 계획이 수립되어 있다.
- 국가 수준의 HPC 인프라(Berzelius)는 400억 파라미터 모델의 훈련을 성공적으로 지원하였으며, 국립 연구 생태계 내에서 대규모 LLM 훈련의 가능성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.