[논문 리뷰] WangchanBERTa: Pretraining transformer-based Thai Language Models
이 논문은 다양한 소스(소셜 미디어, 뉴스, 공개 데이터셋 포함)에서 수집한 정제되고 중복 제거된 78GB의 태국어 텍스트를 기반으로 사전 훈련한 RoBERTa-base 기반의 태국어 언어 모델인 WangchanBERTa를 소개한다. 문장과 청크 경계로 공백을 유지하고 SentencePiece 토큰화를 사용함으로써, WangchanBERTa-base-att-spm-uncased는 단일 언어 태국어 환경에서 순서 분류 및 토큰 분류 작업 모두에서 강력한 베이스라인(NBSVM, CRF, ULMFit)과 다국어 모델(XLM-R, mBERT)을 능가한다.
Transformer-based language models, more specifically BERT-based architectures have achieved state-of-the-art performance in many downstream tasks. However, for a relatively low-resource language such as Thai, the choices of models are limited to training a BERT-based model based on a much smaller dataset or finetuning multi-lingual models, both of which yield suboptimal downstream performance. Moreover, large-scale multi-lingual pretraining does not take into account language-specific features for Thai. To overcome these limitations, we pretrain a language model based on RoBERTa-base architecture on a large, deduplicated, cleaned training set (78GB in total size), curated from diverse domains of social media posts, news articles and other publicly available datasets. We apply text processing rules that are specific to Thai most importantly preserving spaces, which are important chunk and sentence boundaries in Thai before subword tokenization. We also experiment with word-level, syllable-level and SentencePiece tokenization with a smaller dataset to explore the effects on tokenization on downstream performance. Our model wangchanberta-base-att-spm-uncased trained on the 78.5GB dataset outperforms strong baselines (NBSVM, CRF and ULMFit) and multi-lingual models (XLMR and mBERT) on both sequence classification and token classification tasks in human-annotated, mono-lingual contexts.
연구 동기 및 목표
- 다양한 도메인을 포함한 대규모 사전 훈련 데이터셋을 구축하여 고성능 단일 언어 태국어 언어 모델의 부족을 해결하기 위해.
- mBERT, XLM-R와 같은 다국어 모델이 태국어 NLP 작업에서 최적의 성능을 내지 못하는 문제를 해결하기 위해 전용 단일 언어 모델을 훈련하기 위해.
- 단어 수준, 음절 수준, SentencePiece 토큰화 전략의 영향을 분석하여 태국어 NLP의 최종 성능에 미치는 영향을 조사하기 위해.
- 서브워드 토큰화 중에 공백을 문법적 경계로 유지함으로써 태국어의 핵심 언어학적 특징을 반영하고 태국어 NLP 성능을 향상시키기 위해.
- 대규모로 정제된 데이터셋을 기반으로 사전 훈련하고 모델을 공개함으로써 태국어 NLP 분야에 새로운 SOTA 기준을 설정하기 위해.
제안 방법
- 소셜 미디어(Wisesight, Pantip), 뉴스(Thairath, Prachathai), 위키백과에서 수집한 정제되고 중복 제거된 태국어 텍스트 총 78GB를 기반으로 RoBERTa-base 아키텍처를 사전 훈련한다.
- 서브워드 토큰화 이전에 문장과 청크 경계로 공백을 유지하는 태국어 전용 텍스트 전처리를 적용한다.
- 학습 가능한 어휘를 사용하는 SentencePiece 서브워드 토큰화를 적용하여 OOV 단어를 처리하고 모델의 강건성을 향상시킨다.
- 다섯 가지 변형 모델을 훈련하고 비교한다: 전체 78GB 데이터셋을 사용한 모델(WangchanBERTa-base-att-spm-uncased)과 다양한 토크나이저(서브워드 토큰화, 단어 수준, 음절 수준, SEFR)를 사용한 위키백과 전용 데이터셋 기반의 네 가지 모델.
- 인간이 애너테이션한 데이터셋을 사용하여 순서 분류(다중 클래스 및 다중 레이블) 및 토큰 분류(명명된 엔티티 인식) 작업에서 성능을 평가한다.
- Hugging Face에 사전 훈련된 및 미세조정된 모델을 배포하고 GitHub에 훈련 코드를 오픈소스로 공개한다.
실험 결과
연구 질문
- RQ1기존의 베이스라인 및 다국어 모델과 비교해 볼 때, 다양한 도메인과 정제된 대규모 데이터셋을 기반으로 사전 훈련된 단일 언어 태국어 BERT 모델이 최종 NLP 작업 성능을 향상시키는가?
- RQ2토큰화 과정에서 공백을 문법적 경계로 유지하는 것이 태국어 언어 모델의 성능에 어떤 영향을 미치는가?
- RQ3단어 수준, 음절 수준, SentencePiece 토큰화 전략의 상대적 영향은 태국어의 순서 분류 및 토큰 분류 성능에 어떤가?
- RQ4대규모 단일 언어 태국어 언어 모델이 mBERT나 XLM-R 같은 다국어 모델을 태국어 전용 벤치마크에서 능가할 수 있는가?
- RQ5토크나이저의 선택이 다양한 태국어 텍스트 도메인에 걸쳐 모델의 일반화 능력에 어떤 영향을 미치는가?
주요 결과
- WangchanBERTa-base-att-spm-uncased는 다중 클래스 및 다중 레이블 순서 분류 작업에서 NBSVM, CRF, ULMFit를 능가하며, ThaiNER LST20 데이터셋에서 매크로 F1 스코어 0.8155를 기록한다.
- 동일한 데이터셋에서 모델은 품사 태깅에서 매크로 F1 스코어 0.8586, NER에서 0.7519를 기록하여 mBERT 및 XLM-R를 크게 능가한다.
- 전체 78GB 데이터셋을 기반으로 SentencePiece 토큰화를 사용한 모델가 가장 높은 성능을 기록하여 대규모로 다양한 도메인의 사전 훈련이 효과적임을 입증한다.
- mBERT 및 XLM-R와 비교해 볼 때, WangchanBERTa 모델은 ThaiNER LST20의 모든 명명된 엔티티 유형에서 높은 F1 스코어를 기록하며, PER 유형에선 0.9132, TITL 유형에선 0.9682를 기록한다.
- 아블레이션 연구 결과, 단어 수준 및 음절 수준 토크나이저는 SentencePiece에 비해 성능이 열등하며, 특히 OOV 및 희귀어 처리에서 뚜렷한 열세를 보이며, 저자원 환경에서 서브워드 모델링의 중요성을 입증한다.
- 모델의 성능은 다양한 도메인에 걸쳐 뛰어나며, 소셜 미디어 및 공식 뉴스 텍스트 모두에서 뛰어난 성능을 기록하여 효과적인 일반화 능력을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.