Skip to main content
QUICK REVIEW

[논문 리뷰] PhayaThaiBERT: Enhancing a Pretrained Thai Language Model with Unassimilated Loanwords

Panyut Sriwirote, Jalinee Thapiang|arXiv (Cornell University)|2023. 11. 21.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 WangchanBERTa의 변종인 PhayaThaiBERT를 소개하며, XLM-R에서 전이된 방식으로 토크나이저 어휘를 확장하고 156.5GB의 더 큰 데이터셋으로 미사전훈련을 통해 비통합 외래어—특히 영어어휘—의 이해 능력을 향상시킨다. 이 모델은 하류 작업에서 뛰어난 성능을 보이며, 특히 외래어 비율이 높은 토큰 분류 작업에서 정확도 향상이 두드러진다.

ABSTRACT

While WangchanBERTa has become the de facto standard in transformer-based Thai language modeling, it still has shortcomings in regard to the understanding of foreign words, most notably English words, which are often borrowed without orthographic assimilation into Thai in many contexts. We identify the lack of foreign vocabulary in WangchanBERTa's tokenizer as the main source of these shortcomings. We then expand WangchanBERTa's vocabulary via vocabulary transfer from XLM-R's pretrained tokenizer and pretrain a new model using the expanded tokenizer, starting from WangchanBERTa's checkpoint, on a new dataset that is larger than the one used to train WangchanBERTa. Our results show that our new pretrained model, PhayaThaiBERT, outperforms WangchanBERTa in many downstream tasks and datasets.

연구 동기 및 목표

  • 태국어 텍스트에서 철자적으로 통합되지 않은 외래어, 특히 영어어휘의 이해 능력에 한계가 있는 WangchanBERTa의 문제를 해결하기 위해.
  • 코드 스위칭이나 외래어 비율이 높은 태국어 텍스트를 포함한 하류 NLP 작업에서 모델의 성능을 향상시키기 위해.
  • XLM-R의 토크나이저에서 외래어 토큰을 전이하여 WangchanBERTa의 어휘를 확장하여 통합되지 않은 외래어를 더 잘 포착하도록 하기 위해.
  • WangchanBERTa의 원래 훈련 데이터보다 두 배 이상 큰 156.5GB 데이터셋으로 미사전훈련을 수행하여 일반화 능력을 향상시키기 위해.
  • 향상된 외래어 이해가 다양한 태국어 NLP 벤치마크에서 측정 가능한 성능 향상으로 이어지는지 평가하기 위해.

제안 방법

  • XLM-R의 사전 훈련된 토크나이저에서 유래한 외래어 서브워드 유닛을 전이하여 WangchanBERTa의 SentencePiece unigram 토크나이저를 확장하였다.
  • 학습된 표현을 유지하면서 새로운 어휘에 적응하기 위해 WangchanBERTa의 체크포인트를 사용해 새로운 모델을 초기화하였다.
  • 동일한 마스크된 언어 모델링 목표를 사용하여 WangchanBERTa의 훈련 데이터보다 두 배 큰 156.5GB 데이터셋으로 모델을 미사전훈련하였다.
  • 태국어 고유의 언어적 특징을 유지하기 위해 공백 유지 및 반복 문자 정규화 기법을 적용하였다.
  • 다양한 하류 NLP 작업, 특히 시퀀스 및 토큰 분류 작업에 대해 최종 PhayaThaiBERT 모델을 미세조정하였다.
  • 다양한 데이터셋에서 표준 지표를 사용해 성능을 평가하였으며, WangchanBERTa 및 XLM-R와의 비교를 수행하였다.

실험 결과

연구 질문

  • RQ1외래어를 포함한 토크나이저 어휘 확장이 태국어 언어 모델의 통합되지 않은 외래어 이해 능력을 향상시키는가?
  • RQ2더 큰 데이터셋으로 미사전훈련을 수행할 경우 하류 태국어 NLP 작업에서 성능 향상이 어느 정도 이루어지는가?
  • RQ3특히 토큰 분류 작업에서 통합되지 않은 영어 외래어 비율이 높은 작업에서 측정 가능한 성능 향상이 발생하는가?
  • RQ4다양한 데이터셋에서 PhayaThaiBERT는 Zero-shot 및 미세조정 성능 측면에서 WangchanBERTa 및 XLM-R와 비교해 어떻게 성과를 내는가?
  • RQ5어휘 확장과 더 큰 규모의 미사전훈련이 코드 스위칭이나 외래어 영향을 받은 태국어 텍스트를 처리하는 데 있어 기존 태국어 모델의 한계를 완화할 수 있는가?

주요 결과

  • PhayaThaiBERT는 외래어 비율이 높은 토큰 분류 데이터셋에서 WangchanBERTa를 뛰어넘는 성능을 보이며, 여러 하류 작업에서 뛰어난 성능을 기록하였다.
  • 38.54%의 통합되지 않은 영어어휘를 포함한 Thai_NNER 데이터셋에서 PhayaThaiBERT는 WangchanBERTa 대비 +4.95%의 F1 스코어 향상을 달성하였다.
  • 전체가 영어로 구성된 Yelp Review Full 데이터셋에서 PhayaThaiBERT는 +9.86%의 F1 스코어 향상을 기록하여 외국어 콘텐츠 처리 능력이 뛰어나다는 것을 입증하였다.
  • 영어 전용 Yelp 데이터셋에서 +6.72%의 F1 스코어 향상을 보였으며, 이는 향상된 외래어 처리 능력이 이러한 맥락에서 직접적인 성능 향상으로 이어진다는 것을 확인한다.
  • 중간 수준의 외래어 비율(예: wisesight_sentiment의 27.59%)을 가진 시퀀스 분류 작업에서 PhayaThaiBERT는 +1.8%의 F1 스코어 향상을 달성하여 일관된 성능 향상을 보였다.
  • 성능 향상에도 불구하고, 생성된 리뷰 데이터셋(enhanced)에서는 PhayaThaiBERT가 XLM-R를 초월하지 못했으며, 기계 번역 콘텐츠 처리에 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.