Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Large-scale Language Models and Resources for Filipino

Jan Christian Blaise Cruz, Charibeth Cheng|arXiv (Cornell University)|2021. 11. 11.
Natural Language Processing Techniques참고 문헌 18인용 수 16
한 줄 요약

이 논문은 필리핀어를 위한 대규모이고 다양한 사전학습 코퍼스인 TLUnified을 소개하고, 이를 기반으로 RoBERTa 기반 언어 모델을 미세조정한다. 새로운 모델들은 세 가지 벤치마크 작업(혐오 발언 탐지, dengue 증상 분류, NLI)에서 평균 4.47% 높은 테스트 정확도를 기록하며 이전의 필리핀어 모델들인 BERT와 ELECTRA를 능가한다.

ABSTRACT

In this paper, we improve on existing language resources for the low-resource Filipino language in two ways. First, we outline the construction of the TLUnified dataset, a large-scale pretraining corpus that serves as an improvement over smaller existing pretraining datasets for the language in terms of scale and topic variety. Second, we pretrain new Transformer language models following the RoBERTa pretraining technique to supplant existing models trained with small corpora. Our new RoBERTa models show significant improvements over existing Filipino models in three benchmark datasets with an average gain of 4.47% test accuracy across the three classification tasks of varying difficulty.

연구 동기 및 목표

  • 저자원 필리핀어를 위한 대규모이고 다양한 사전학습 데이터의 부족 문제를 해결하기 위해 새로운 확장된 코퍼스를 구축한다.
  • 이전에 이용 가능했던 것보다 더 크고 다양한 데이터셋으로 RoBERTa 기반 아키텍처를 훈련시켜 필리핀어 언어 모델의 성능을 향상시킨다.
  • 기존의 필리핀어 모델들(예: BERT와 ELECTRA)을 능가하는 정확도를 보여줌으로써 이를 대체한다.
  • 사전학습 중에 더 높은 품질과 주제 다양성을 확보함으로써 필리핀어 NLP 모델의 강건성과 일반화 능력을 향상시킨다.
  • 미래의 연구와 응용을 지원하기 위해 오픈소스로 상태 최고 수준의 RoBERTa 모델을 제공한다.

제안 방법

  • Bible-UEdin, ParaCrawl, TED2020 등의 다국어 비트렉스트, OSCAR의 필리핀어 서브셋, NewsPH 뉴스 코퍼스의 60% 서브셋을 통합하여 TLUnified를 구축했다.
  • 다섯 단계의 필터링 절차를 적용: 비라틴 문자 비율 15% 초과 필터, 길이 필터(4~150 토큰), 구두점 필터(과도한 구두점), 평균 단어 길이 필터(비율 3~18), HTML/URL 필터.
  • 중복 제거를 수행하고, 32,000개의 서브워드와 100% 문자 커버리지로 BPE 토크나이저를 훈련시켰으며, 대소문자 구분을 유지했다.
  • 원래 RoBERTa 논문의 하이퍼파라미터에 맞춰 RoBERTa-base 및 RoBERTa-large 모델을 RoBERTa 사전학습 목표(마스킹 언어 모델링)를 사용해 사전학습했다.
  • Hatespeech(다중 레이블), Dengue(다중 레이블), NewsPH-NLI Medium(자연어 추론) 세 가지 벤치마크 데이터셋에 대해 128~256 토큰의 시퀀스 길이로 모델을 미세조정했다.
  • Hatespeech 및 Dengue 작업을 위해 어휘에 특수 토큰([LINK], [MENTION], [HASHTAG])을 추가했으며, 이들의 임베딩을 서브워드 벡터의 평균값으로 초기화했다.

실험 결과

연구 질문

  • RQ1더 크고 다양한 사전학습 코퍼스는 더 작은 주제에 국한된 데이터셋에 비해 필리핀어 언어 모델의 성능을 크게 향상시킬 수 있는가?
  • RQ2새로운 TLUnified 코퍼스를 기반으로 RoBERTa 기반 모델을 훈련시키면 필리핀어의 후행 분류 작업에서 측정 가능한 성능 향상이 이루어지는가?
  • RQ3새로운 RoBERTa 모델의 성능 향상은 기존의 최고 수준의 모델들인 BERT와 ELECTRA에 비해 얼마나 뛰어나게 나타나는가?
  • RQ4사전학습 데이터가 여전히 제한된 상황에서 모델 크기(기본 vs. 라지)가 성능 향상에 얼마나 기여하는가?
  • RQ5다양하고 고품질이며 필터링된 다국어 비트렉스트와 뉴스 데이터의 포함 여부가 필리핀어 NLP 모델의 강건성 향상에 얼마나 기여하는가?

주요 결과

  • RoBERTa Large 모델은 혐오 발언 탐지 작업에서 기존 최고 성능을 기록한 BERT Base 모델 대비 4.07%p의 절대 정확도 향상을 기록했다.
  • Dengue 증상 분류 작업에서 RoBERTa Large 모델은 BERT Base 모델 대비 5.3%p의 테스트 정확도 향상을 기록했으며, 모든 벤치마크 중에서 가장 큰 향상 폭을 보였다.
  • NewsPH-NLI Medium 자연어 추론 작업에서 RoBERTa Large 모델은 ELECTRA Base 모델 대비 4.04%p의 테스트 정확도 향상을 기록했다.
  • RoBERTa Base 모델은 모든 세 가지 작업에서 BERT Base 및 ELECTRA Base를 모두 초월했으며, Hatespeech에서 +3.9%, Dengue에서 +4.4%, NLI에서 +3.95%의 성능 향상을 기록했다.
  • RoBERTa Base와 RoBERTa Large 간의 성능 격차는 매우 미미했으며, Hatespeech에서 +0.17%, Dengue에서 +0.9%, NLI에서 +0.09%에 그쳐, 현재의 TLUnified 코퍼스가 아직 대규모 모델의 잠재력을 충분히 활용하지 못하고 있음을 시사한다.
  • 세 작업 평균 테스트 정확도 향상률은 4.47%로, 향상된 사전학습 데이터와 RoBERTa 미세조정 전략의 일관성 있고 뚜렷한 성과를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.