Skip to main content
QUICK REVIEW

[논문 리뷰] RUBERT: A Bilingual Roman Urdu BERT Using Cross Lingual Transfer Learning

Usama Khalid, Mirza Omer Beg|arXiv (Cornell University)|2021. 02. 22.
Natural Language Processing Techniques참고 문헌 52인용 수 7
한 줄 요약

이 논문은 영어 BERT에서의 다국어 전이를 활용하여, 새로운 5400만 토큰의 로마어라비아어 트위터 코퍼스에서 추가 사전학습을 통해 제작된 이중어 로마어라비아어 BERT 모델인 RUBERT을 소개한다. RUBERT은 단일어 및 다국어 대안보다 뛰어난 성능을 보이며, MLM(0.23)과 NSP(0.95) 정확도가 가장 높아, 자원이 부족한 언어인 로마어라비아어에 대해 강력한 단일어 기반에서의 이중어 미세조정이 다국어 사전학습보다 더 효과적임을 보여준다.

ABSTRACT

In recent studies, it has been shown that Multilingual language models underperform their monolingual counterparts. It is also a well-known fact that training and maintaining monolingual models for each language is a costly and time-consuming process. Roman Urdu is a resource-starved language used popularly on social media platforms and chat apps. In this research, we propose a novel dataset of scraped tweets containing 54M tokens and 3M sentences. Additionally, we also propose RUBERT a bilingual Roman Urdu model created by additional pretraining of English BERT. We compare its performance with a monolingual Roman Urdu BERT trained from scratch and a multilingual Roman Urdu BERT created by additional pretraining of Multilingual BERT. We show through our experiments that additional pretraining of the English BERT produces the most notable performance improvement.

연구 동기 및 목표

  • 공개적으로 이용 가능한 로마어라비아어 NLP 자원의 부족 문제를 해결하기 위해, 스크래핑한 트위터 데이터에서 300만 문장과 5400만 토큰으로 구성된 새로운 대규모 코퍼스를 구축한다.
  • 남아아시아 소셜 미디어에서 널리 사용되는 자원이 부족한 언어인 로마어라비아어의 저자원 언어 모델링을 향상시키기 위해 다국어 전이 학습을 활용한다.
  • 로마어라비아어에 대해 단일어 영어 BERT 모델에서의 추가 사전학습이, 초기 학습 또는 다국어 모델에서의 추가 사전학습보다 더 나은 성능을 내는지 조사한다.
  • 단일어 기반 모델을 사용해 새로운 언어에서 이중어 언어 모델링을 수행할 경우, 저자원 언어에 대해 다국어 사전학습보다 더 뛰어난 성능을 낼 수 있음을 입증한다.

제안 방법

  • 저자들은 공개된 트위터 데이터에서 3,040,153개의 문장과 54,622,490개의 토큰을 포함한 대규모 로마어라비아어 데이터셋을 수집하고 정제하여, 저자원 언어 모델링을 위한 새로운 코퍼스를 구축했다.
  • 기존의 영어 BERT 기반 모델을 로마어라비아어 코퍼스에서 추가 사전학습하여 미세조정하였으며, 원래의 영어 BERT 아키텍처와 초기 임베딩을 유지하면서 어휘와 학습을 새로운 언어에 맞게 조정하였다.
  • 세 가지 다른 사전학습 접근 방식을 비교하였다: (1) 단일어 로마어라비아어 BERT를 초기 상태에서 학습하는 것, (2) 다국어 BERT(mBERT)에서 추가 사전학습하는 것, (3) 단일어 영어 BERT에서 추가 사전학습하는 것(RUBERT).
  • 모델들은 원래 BERT 사전학습에서 사용된 마스크된 언어 모델링(MLM) 및 다음 문장 예측(NSP) 작업을 동일하게 사용하여 평가하였으며, 성능 측정을 위해 별도의 검증 세트를 활용하였다.
  • 공통된 라틴 문자 사용과 코드 스위칭 패턴을 활용하여 영어와 로마어라비아어 간의 유사성을 이용함으로써, 더 나은 문맥 표현 학습이 가능하도록 다국어 전이를 구현하였다.
  • 모든 모델에 동일한 초모수를 적용하였음(10,000개의 학습 스텝, 초기 학습률 2e-5), 유일한 예외는 초기 학습에서 안정화를 위해 더 높은 1e-4 학습률을 사용한 단일어 모델이었다.

실험 결과

연구 질문

  • RQ1로마어라비아어에 대해 단일어 영어 BERT 모델에서의 추가 사전학습이, 초기 학습 또는 다국어 모델에서의 추가 사전학습보다 더 나은 성능을 내는가?
  • RQ2공통된 라틴 문자와 어휘 겹침이 있음에도 불구하고, 언어적 구조의 차이가 있음에도 불구하고 영어 BERT에서의 다국어 전이가 로마어라비아어에 효과적으로 작용할 수 있는가?
  • RQ3이중어 로마어라비아어-영어 모델의 성능은 다국어 및 단일어 기반 모델과 비교하여 다운스트림 사전학습 작업에서 어떻게 다른가?
  • RQ4로마어라비아어와 같이 자원이 부족한 언어에 대해, 다국어 모델에서의 사전학습을 수행할 경우 '다국어의 저주'가 성능에 얼마나 큰 영향을 미치는가?

주요 결과

  • 단일어 영어 BERT에서 추가 사전학습을 통해 제작된 RUBERT 모델은 MLM 정확도가 0.23로 가장 높았으며, 단일어(0.02) 및 다국어(0.11) 기반 모델보다 뚜렷하게 뛰어났다.
  • RUBERT는 NSP 정확도도 0.95로 가장 높았으며, 이는 단일어(0.53) 및 다국어(0.91) 모델보다 문장 수준의 이해 능력이 뛰어나다는 것을 시사한다.
  • 초기 상태에서 학습한 단일어 로마어라비아어 BERT는 MLM 정확도가 단지 0.02에 불과하여, 저자원 언어에 대해 효과적인 언어 모델을 초기 상태에서 학습하는 데 어려움이 있음을 보여준다.
  • 로마어라비아어에서 미세조정된 다국어 BERT는 다소 향상된 성능(MLM 정확도 0.11)을 보였지만, 여전히 이중어 RUBERT에 비해 크게 뒤처져 있었으며, 이는 다국어 모델이 저자원 언어에 대해 능력 분산 현상에 시달린다는 것을 시사한다.
  • 결과적으로, 자원이 부족한 언어인 로마어라비아어에 대해 고자원 언어(영어)에서의 다국어 전이를 통한 이중어 사전학습이 다국어 사전학습보다 더 효과적임을 확인하였다.
  • 연구는 공통된 스크립트와 어휘 겹침(예: 코드 스위칭)이 저자원 환경에서 성공적인 다국어 전이를 가능하게 하는 핵심 요소임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.