Skip to main content
QUICK REVIEW

[논문 리뷰] Can Multilingual Language Models Transfer to an Unseen Dialect? A Case Study on North African Arabizi

Benjamin Müller, Benoît Sagot|arXiv (Cornell University)|2020. 05. 01.
Natural Language Processing Techniques인용 수 8
한 줄 요약

이 논문은 다국어 BERT(mBERT)가 자원이 적고 표준화되지 않은, 라틴 문자로 쓰인 북아프리카 아라비아어(아랍지)로의 제로샷 전이가 가능한지 조사한다. mBERT는 아랍지에 대한 사전 훈련을 하지 않았음에도 불구하고 품사 태깅(81.60 F1)과 의존성 파싱(66.84 UAS)에서 강력한 제로샷 성능을 기록하며, 무 supervision 테이닝을 통해 성능이 더욱 향상된다. 이는 스크립트가 다를 뿐 아니라 전혀 다른 언어인 말타어와 같은 언어로도 강력한 다국어 간 전이 능력을 보여준다.

ABSTRACT

Building natural language processing systems for non standardized and low resource languages is a difficult challenge. The recent success of large-scale multilingual pretrained language models provides new modeling tools to tackle this. In this work, we study the ability of multilingual language models to process an unseen dialect. We take user generated North-African Arabic as our case study, a resource-poor dialectal variety of Arabic with frequent code-mixing with French and written in Arabizi, a non-standardized transliteration of Arabic to Latin script. Focusing on two tasks, part-of-speech tagging and dependency parsing, we show in zero-shot and unsupervised adaptation scenarios that multilingual language models are able to transfer to such an unseen dialect, specifically in two extreme cases: (i) across scripts, using Modern Standard Arabic as a source language, and (ii) from a distantly related language, unseen during pretraining, namely Maltese. Our results constitute the first successful transfer experiments on this dialect, paving thus the way for the development of an NLP ecosystem for resource-scarce, non-standardized and highly variable vernacular languages.

연구 동기 및 목표

  • 다국어 언어 모델이 자원이 적고 표준화되지 않은 어휘인 북아프리카 아랍지로 제로샷 전이를 수행할 수 있는지 조사한다.
  • 가장 가까운 표준 언어인 현대 표준 아랍어(MSA)가 아랍 문자를 사용하는 데 비해, 라틴 문자로 쓰인 어휘를 처리하는 데 도전한다.
  • mBERT의 사전 훈련 코퍼스에 포함되지 않은 언어인 말타어처럼 아랍지와 관련이 없는 언어에서의 전이 성능을 검토한다.
  • 무 supervision 테이닝이 다소 다양하고 코드 믹스가 빈번한 방언 데이터에 대한 다국어 간 전이에 미치는 영향을 평가한다.
  • 다양한 언어로 사전 훈련된 다국어 모델이 자원이 적고 알려지지 않은 방언 유형으로의 전이를 가능하게 한다는 것을 입증한다.

제안 방법

  • 104개 언어로 사전 훈련된 다국어 BERT 모델인 mBERT를 사용하여, 타겟 데이터에 대한 테이닝 없이 아랍지로의 제로샷 전이를 수행한다.
  • 원시 아랍지 텍스트를 사용해 마스크된 언어 모델링(MLM) 목적함수를 적용하여 mBERT를 타겟 방언에 맞게 무 supervision 테이닝한다.
  • 아랍지 트리뱅크와 원시 코퍼스를 사용해 품사 태깅과 의존성 파싱이라는 두 가지 NLP 작업에 대해 훈련 및 평가를 수행한다.
  • 현대 표준 아랍어(MSA), 프랑스어, 영어, 말타어, 베트남어 등 다양한 소스 언어 간 성능을 비교한다.
  • mBERT, RoBERTa, CamemBERT, 무작위 초기화된 Transformer를 비교하여 다국어 사전 훈련의 역할을 분리하기 위해 추론 실험을 수행한다.
  • 통계적 안정성을 확보하기 위해 5개의 랜덤 시드를 사용해 훈련 및 평가를 수행하고 평균 성능 지표를 보고한다.

실험 결과

연구 질문

  • RQ1mBERT는 사전 훈련 코퍼스에 포함되지 않은 아랍지로 제로샷 다국어 간 전이를 수행할 수 있는가?
  • RQ2소스 언어가 관련이 없거나 다른 스크립트를 사용할 경우, 무 supervision 테이닝이 아랍지로의 전이 성능을 향상시키는가?
  • RQ3표준화되지 않은 철자와 자주 프랑스어로 코드 스위칭이 일어나는 방언이라도 mBERT가 효과적으로 전이할 수 있는가?
  • RQ4mBERT가 아랍지로의 전이에 성공한 것은 다국어 사전 훈련 덕분인지, 아니면 단일 언어나 무작위 초기화된 모델도 유사한 성능을 낼 수 있는가?
  • RQ5소스 언어가 아랍지와 관련된(예: MSA) 경우와 관련이 없는(예: 말타어) 경우에 따라 전이 성능는 어떻게 달라지는가?

주요 결과

  • mBERT는 아랍지에서 제로샷 품사 태깅에서 81.60 F1, 의존성 파싱에서 66.84 UAS를 기록하여, 이 방언에 대한 사전 훈련이 없음에도 불구하고 강력한 제로샷 전이 능력을 보였다.
  • 마스크된 언어 모델링 목적함수를 사용한 무 supervision 테이닝을 통해 품사 태깅 F1은 82.61로, UAS는 67.12로 향상되어 두 작업 모두 유의미한 성과 향상을 보였다.
  • 사전 훈련 중에 포함되지 않은 말타어로 테이닝한 mBERT가 가장 높은 성능(품사 태깅 F1 38.94, UAS 42.32)을 기록했으며, 제로샷 설정에서 스탠포드NLP보다 각각 5점과 6점 높은 성능을 보였다.
  • mBERT는 RoBERTa, CamemBERT, 무작위 초기화된 모델보다 제로샷 전이에서 유의미하게 뛰어난 성능을 보였으며, 다국어 사전 훈련이 성공의 핵심 요소임을 확인했다.
  • mBERT는 스크립트 간 전이를 효과적으로 처리했으며, 아랍어 스크립트로 사전 훈련된 MSA에서 시작해 라틴 문자로 쓰인 아랍지를 처리하는 데 성공했고, 이는 강력한 스크립트 간 표현 학습 능력을 보여준다.
  • 무 supervision 테이닝은 아랍지와 프랑스어 간 어휘 격차를 줄였으며, 프랑스어에서 시작한 테이닝 시 품사 태깅 성능이 +14.2점 향상되어 코드 믹스 패턴에 효과적으로 적응함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.