Skip to main content
QUICK REVIEW

[논문 리뷰] RobBERT-2022: Updating a Dutch Language Model to Account for Evolving Language Use

Pieter Delobelle, Thomas Winters|Lirias (KU Leuven)|2022. 11. 15.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 2022년 네덜란드 OSCAR 코퍼스에서 유의미한 빈도로 나타나는 새로운 토큰을 토크나이저에 추가하고, 이 데이터로 추가 사전 훈련을 통해 최신 네덜란드 RoBERTa 기반 언어 모델인 RobBERT-2022를 제안한다. 업데이트된 모델은 최근 네덜란드 NLP 작업, 특히 코로나19 관련 텍스트에서 뚜렷한 성능 향상을 보이며, 이전 벤치마크 작업에서도 강력한 성능을 유지함으로써 언어 사용의 변화에 맞춰 지속적으로 언어 모델을 업데이트하는 것의 가치를 입증한다.

ABSTRACT

Large transformer-based language models, e.g. BERT and GPT-3, outperform previous architectures on most natural language processing tasks. Such language models are first pre-trained on gigantic corpora of text and later used as base-model for finetuning on a particular task. Since the pre-training step is usually not repeated, base models are not up-to-date with the latest information. In this paper, we update RobBERT, a RoBERTa-based state-of-the-art Dutch language model, which was trained in 2019. First, the tokenizer of RobBERT is updated to include new high-frequent tokens present in the latest Dutch OSCAR corpus, e.g. corona-related words. Then we further pre-train the RobBERT model using this dataset. To evaluate if our new model is a plug-in replacement for RobBERT, we introduce two additional criteria based on concept drift of existing tokens and alignment for novel tokens.We found that for certain language tasks this update results in a significant performance increase. These results highlight the benefit of continually updating a language model to account for evolving language use.

연구 동기 및 목표

  • 언어 사용의 변화로 인해 언어 모델이 오래되면서 기능이 떨어지는 문제를 해결하기 위해, 특히 네덜란드어에 대해.
  • 2019년에 훈련된 최신 네덜란드 BERT 모델인 RobBERT를 최근 언어 변화를 반영하도록 업데이트하기 위해.
  • 업데이트된 모델이 이전 작업에서는 성능을 유지하면서도 최신 작업에서는 향상되는지 평가하기 위해.
  • 새로운 토큰에 대한 개념 이탈과 정렬도를 기반으로 한 새로운 평가 기준을 도입하기 위해.

제안 방법

  • 2022년 네덜란드 OSCAR 코퍼스에서 유의미한 빈도로 나타나는 새로운 고빈도 서브워드 및 토큰을 RoBERTa 토크나이저에 확장하였다. 예를 들어 코로나19 관련 용어를 포함한다.
  • 마스크된 언어 모델링(MLM)을 유일한 사전 훈련 목표로 사용하여 RobBERT v2 모델을 2022년 OSCAR 데이터셋으로 추가 훈련하였다.
  • AdamW 옵timizer를 사용하였으며, 기본 학습률은 1e-6, 웜업 스텝 수는 1,000으로 설정하였고, 검증 퍼플렉서티(PPPL) 기반 조기 정지 전략을 적용하였다.
  • 벤치마크 작업, 최근 도메인 전용 작업(예: 코로나19 FAQ 및 트윗 분류), 문장 임베딩의 t-SNE 시각화를 조합하여 모델을 평가하였다.
  • 두 가지 새로운 평가 기준을 도입: 기존 토큰에 대한 개념 이탈 분석 및 신규 토큰에 대한 정렬 평가

실험 결과

연구 질문

  • RQ1더 최근의 네덜란드 텍스트 코퍼스로 추가 훈련하면, 이전 벤치마크에서 성능이 저하되지 않으면서도 최근 NLP 작업에서 성능 향상이 이루어지는가?
  • RQ2업데이트된 모델이 이전에 학습한 언어 패턴에 대해 개념 이탈 또는 치명적인 기억 상실을 얼마나 겪는가?
  • RQ3RobBERT-2022의 임베딩이 신규 도입된 토큰(예: 코로나19 패an드emic 관련 용어)의 의미 정보를 얼마나 잘 포착하는가?
  • RQ4업데이트된 모델이 하류 응용 프로그램에서 원본 RobBERT의 직접적인 교체로 사용될 수 있는가?

주요 결과

  • RobBERT-2022는 네덜란드어 코로나19 백신 FAQ 분류 작업(VaccinChat)에서 79.3%의 F1 스코어를 기록하여 원본 RobBERT v2(77.2% F1)를 초월하였다.
  • 벨기에 코로나19 조치에 관한 트윗 분류 작업에서 RobBERT-2022는 75%의 정확도를 기록하였으며, 원본 RobBERT 및 다국어 BERT 모두 73%였다.
  • 모델는 개념 이탈이 최소 수준이었으며, 이전 벤치마크 작업에서 성능 저하가 없었고, 원래 2019년 코퍼스에서의 가짜 퍼플렉서티는 9.40(기존: 7.76)로 약간 증가하였다.
  • t-SNE 시각화 결과, RobBERT-2022와 원본 모델 간 문장 임베딩에 명확한 이동이 나타나, 2022년 데이터의 새로운 의미 패턴에 적응한 것으로 나타났다.
  • 업데이트된 모델는 일반화 능력을 유지하면서도 최근 언어 사용, 특히 팬데믹 관련 용어에 대해 향상된 정렬 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.