Skip to main content
QUICK REVIEW

[논문 리뷰] Breaking Character: Are Subwords Good Enough for MRLs After All?

Omri Keren, Tal Avinari|arXiv (Cornell University)|2022. 04. 10.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 문법적으로 풍부한 언어(MRLs)에서 성능 향상을 위해 서브워드가 아닌 문자 수준의 스파이크를 사용해 미리 훈련된 BERT 스타일의 마스킹 언어 모델인 TavBERT를 제안한다. 비록 문법적 작업에서 약간의 성능 향상이 있었지만, hebrew, 터키어, 아랍어에서 명명된 엔티티 인식 및 질의 응답과 같은 의미적 작업에서 서브워드 기반 모델이 TavBERT를 크게 앞서며, 서브워드 토크나이제이션은 여전히 MRLs에 대해 강력한 인덕티브 편향임을 입증한다.

ABSTRACT

Large pretrained language models (PLMs) typically tokenize the input string into contiguous subwords before any pretraining or inference. However, previous studies have claimed that this form of subword tokenization is inadequate for processing morphologically-rich languages (MRLs). We revisit this hypothesis by pretraining a BERT-style masked language model over character sequences instead of word-pieces. We compare the resulting model, dubbed TavBERT, against contemporary PLMs based on subwords for three highly complex and ambiguous MRLs (Hebrew, Turkish, and Arabic), testing them on both morphological and semantic tasks. Our results show, for all tested languages, that while TavBERT obtains mild improvements on surface-level tasks à la POS tagging and full morphological disambiguation, subword-based PLMs achieve significantly higher performance on semantic tasks, such as named entity recognition and extractive question answering. These results showcase and (re)confirm the potential of subword tokenization as a reasonable modeling assumption for many languages, including MRLs.

연구 동기 및 목표

  • 이전에 제기된 바와 같이 서브워드 토크나이제이션이 문법적으로 풍부한 언어(MRLs)에 부적합하다는 가정을 검증하기 위해
  • 서브워드 기반 BERT 모델과 비교하여 TavBERT라는 문자 수준의 마스킹 언어 모델의 성능 평가하기
  • Hebrew, 터키어, 아랍어에서 TavBERT와 서브워드 기반 모델을 문법-구문적 및 의미적 하류 작업에서 비교하기
  • 문자 수준의 사전 훈련이 MRLs에서 문법 패턴을 더 잘 포착할 수 있는지 평가하기
  • 서브워드 토크나이제이션이 MRLs에서 PLM 성능을 떨어뜨린다는 가정을 재평가하기

제안 방법

  • 원시 문자 시퀀스에서 마스킹 언어 모델링(MLM) 목적함수를 사용해 BERT 스타일의 트랜스포머 인코더를 사전 훈련하기
  • 스파이크 길이에 대해 포isson 분포를 사용해 무작위 문자 스파이크를 마스킹하며, 평균적으로 시퀀스의 15%가 마스킹되도록 하기
  • 원래 문자를 예측하기 위해 [MASK] 토큰을 사용하며, 다음 문장 예측 없이 오직 MLM 목적함수에만 기반해 훈련하기
  • Hebrew, 터키어, 아랍어의 단일 언어 OSCAR 코퍼스를 사용해 TavBERT를 훈련하며, 문자 빈도를 기반으로 99.93%의 코퍼스를 커버하는 어휘 정의하기
  • POS 태깅, 문법적 불확실성 제거, NER, 추출적 질의 응답과 같은 하류 작업에 TavBERT를 미세조정하기
  • 동일한 벤치마크에서 TavBERT의 성능을 서브워드 기반 모델(mBERT, HeBERT, BERTurk, AraBERT)과 비교하기

실험 결과

연구 질문

  • RQ1문자 수준의 사전 훈련(TavBERT)이 문법적으로 풍부한 언어에서 서브워드 기반 모델보다 문법적 작업에서 우수한가?
  • RQ2TavBERT는 서브워드 기반 BERT들에 비해 전체 문법적 불확실성 제거에서 얼마나 향상되었는가?
  • RQ3명명된 엔티티 인식 및 질의 응답과 같은 의미적 작업에서 서브워드 기반 모델은 TavBERT와 어떻게 비교되는가?
  • RQ4서브워드 토크나이제이션은 MRLs에서 문법적 풍부성을 모델링하는 데 충분한 인덕티브 편향인가?
  • RQ5명시적인 언어학적 사전 지식 없이도 문자 수준의 모델은 복잡한 문법 패턴을 학습할 수 있는가?

주요 결과

  • 품사 태깅 작업에서 TavBERT는 서브워드 기반 모델과 유사한 성능을 보이며, 일부 언어에서 약간의 향상이 있었다.
  • 전체 문법적 불확실성 제거 작업에서 TavBERT는 SPMRL에서 mBERT 대비 25%의 오류 감소, UD에서는 39%의 오류 감소를 기록했으며, mBERT를 능가했지만 단일 언어 서브워드 모델에 비해 큰 격차를 보였다.
  • 명명된 엔티티 인식에서 TavBERT는 서브워드 모델에 뒤져서, 히브리어에서는 F1 점수 81.54(대비 AlephBERT의 84.91), 터키어에서는 F1 점수 91.19(대비 BERTurk의 93.57), 아랍어에서는 F1 점수 79.45(대비 AraBERT의 83.48)를 기록했다.
  • 추출적 질의 응답 작업에서 TavBERT는 뚜렷한 성능 격차를 보였다: 히브리어에서는 F1 48.7 / EM 29.1(대비 AraBERT의 F1 49.6 / EM 26.0), 터키어에서는 F1 61.7 / EM 46.7(대비 BERTurk의 F1 78.2 / EM 61.1), 아랍어에서는 F1 60.0 / EM 45.9(대비 AraBERT의 F1 83.5 / EM 71.1)를 기록했다.
  • 세 언어 전반에서 서브워드 기반 모델은 의미적 작업에서 TavBERT를 일관되게 앞서며, 더 강력한 의미적 표현 학습 능력을 보였다.
  • 결과적으로 서브워드 토크나이제이션은 MRLs에 대해 합리적이고 효과적인 인덕티브 편향임을 시사하며, 이는 이전에 그 부적합성에 대한 주장과는 정반대이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.