Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer-based Korean Pretrained Language Models: A Survey on Three Years of Progress

Kichang Yang|arXiv (Cornell University)|2021. 11. 25.
Natural Language Processing Techniques인용 수 7
한 줄 요약

이 종합 검토는 2018–2021년 사이에 출시된 33개 이상의 한국어 미사전학습 언어 모델(PLM)을 종합적으로 비교하며, 감성 분석, NER, NLI, STS, 복구 탐지, 질의 응답 등 6개 벤치마크 과제에서의 성능을 평가한다. KoELECTRA (Base)와 KcELECTRA-base가 특히 장문 및 다중문장 과제에서 최고 성능을 보이며, 복잡한 추론 과제에서는 DistilKoBERT와 같은 정제된 모델에서 성능 저하가 발생함을 밝힌다.

ABSTRACT

With the advent of Transformer, which was used in translation models in 2017, attention-based architectures began to attract attention. Furthermore, after the emergence of BERT, which strengthened the NLU-specific encoder part, which is a part of the Transformer, and the GPT architecture, which strengthened the NLG-specific decoder part, various methodologies, data, and models for learning the Pretrained Language Model began to appear. Furthermore, in the past three years, various Pretrained Language Models specialized for Korean have appeared. In this paper, we intend to numerically and qualitatively compare and analyze various Korean PLMs released to the public.

연구 동기 및 목표

  • 2018년부터 2021년까지 공개된 트랜스포머 기반 한국어 미사전학습 언어 모델의 성능을 체계적으로 조사하고 비교하는 것.
  • 다양한 한국어 NLP 과제에서 모델 아키텍처, 사전학습 목표, 미세조정 전략을 분석하는 것.
  • NSMC, Naver NER, KorNLI, KorSTS, Question Pair, KorQuAD와 같은 표준 벤치마크에서의 모델 성능 평가.
  • 모델 크기, 정제, 사전학습 목표의 영향 등 성능 추세 분석, 하류 과제 정확도에 미치는 영향 파악.
  • 최고 성능 모델을 도출하고, 특히 장문 맥락 및 다중문장 추론 과제에서의 성능 격차를 규명하는 것.

제안 방법

  • 33개 이상의 공개된 한국어 PLM(예: KoBERT, KcBERT, KoELECTRA, SoongsilBERT, KcELECTRA, KoBigBird, XLM-RoBERTa)을 평가한다.
  • 6개 표준 한국어 NLP 과제에서 평가: NSMC(감성), Naver NER(이름 추출), KorNLI(자연어 추론), KorSTS(의미 유사도), Question Pair(복구 탐지), KorQuAD(질의 응답).
  • 표준 지표를 사용해 성능 측정: NSMC 및 NER의 경우 F1 점수, KorNLI 및 Question Pair의 경우 정확도, KorSTS의 경우 스피어만 상관계수, KorQuAD의 경우 EM 및 F1 점수.
  • 기본형 및 소형 버전의 모델을 분석하며, DistilKoBERT와 같은 정제 모델의 성능 트레이드오프에 특별한 주목을 기울인다.
  • 사전학습 목표(MLM, NSP, 그리고 ELECTRA 방식의 적대적 목표)에 따라 모델을 비교한다.
  • 결과를 종합 및 분석하여 아키텍처, 크기, 사전학습 전략에 따른 성능 추세를 도출한다.

실험 결과

연구 질문

  • RQ1다양한 NLP 벤치마크에서 가장 높은 성능을 기록한 한국어 PLM은 무엇이며, XLM-RoBERTa와 같은 다국어 모델과 비교해 어떻게 다를까?
  • RQ2DistilKoBERT와 같은 정제 모델은 NLI 및 QA와 같은 복잡한 장문장 과제에서 기존의 전체 크기 모델 대비 어떻게 성능을 내는가?
  • RQ3MLM, NSP, 또는 적대적 마스킹과 같은 사전학습 목표가 한국어 NLP의 하류 과제 성능에 어떤 영향을 미치는가?
  • RQ4KcBERT 및 SoongsilBERT는 짧은 텍스트 벤치마크에서는 강력한 성능을 보이지만, 왜 장문 맥락 과제에서는 성능이 떨어지는가?
  • RQ5KoBigBird 및 KoELECTRA와 같은 최신 모델은 질문 응답 및 자연어 추론과 같은 장문 맥락 추론 과제에서 어떻게 성능을 내는가?

주요 결과

  • KoELECTRA (Base)는 KorNLI에서 82.24의 정확도, KorSTS에서 85.53의 스피어만 상관계수를 기록하여 KoBERT 및 XLM-RoBERTa를 모두 초월하는 최고 성능을 보였다.
  • KcELECTRA-base는 BEEP! 혐오 발언 분류 벤치마크에서 F1 점수 69.91로 가장 높은 성능을 기록하여 KoBERT 및 KcBERT를 포함한 다른 모든 모델을 앞섰다.
  • KoBigBird는 KorQuAD에서 최고의 EM 점수(87.08)와 F1 점수(94.71)를 기록하여 장문 맥락 질문 응답 과제에서 뛰어난 성능을 보였다.
  • DistilKoBERT는 NSMC 성능 대비 BEEP! 데이터셋에서 F1 점수 5점 이상 감소하는 등 복잡하고 세밀한 분류 과제에서 성능 저하를 보이며 정제 모델의 한계를 드러냈다.
  • KcBERT 및 SoongsilBERT는 KorNLI 및 KorQuAD와 같은 다중문장 과제에서 다국어 XLM-RoBERTa-base 모델보다 낮은 점수를 기록하여 도메인 특화 사전학습이 항상 장문 맥락 추론에서의 일반화 능력을 향상시키지 못함을 시사한다.
  • 이 연구는 적대적 마스킹(ELECTRA) 및 전체 어텐션 메커니즘(BigBird)과 같은 사전학습 목표가 복잡한 추론 및 장문장 과제에서 성능 향상에 크게 기여함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.