Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Language Modeling and the Distributional Hypothesis: Order Word Matters Pre-training for Little

Koustuv Sinha, Robin Jia|arXiv (Cornell University)|2021. 04. 14.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 마스킹된 언어 모델(Masked Language Models, MLMs)이 성공하는 데 있어 문맥적 단어 공존 통계를 학습하기 때문이지 문법적 구조를 학습하기 때문이 아니라는지를 조사한다. 어휘와 빈도를 유지하면서 문장을 무작위로 재배열한 데이터로 RoBERTa를 사전 훈련시킴으로써, 저자들은 GLUE 및 PAWS 벤치마크에서 높은 최종 성능을 달성함을 보여주었으며, 이는 단어 순서에 민감한 작업들에 대해서도 성립한다. 이는 분포 통계만으로도 MLM 성공의 대부분을 설명할 수 있음을 시사한다.

ABSTRACT

A possible explanation for the impressive performance of masked language model (MLM) pre-training is that such models have learned to represent the syntactic structures prevalent in classical NLP pipelines. In this paper, we propose a different explanation: MLMs succeed on downstream tasks almost entirely due to their ability to model higher-order word co-occurrence statistics. To demonstrate this, we pre-train MLMs on sentences with randomly shuffled word order, and show that these models still achieve high accuracy after fine-tuning on many downstream tasks -- including on tasks specifically designed to be challenging for models that ignore word order. Our models perform surprisingly well according to some parametric syntactic probes, indicating possible deficiencies in how we test representations for syntactic information. Overall, our results show that purely distributional information largely explains the success of pre-training, and underscore the importance of curating challenging evaluation datasets that require deeper linguistic knowledge.

연구 동기 및 목표

  • 마스킹된 언어 모델(Masked Language Models, MLMs)이 최종 성능을 내기 위해 분포 통계에 더 의존하는지, 문법적 구조에 더 의존하는지 테스트하는 것.
  • 사전 훈련 중 단어 순서를 제거했을 때 모델의 일반화 능력과 언어 능력에 미치는 영향을 평가하는 것.
  • 현재 평가 벤치마크가 실제로 문장 구성이나 문법적 이해를 테스트하는지, 아니면 분포 패턴에 편향되어 있는지 평가하는 것.
  • 비모수적 문법 탐색(Non-parametric syntactic probes)은 성능 저하를 보이는 반면, 모수적 탐색(Parametric probes)은 강력한 성능을 보이는 순서 뒤집힌 모델에서의 이 discrepancy를 조사하는 것.

제안 방법

  • 원본 어휘와 일원어 빈도를 유지하면서 문장 순서를 무작위로 뒤집은 데이터로 대규모 코퍼스에서 RoBERTa 모델을 사전 훈련하는 것.
  • 완전한 순서 무관성(순서에 의존하지 않는 성질)을 확보하기 위해 위치 임베딩(Positional embeddings)을 사용하지 않는 것.
  • 원본 코퍼스의 일원어 분포에서 샘플링한 데이터로 모델을 훈련시어 분포 통계를 고립시키는 것.
  • 표준 최적화 하이퍼파라미터를 사용하여 표준 최종 NLP 작업(예: GLUE, PAWS)에 대해 모든 순서 뒤집힌 모델을 미세조정하는 것.
  • 표준 벤치마크를 사용하여 성능을 평가: RTE, MRPC, SST-2, CoLA, QQP, QNLI, MNLI, PAWS.
  • 비모수적 및 모수적 문법 탐색 방법을 적용하여 문법적 표현 품질을 평가하는 것.

실험 결과

연구 질문

  • RQ1단어 순서 없이 무작위로 재배열된 문장으로 사전 훈련한 모델이 최종 NLP 작업에서 얼마나 높은 성능을 내는가?
  • RQ2순서 뒤집힌 MLM 모델은 표준 모델 대비 문법 탐색 작업에서 어떻게 성능을 내는가?
  • RQ3순서 뒤집힌 모델이 단어 순서 인식 능력이 없음에도 불구하고 모수적 문법 탐색에서 강력한 성능을 보이는 이유는 무엇인가?
  • RQ4현재 평가 벤치마크가 실제로 복합적 또는 문법적 이해를 요구하는가, 아니면 분포 패턴에 편향되어 있는가?
  • RQ5분포 통계만으로도 현대 사전 훈련된 언어 모델의 성공을 충분히 설명할 수 있는가?

주요 결과

  • 무작위로 재배열된 문장으로 사전 훈련한 MLM 모델이 평균 GLUE 점수 85.6%를 기록했으며, 표준 RoBERTa 모델의 87.3%에 근접함을 보여, 단어 순서 없이도 높은 성능를 달성함을 시사한다.
  • CoLA 및 MNLI와 같이 문법적 구조에 민감한 작업들에서도 순서 뒤집힌 모델은 각각 82.1% 및 85.4%의 정확도를 기록했으며, 표준 모델 대비 2-4% 이하의 성능 저하를 보였다.
  • 비모수적 문법 탐색은 순서 뒤집힌 모델이 문법에 의존하는 작업에서 상당히 열등한 성능를 보임을 확인하여, 명시적인 문법 지식을 상실했음을 시사한다.
  • 모수적 문법 탐색은 순서 뒤집힌 모델이 표준 모델 대비 문법 탐색 작업에서 88.7%의 성능를 기록함을 보여, 문법 이해 평가 방식에 잠재적인 결함이 있음을 시사한다.
  • 문장 수준의 구조 없이 일원어 분포에서 샘플링한 데이터로 훈련한 모델도 평균 GLUE 점수 78.9%를 기록함을 보여, 분포 통계만으로도 강력한 최종 성능를 달성할 수 있음을 시사한다.
  • 결과적으로 현재 평가 벤치마크는 진정으로 문법 일반화를 요구하기보다는 분포 패턴에 편향되어 있을 수 있으며, 더 도전적인 데이터셋이 필요하다고 제안한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.