Skip to main content
QUICK REVIEW

[논문 리뷰] CERT: Contrastive Self-supervised Learning for Language Understanding

Hongchao Fang, Sicheng Wang|arXiv (Cornell University)|2020. 05. 16.
Topic Modeling인용 수 9
한 줄 요약

CERT는 백트랜슬레이션을 통한 문장 수준 증강을 이용해 BERT 유사 모델을 사전학습하는 대비적 자기지도 학습 방법을 제안한다. 두 증강 문장이 동일한 원본 문장에서 유래되었는지 예측함으로써 CERT는 문장 수준의 의미를 향상시켜 GLUE 태스크 11개 중 7개에서 BERT를 능가하고 평균 점수를 더 높였다.

ABSTRACT

Pretrained language models such as BERT, GPT have shown great effectiveness in language understanding. The auxiliary predictive tasks in existing pretraining approaches are mostly defined on tokens, thus may not be able to capture sentence-level semantics very well. To address this issue, we propose CERT: Contrastive self-supervised Encoder Representations from Transformers, which pretrains language representation models using contrastive self-supervised learning at the sentence level. CERT creates augmentations of original sentences using back-translation. Then it finetunes a pretrained language encoder (e.g., BERT) by predicting whether two augmented sentences originate from the same sentence. CERT is simple to use and can be flexibly plugged into any pretraining-finetuning NLP pipeline. We evaluate CERT on 11 natural language understanding tasks in the GLUE benchmark where CERT outperforms BERT on 7 tasks, achieves the same performance as BERT on 2 tasks, and performs worse than BERT on 2 tasks. On the averaged score of the 11 tasks, CERT outperforms BERT. The data and code are available at https://github.com/UCSD-AI4H/CERT

연구 동기 및 목표

  • 기존 사전학습 방법이 토큰 수준 예측 작업에 집중함으로써 전반적인 문장 수준의 의미를 충분히 반영하지 못할 수 있는 한계를 해결한다.
  • 예측 작업을 토큰 수준에서 문장 수준으로 이동시켜 언어 표현 학습을 향상시킨다.
  • 기존 BERT 스타일의 모델과 파인튜닝 파이프라인과 호환되는 유연하고 플러그인 방식의 사전학습 방법을 개발한다.
  • 자연어 이해를 위한 문장 수준의 대비적 자기지도 학습의 효과성을 입증한다.
  • 증강 전략과 사전학습 코퍼스 소스의 영향을 아블레이션 연구를 통해 조사한다.

제안 방법

  • 백트랜슬레이션을 사용해 문장 수준의 데이터 증강을 수행한다: 원본 문장을 대상 언어로 번역한 후 다시 원래 언어로 번역하여 의미는 유사하지만 어휘적 표현이 다른 문장을 생성한다.
  • 모멘타임 컨트라스트(MoCo)를 사용해 대비적 자기지도 학습을 수행하며, 각 증강 문장을 쿼리로, 다른 증강 문장을 키로 간주한다.
  • 동일한 원본 문장에서 유도된 두 증강 문장을 양성 쌍으로 정의하고, 서로 다른 원본에서 유도된 문장을 부정 쌍으로 정의한다.
  • 대비 손실을 사용해 양성 쌍 간의 유사도를 최대화하고 부정 쌍 간의 유사도를 최소화하도록 모델을 훈련한다.
  • 표준 파인튜닝을 사용해 라벨이 부여된 데이터를 바탕으로 CERT 모델을 최종적인 NLP 태스크에 대해 파인튜닝한다.
  • CERT를 다양한 사전학습된 인코더(예: BERT, BART, RoBERTa)에 적용할 수 있는 플러그인 모듈로 통합한다.

실험 결과

연구 질문

  • RQ1문장 수준에서의 대비적 자기지도 학습은 토큰 수준 사전학습에 비해 언어 표현을 향상시킬 수 있는가?
  • RQ2백트랜슬레이션 기반 문장 증강은 다른 증강 전략에 비해 강건한 문장 표현을 학습하는 데 더 효과적인가?
  • RQ3사전학습 코퍼스의 선택이 CERT 프레임워크의 성능에 영향을 미치는가?
  • RQ4표준 BERT 사전학습에 비해 CERT는 하류 NLU 태스크에서 더 나은 일반화 성능을 달성할 수 있는가?
  • RQ5전반적인 의미적 구조를 포착하는 데 있어 문장 수준의 대비 학습 목표가 토큰 수준의 목표보다 더 효과적인가?

주요 결과

  • CERT는 GLUE 벤치마크의 11개 태스크 중 7개에서 BERT를 능가하며, 특히 SST-2, QNLI, RTE에서 뚜렷한 향상을 보였다.
  • 모든 11개 GLUE 태스크의 평균 점수에서 CERT는 BERT보다 높은 성능을 기록하여 전반적인 언어 이해 능력 향상이 일관되게 이루어졌음을 보여주었다.
  • WNLI와 WNLI-SNLI 두 태스크에서는 CERT가 BERT와 동일한 성능을 달성하여 도전적인 의미 유사성 태스크에서 경쟁적인 성능을 보였다.
  • WNLI와 WNLI-SNLI 두 태스크에서 CERT는 BERT보다 성능이 열 劣하였으며, 이는 태스크 특성에 민감하거나 증강 노이즈에 영향을 받을 수 있음을 시사한다.
  • 아블레이션 연구 결과, CERT의 성능는 사전학습 코퍼스의 선택과 사용된 백트랜슬레이션 증강 수에 민감하게 영향을 받는 것으로 나타났다.
  • 이 방법은 플러그인 모듈로 효과적으로 작동한다: CERT는 어떤 사전학습된 인코더에나 적용 가능하며 아키텍처 변경 없이 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.