Skip to main content
QUICK REVIEW

[논문 리뷰] CAPT: Contrastive Pre-Training for Learning Denoised Sequence Representations

Fuli Luo, Pengcheng Yang|arXiv (Cornell University)|2020. 10. 13.
Multimodal Machine Learning Applications참고 문헌 38인용 수 14
한 줄 요약

CAPT는 원본 및 손상된 입력 시퀀스 간의 의미 일致성을 강제하여 노이즈에 강인한 시퀀스 표현을 학습하는 대비적 사전학습 프레임워크를 제안한다. 인스턴스 기반 대비 손실을 적용함으로써 사전학습-微調整 불일치를 감소시키고 전반적인 의미 모델링을 향상시켜 자연어 처리 및 시각-언어 작업에서 GLUE에 0.6%, NLVR²에 0.8%의 일관된 성능 향상을 달성한다.

ABSTRACT

Pre-trained self-supervised models such as BERT have achieved striking success in learning sequence representations, especially for natural language processing. These models typically corrupt the given sequences with certain types of noise, such as masking, shuffling, or substitution, and then try to recover the original input. However, such pre-training approaches are prone to learning representations that are covariant with the noise, leading to the discrepancy between the pre-training and fine-tuning stage. To remedy this, we present ContrAstive Pre-Training (CAPT) to learn noise invariant sequence representations. The proposed CAPT encourages the consistency between representations of the original sequence and its corrupted version via unsupervised instance-wise training signals. In this way, it not only alleviates the pretrain-finetune discrepancy induced by the noise of pre-training, but also aids the pre-trained model in better capturing global semantics of the input via more effective sentence-level supervision. Different from most prior work that focuses on a particular modality, comprehensive empirical evidence on 11 natural language understanding and cross-modal tasks illustrates that CAPT is applicable for both language and vision-language tasks, and obtains surprisingly consistent improvement, including 0.6\% absolute gain on GLUE benchmarks and 0.8\% absolute increment on $ ext{NLVR}^2$.

연구 동기 및 목표

  • 자기지도 사전학습에서 노이즈에 민감한 표현으로 인한 사전학습-微조정 불일치 문제를 해결한다.
  • 더 효과적인 문장 수준의 감독을 도입하여 전반적인 의미 모델링을 향상시킨다.
  • 자연어 처리 및 시각-언어 작업에 모두 적용 가능한 일반화 가능한 사전학습 방법을 개발한다.
  • 위치 기반 감독(예: 다음 문장 예측)에 의존도를 줄여 약하거나 혼란스러운 기울기를 유발하는 것을 방지한다.
  • 사전학습 모델이 마스킹 또는 셔플링과 같은 일반적인 손상 연산에 강인한 표현을 학습할 수 있도록 한다.

제안 방법

  • 입력 시퀀스에 표준 손상 연산(예: 마스킹)을 적용하여 손상된 버전을 생성한다.
  • 사전학습된 모델(예: BERT, RoBERTa)을 사용해 원본 및 손상된 시퀀스를 모두 은닉 표현으로 인코딩한다.
  • 전체 시퀀스 수준 표현을 확보하기 위해 집계 레이어(예: 평균 풀링 또는 분류 토큰)를 적용한다.
  • 동일 인스턴스의 표현(원본 및 손상된)을 임베딩 공간에서 가까이 오게 하는 대비 손실를 정의한다.
  • 다른 인스턴스(음성 쌍)의 표현을 서로 멀리 떨어지게 하여 구별 가능한 특징 학습을 강제한다.
  • 노이즈 집중형 및 다양한 특징을 더 잘 학습할 수 있도록 보조 방법 두 가지를 도입하여 강건성과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1대비 학습이 자기지도 사전학습에서 노이즈에 민감한 표현으로 인한 사전학습-微조정 불일치를 줄일 수 있는가?
  • RQ2인스턴스 기반 대비 감독은 토큰 수준 또는 세그먼트 수준 작업보다 전반적인 의미 모델링을 향상시키는가?
  • RQ3제안된 CAPT 프레임워크는 자연어 처리 및 시각-언어 작업 모두에 일반화 가능한가?
  • RQ4다운스트림 성능 측면에서 표준 사전학습 목표(예: MLM, MRM)와 비교해 CAPT는 어떠한가?
  • RQ5CAPT는 추가적인 레이블 데이터나 훈련 비용을 크게 증가시키지 않고도 모델의 강건성과 일반화 능력을 향상시키는가?

주요 결과

  • CAPT는 RoBERTa의 GLUE 개발 세트 성능을 88.9%에서 89.5%로 향상시켜 0.6%의 절대적 성능 향상을 달성한다.
  • NLVR² 벤치마크에서 CAPT는 LXMERT를 0.8% 초월하여 시각-언어 이해에서 강력한 성능 향상을 보였다.
  • CAPT는 8개의 자연어 이해 및 3개의 다중모odal 작업을 포함한 총 11개의 다양한 작업에서 일관된 성능 향상을 기록했다.
  • 마스킹과 같은 일반적인 손상 연산에 강인한 표현을 학습함으로써 사전학습-微조정 불일치를 감소시켰다.
  • 다음 문장 예측과 같은 위치 기반 작업보다 더 강력한 문장 수준 감독을 제공함으로써 전반적인 의미 모델링을 향상시켰다.
  • 대비 목표 덕분에 추가 레이블 데이터가 없이도 훈련 비용을 크게 증가시키지 않고도 더 나은 특징 학습이 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.