[논문 리뷰] Simple Contrastive Representation Adversarial Learning for NLP Tasks
이 논문은 간단한 대비적 적대적 학습(SCAL)과 비지도 학습을 위한 SCAL(USCAL)을 제안하며, 임bedding 공간에서 어려운 적대적 예제를 생성하여 대비 학습의 양성 쌍으로 활용함으로써 모델의 강건성과 일반화 능력을 향상시킨다. 이 방법은 GLUE 벤치마크에서 SOTA 성능을 달성(비트 기반 모델 대비 1.75% 향상)하고, 적대적 NLI 작업에서도 최고 성능을 기록하며, 적대적 훈련 하에 ANLI 테스트 세트에서 32.4%의 정확도와 ANLI 개발 세트에서 58.6%의 정확도를 기록한다.
Self-supervised learning approach like contrastive learning is attached great attention in natural language processing. It uses pairs of training data augmentations to build a classification task for an encoder with well representation ability. However, the construction of learning pairs over contrastive learning is much harder in NLP tasks. Previous works generate word-level changes to form pairs, but small transforms may cause notable changes on the meaning of sentences as the discrete and sparse nature of natural language. In this paper, adversarial training is performed to generate challenging and harder learning adversarial examples over the embedding space of NLP as learning pairs. Using contrastive learning improves the generalization ability of adversarial training because contrastive loss can uniform the sample distribution. And at the same time, adversarial training also enhances the robustness of contrastive learning. Two novel frameworks, supervised contrastive adversarial learning (SCAL) and unsupervised SCAL (USCAL), are proposed, which yields learning pairs by utilizing the adversarial training for contrastive learning. The label-based loss of supervised tasks is exploited to generate adversarial examples while unsupervised tasks bring contrastive loss. To validate the effectiveness of the proposed framework, we employ it to Transformer-based models for natural language understanding, sentence semantic textual similarity and adversarial learning tasks. Experimental results on GLUE benchmark tasks show that our fine-tuned supervised method outperforms BERT$_{base}$ over 1.75\%. We also evaluate our unsupervised method on semantic textual similarity (STS) tasks, and our method gets 77.29\% with BERT$_{base}$. The robustness of our approach conducts state-of-the-art results under multiple adversarial datasets on NLI tasks.
연구 동기 및 목표
- 텍스트가 이산적이고 희박하기 때문에 데이터 증강이 어려운 자연어 처리(NLP) 분야에서 의미 있는, 레이블을 유지하는 양성 쌍을 생성하는 데 도전하는 것.
- 적대적 훈련과 대비 학습을 융합하여 적대적 예제를 어려운 양성 쌍으로 활용함으로써 모델의 일반화 능력과 강건성을 향상시키는 것.
- 다양한 NLP 작업을 위한 지도 학습 및 비지도 학습을 통합한 통합 프레임워크를 제안하는 것.
- 임베딩 공간 내 적대적 예제가 NLP의 대비 학습을 위한 새로운 데이터 증강 전략으로 효과적인지 검증하는 것.
제안 방법
- 입력 임베딩의 기울기를 계산하여 임베딩 공간에서 적대적 예제를 생성하고, 작은 편향을 더해 $ z_i^{adv} $ 를 생성한다.
- 프레임워크는 $ z_i $ 와 $ z_i^{adv} $ 를 양성 쌍으로 묶어주는 대비 손실을 사용하며, 서로 다른 인스턴스의 표현은 서로 멀어지도록 한다.
- 지도 학습의 경우, SCAL에서 레이블 기반 분류 손실과 대비 손실을 결합하여 정확도와 표현 품질을 동시에 최적화한다.
- 비지도 학습의 경우, USCAL에서 대비 손실만을 사용하여 레이블 없이 문장 표현을 학습한다.
- 모든 브랜치에서 공통된 인코더 및 분류기 가중치를 사용하여 일관성 유지 및 훈련 효율성 향상.
- 이 방법은 BERT 및 RoBERTa 기반 모델에 적용되며, 어려운 양성 쌍을 생성하기 위해 기울기 기반 편향을 통해 적대적 훈련을 수행한다.
실험 결과
연구 질문
- RQ1임베딩 공간에서 생성된 적대적 예제가 NLP의 대비 학습에 효과적인 양성 쌍으로 기능할 수 있는가?
- RQ2적대적 훈련과 대비 학습을 융합하면 하류 NLP 작업에서 모델의 일반화 능력과 강건성이 향상되는가?
- RQ3제안된 SCAL 프레임워크는 GLUE 및 NLI 벤치마크에서 기존의 적대적 훈련 및 대비 학습 방법과 비교해 어떻게 성능을 내는가?
- RQ4비지도 버전인 USCAL은 지도 학습 방법과 비교해 유사한 문장 표현을 효과적으로 학습할 수 있는가?
주요 결과
- SCAL은 GLUE 벤치마크에서 비트 기반 모델 대비 1.75% 향상되어 지도 학습 NLU 작업에서 더 나은 일반화 능력을 보였다.
- 문서 유사도 분석(STS) 작업에서 비지도 USCAL 방법은 비트 기반 모델을 사용해 77.29%의 성능을 기록하며 강력한 제로샷 성능를 보였다.
- 적대적 ANLI 벤치마크에서 MNLI+SNLI에서 훈련한 경우 SCAL은 32.4%의 테스트 정확도를 기록했으며, FreeLB(27.4%)와 InfoBERT(28.2%)를 4% 이상 초월했다.
- MNLI+SNLI+ANLI+FeverNLI에서 미세조정한 경우, RoBERTa 기반 SCAL은 ANLI 개발 세트에서 58.6%의 강건한 정확도를 기록했으며, InfoBERT(58.3%)와 FreeLB(56.2%)를 모두 뛰어넘었다.
- 이 방법은 다양한 공격 시나리오에서 다양한 적대적 NLI 데이터셋에서 높은 강건성을 유지하며 뛰어난 성능을 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.