Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-Tuning Pre-trained Language Model with Weak Supervision: A Contrastive-Regularized Self-Training Approach

Yue Yu, Simiao Zuo|arXiv (Cornell University)|2020. 10. 15.
Topic Modeling참고 문헌 44인용 수 5
한 줄 요약

이 논문은 레이블이 없는 데이터만을 사용하여 사전 훈련된 언어 모델을 미세조정하는 대비 정규화된 자기 훈련 프레임워크인 COSINE을 제안한다. 대비 정규화를 통해 표현 학습을 향상시키고, 신뢰도 기반 재가중을 통해 노이즈가 있는 가짜 레이블을 억제함으로써 COSINE는 완전히 감독된 방법과 경쟁 가능한 성능을 달성하여, Yelp 데이터셋에서 완전히 감독된 미세조정의 97.2%에 근접한 96.0%의 정확도를 기록한다.

ABSTRACT

Fine-tuned pre-trained language models (LMs) have achieved enormous success in many natural language processing (NLP) tasks, but they still require excessive labeled data in the fine-tuning stage. We study the problem of fine-tuning pre-trained LMs using only weak supervision, without any labeled data. This problem is challenging because the high capacity of LMs makes them prone to overfitting the noisy labels generated by weak supervision. To address this problem, we develop a contrastive self-training framework, COSINE, to enable fine-tuning LMs with weak supervision. Underpinned by contrastive regularization and confidence-based reweighting, this contrastive self-training framework can gradually improve model fitting while effectively suppressing error propagation. Experiments on sequence, token, and sentence pair classification tasks show that our model outperforms the strongest baseline by large margins on 7 benchmarks in 6 tasks, and achieves competitive performance with fully-supervised fine-tuning methods.

연구 동기 및 목표

  • 레이블 데이터가 부족하거나 가용하지 않을 경우 사전 훈련된 언어 모델을 미세조정하는 데 도전하는 데 목적이 있다.
  • 약한 감독을 통해 생성된 노이즈가 있는 가짜 레이블로 인한 오류 전파 문제를 완화하는 데 목적이 있다.
  • 대비 정규화와 신뢰도 기반 재가중을 활용하여 약한 감독 하에서 모델의 일반화 능력과 내성 강도를 향상시키는 데 목적이 있다.
  • 약한 감독 소스에 대한 사전 지식이 필요 없이 다양한 NLP 분류 작업에 적용 가능한 유연하고 작업에 관계없는 프레임워크를 개발하는 데 목적이 있다.
  • 완전히 감독된 미세조정과 비교 가능한 성능을 달성하면서도, 오직 약한 레이블과 비레이블 데이터에 의존하는 데 목적이 있다.

제안 방법

  • COSINE는 두 단계 훈련 과정을 사용한다: 첫 번째로, 조기 정지 기법을 적용하여 약한 레이블 데이터로 모델을 미세조정한다.
  • 그 후, 비레이블 데이터에 대해 대비 자기 훈련을 적용하며, 가짜 레이블을 생성하고 동일 클래스의 샘플 간 거리를 좁히고 다른 클래스 간 거리를 넓히는 방식으로 특징 공간을 정규화한다.
  • 신뢰도 기반 재가중은 훈련 중에 높은 신뢰도 예측에 초점을 맞춰 잘못된 가짜 레이블의 영향을 줄인다.
  • 신뢰도 정규화는 과도하게 확신하는 예측을 억제함으로써 노이즈가 있는 레이블에 민감하지 않게 하여 모델의 매끄러움을 강화한다.
  • 소량의 깨끗한 레이블이 가용할 경우, 프레임워크는 준감독 학습으로 확장 가능하다.
  • 이 방법은 약한 감독 소스에 대해 무관하며, 의미 규칙, 패턴 매칭, 커뮤니티 기반 레이블링을 모두 지원한다.

실험 결과

연구 질문

  • RQ1약한 감독 하에서 사전 훈련된 언어 모델의 미세조정 동안 대비 자기 훈련 프레임워크가 레이블 노이즈를 효과적으로 줄일 수 있는가?
  • RQ2신뢰도 기반 재가중과 정규화는 자기 훈련에서 노이즈가 있는 가짜 레이블에 대해 어떻게 강건성을 향상시키는가?
  • RQ3약한 감독 모델이 완전히 감독된 미세조정과 비교해 어느 정도의 성능을 달성할 수 있는가?
  • RQ4이 프레임워크는 시퀀스, 토큰, 문장 쌍 분류를 포함한 다양한 NLP 작업으로 일반화 가능한가?
  • RQ5편향되거나 무작위로 손상된 레이블과 같은 다양한 유형의 레이블 노이즈 하에서 모델의 성능은 어떠한가?

주요 결과

  • COSINE는 일곱 개의 공개 벤치마크에서 평가된 여섯 가지 NLP 분류 작업 전반에서 가장 강력한 기준 모델을 모두 압도한다.
  • Yelp 데이터셋에서 COSINE는 96.0%의 정확도를 기록했으며, 완전히 감독된 미세조정의 97.2%에 근접한 성능을 보였다.
  • 대비 정규화와 신뢰도 기반 재가중 덕분에, 편향된 레이블 노이즈와 무작위로 손상된 레이블 노이즈 모두에 대해 강력한 내성 강도를 보였다.
  • 레이블 데이터가 전혀 없을 경우에도 경쟁 가능한 성능을 달성했으며, 기존의 약한 감독 미세조정 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 신뢰도 기반 재가중과 정규화는 오류 전파를 효과적으로 억제하여 반복적인 자기 훈련 과정에서 성능 저하를 방지했다.
  • 이 방법은 의미 규칙과 커뮤니티 기반 레이블링을 포함한 다양한 약한 감독 소스에 적용 가능하며, 레이블링 함수에 대한 사전 지식이 필요로 하지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.