Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Semi-supervised Learning for Text Classification Under Large-Scale Pretraining

Zijun Sun, Chun Chieh Fan|arXiv (Cornell University)|2020. 11. 17.
Topic Modeling참고 문헌 81인용 수 10
한 줄 요약

이 논문은 대규모 언어 모델 사전 훈련 환경에서 텍스트 분류의 준지도 학습을 조사하며, 라벨이 없는 데이터 $U$에 대해 도메인 내 사전 훈련이 개방형 사전 훈련보다 더 효과적이라고 제안한다. 도메인 내 사전 훈련과 가짜 레이블링을 조합하면 성능이 크게 향상되며, IMDB에서 라벨이 50개뿐인 경우 93.8%의 정확도를 기록하고 전체 데이터를 사용할 경우 96.6%에 이를 정도로, 자원이 제한된 텍스트 분류에 실용적인 프레임워크를 제공한다.

ABSTRACT

The goal of semi-supervised learning is to utilize the unlabeled, in-domain dataset U to improve models trained on the labeled dataset D. Under the context of large-scale language-model (LM) pretraining, how we can make the best use of U is poorly understood: is semi-supervised learning still beneficial with the presence of large-scale pretraining? should U be used for in-domain LM pretraining or pseudo-label generation? how should the pseudo-label based semi-supervised model be actually implemented? how different semi-supervised strategies affect performances regarding D of different sizes, U of different sizes, etc. In this paper, we conduct comprehensive studies on semi-supervised learning in the task of text classification under the context of large-scale LM pretraining. Our studies shed important lights on the behavior of semi-supervised learning methods: (1) with the presence of in-domain pretraining LM on U, open-domain LM pretraining is unnecessary; (2) both the in-domain pretraining strategy and the pseudo-label based strategy introduce significant performance boosts, with the former performing better with larger U, the latter performing better with smaller U, and the combination leading to the largest performance boost; (3) self-training (pretraining first on pseudo labels D' and then fine-tuning on D) yields better performances when D is small, while joint training on the combination of pseudo labels D' and the original dataset D yields better performances when D is large. Using semi-supervised learning strategies, we are able to achieve a performance of around 93.8% accuracy with only 50 training data points on the IMDB dataset, and a competitive performance of 96.6% with the full IMDB dataset. Our work marks an initial step in understanding the behavior of semi-supervised learning models under the context of large-scale pretraining.

연구 동기 및 목표

  • 대규모 사전 훈련이 이미 적용된 상황에서 준지도 학습이 여전히 유익한가를 이해하는 것.
  • 라벨이 없는 도메인 내 데이터 $U$를 활용하기 위해 도메인 내 사전 훈련과 가짜 레이블 생성의 효과성을 비교하는 것.
  • 데이터셋 크기에 따라 최적의 구현 전략(예: 자기 훈련 대 기존 훈련)을 결정하는 것.
  • 라벨이 있는($D$) 및 없는($U$) 데이터셋의 크기가 다양한 준지도 학습 전략의 성능에 미치는 영향을 조사하는 것.

제안 방법

  • 라벨이 없는 도메인 내 데이터셋 $U$에서 언어 모델을 사전 훈련하여 도메인 적합도를 향상시키며, 개방형 사전 훈련을 대체하거나 보완한다.
  • 라벨이 있는 데이터셋 $D$에서 훈련된 테이처 모델을 사용해 $U$의 가짜 레이블을 생성하고, 확장된 훈련 세트 $D'$를 구성한다.
  • 두 가지 훈련 전략을 구현한다: (1) 자기 훈련(가짜 레이블 세트 $D'$에서 사전 훈련한 후 $D$에서 미세 조정), (2) 기존 훈련($D \cup D'$를 동시에 훈련).
  • 반복적 가짜 레이블링을 적용하여, 한 반복에서 생성된 학생 모델이 다음 반복의 테이처 모델이 되도록 하여 레이블 신뢰도를 점진적으로 향상시킨다.
  • 가짜 레이블링을 위해 도메인 내 사전 훈련된 모델을 테이처 모델의 초기화로 사용함으로써 도메인 내 사전 훈련과 가짜 레이블링을 통합한다.
  • IMDB를 벤치마크로 사용하여 $D$(50에서 25,000까지)와 $U$(최대 340만 개의 리뷰까지)의 크기가 다양한 조건에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1대규모 개방형 사전 훈련이 이미 수행된 상황에서 준지도 학습이 여전히 유익한가?
  • RQ2라벨이 없는 도메인 내 데이터 $U$는 도메인 내 사전 훈련에 사용할 것인가, 아니면 가짜 레이블 생성에 사용할 것인가?
  • RQ3다양한 크기의 라벨 세트 $D$에 따라 다른 훈련 전략(예: 자기 훈련 대 기존 훈련)이 성능에 미치는 영향은 어떻게 되는가?
  • RQ4$D'$(가짜 레이블 세트)와 $U$의 크기가 모델 성능에 어떻게 영향을 미치는가?
  • RQ5반복적 가짜 레이블링은 성능에 어떤 영향을 미치며, 특히 작은 $D$의 경우 어떤가?

주요 결과

  • 라벨이 없는 데이터 $U$에 대해 도메인 내 사전 훈련이 개방형 사전 훈련보다 더 효과적이며, $U$가 이용 가능한 경우 개방형 사전 훈련은 불필요하다.
  • 도메인 내 사전 훈련은 $U$가 클수록 더 좋은 성능을 내지만, 가짜 레이블링은 $U$가 작을수록 더 우수하며, 두 전략을 조합하면 최고의 성능을 기록한다.
  • 작은 $D$(예: 50~100개 예제)의 경우 자기 훈련(가짜 레이블 세트 $D'$에서 사전 훈련한 후 $D$에서 미세 조정)이 기존 훈련보다 성능이 뛰어나며, $D$가 클수록 기존 훈련이 더 좋은 성능을 낸다.
  • $|D| = 50$일 때 준지도 학습을 통해 93.8%의 정확도를 달성하여 자원이 제한된 환경에서도 강력한 일반화 성능을 입증한다.
  • 전체 IMDB 데이터셋($|D| = 25,000$)을 사용할 경우 조합 전략으로 96.6%의 정확도를 기록하여 높은 경쟁력 있는 성능을 보였다.
  • 반복적 가짜 레이블링은 추가적인 성능 향상을 제공하며, 특히 작은 $D$의 경우 두드러진 효과를 보이며, 여러 차례 반복 후에야 성능이 안정화된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.