Skip to main content
QUICK REVIEW

[논문 리뷰] Using GPT-2 to Create Synthetic Data to Improve the Prediction Performance of NLP Machine Learning Classification Models

Dewayne Whitfield|arXiv (Cornell University)|2021. 04. 02.
Oil and Gas Production Techniques인용 수 8
한 줄 요약

이 논문은 NLP 텍스트 분류 모델의 성능을 향상시키기 위해 미세튜닝된 GPT-2를 사용하여 합성 텍스트 데이터를 생성하는 방법을 제안한다. Yelp 피자 리뷰 데이터셋에 GPT-2를 미세튜닝한 후, 합성 리뷰를 실제 데이터와 결합함으로써, 실데이터로만 훈련된 기준 모델 대비 모델 정확도와 정밀도가 크게 향상됨을 실험적으로 입증하였다.

ABSTRACT

Classification Models use input data to predict the likelihood that the subsequent input data will fall into predetermined categories. To perform effective classifications, these models require large datasets for training. It is becoming common practice to utilize synthetic data to boost the performance of Machine Learning Models. It is reported that Shell is using synthetic data to build models to detect problems that rarely occur; for example Shell created synthetic data to help models to identify deteriorating oil lines. It is common practice for Machine Learning Practitioners to generate synthetic data by rotating, flipping, and cropping images to increase the volume of image data to train Convolutional Neural Networks. The purpose of this paper is to explore creating and utilizing synthetic NLP data to improve the performance of Natural Language Processing Machine Learning Classification Models. In this paper I used a Yelp pizza restaurant reviews dataset and transfer learning to fine-tune a pre-trained GPT-2 Transformer Model to generate synthetic pizza reviews data. I then combined this synthetic data with the original genuine data to create a new joint dataset. The new combined model significantly outperformed the original model in accuracy and precision.

연구 동기 및 목표

  • GPT-2로 생성된 합성 텍스트 데이터가 NLP 분류 모델의 성능을 향상시킬 수 있는지 조사하기.
  • 저자원 또는 불균형한 NLP 분류 환경에서 합성 데이터 증강의 효과를 평가하기.
  • 전이 학습을 활용한 GPT-2로 다양하고 현실적인 합성 텍스트를 생성하는 실용적인 방법을 제시하기.
  • 실데이터만 사용한 모델과 실-합성 데이터를 조합한 데이터셋을 사용한 모델 간의 성능을 텍스트 분류 작업에서 비교하기.

제안 방법

  • 도메인 특화의 합성 리뷰를 생성할 수 있도록 사전 훈련된 GPT-2 언어 모델을 실제 Yelp 피자 리뷰 데이터셋에 미세튜닝하기.
  • 미세튜닝된 GPT-2 모델을 사용하여 대량의 인간과 유사한 합성 리뷰를 생성하여 데이터 증강에 활용하기.
  • 합성 리뷰를 원본 실리뷰와 결합하여 통합 훈련 데이터셋을 구성하기.
  • 표준 NLP 훈련 절차를 사용하여 통합 실-합성 데이터셋으로 하류 텍스트 분류 모델을 재훈련하기.
  • 보류된 테스트 세트에서 표준 지표(예: 정확도 및 정밀도)를 사용하여 모델 성능 평가하기.

실험 결과

연구 질문

  • RQ1GPT-2로 생성된 합성 텍스트 데이터가 NLP 분류 모델의 예측 성능을 향상시킬 수 있는가?
  • RQ2실데이터와 합성 데이터를 함께 훈련한 모델의 성능은 순수 실데이터로만 훈련된 모델보다 어떻게 다를까?
  • RQ3GPT-2로 생성된 텍스트를 통한 데이터 증강이 모델의 일반화 능력과 견고성에 어느 정도 기여하는가?
  • RQ4합성 데이터는 텍스트 분류 작업에서 정밀도와 재현율에 어떤 영향을 미치는가?

주요 결과

  • 실-합성 데이터를 조합한 데이터셋으로 훈련된 모델은 실데이터로만 훈련된 기준 모델 대비 유의미하게 높은 정확도를 기록하였다.
  • 통합 모델은 테스트 세트에서 더 나은 분류 신뢰도를 보이며 정밀도가 향상됨을 보였다.
  • 합성 데이터는 노이즈나 분포 이탈 없이 훈련 예제의 다양성과 양을 효과적으로 증가시켰다.
  • 결과적으로 GPT-2는 태스크에 관련된 타당하고 현실적인 텍스트를 생성할 수 있으며, 이는 하류 모델의 성능 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.