[논문 리뷰] Generate, Annotate, and Learn: Generative Models Advance Self-Training and Knowledge Distillation.
이 논문은 자기 훈련과 지식 정복을 위한 도메인 내 무라벨 데이터를 생성하기 위해 미세조정된 GPT-2를 사용하는 GAL(Generate, Annotate, and Learn) 프레임워크를 소개한다. 소규모 데이터를 생성하고 분류기로부터 소프트 가짜 레이블을 사용함으로써 GAL은 GLUE, CIFAR-10, UCI 테이블러 태스크에서 성능을 향상시키며, 6층 트랜스포머에서 최신 기술 수준의 성능을 달성하고 RoBERTa-large보다 GLUE에서 뛰어난 성능을 보인다.
Semi-Supervised Learning (SSL) has seen success in many application domains, but this success often hinges on the availability of task-specific unlabeled data. Knowledge distillation (KD) has enabled compressing deep networks and ensembles, achieving the best results when distilling knowledge on fresh task-specific unlabeled examples. However, task-specific unlabeled data can be challenging to find. We present a general framework called generate, annotate, and learn (GAL) that uses unconditional generative models to synthesize in-domain unlabeled data, helping advance SSL and KD on different tasks. To obtain strong task-specific generative models, we adopt generic generative models, pretrained on open-domain data, and fine-tune them on inputs from specific tasks. Then, we use existing classifiers to annotate generated unlabeled examples with soft pseudo labels, which are used for additional training. When self-training is combined with samples generated from GPT2-large, fine-tuned on the inputs of each GLUE task, we outperform a strong RoBERTa-large baseline on the GLUE benchmark. Moreover, KD on GPT-2 samples yields a new state-of-the-art for 6-layer transformers on the GLUE leaderboard. Finally, self-training with GAL offers significant gains on image classification on CIFAR-10 and four tabular tasks from the UCI repository
연구 동기 및 목표
- 자기 훈련과 지식 정복에서 작업별 무라벨 데이터 접근성이 제한된 문제를 해결하기 위해.
- 실제 무라벨 데이터에 의존하지 않고도 다운스트림 NLP, 비전, 테이블러 태스크에서 모델 성능을 향상시키기 위해.
- 사전 훈련된 생성 모델을 활용해 데이터 생성과 가짜 레이블링을 수행할 수 있는 일반화 가능한 프레임워크를 개발하기 위해.
- 미세조정된 GPT-2에서 유도된 합성 데이터가 다양한 태스크에서 자기 훈련과 지식 정복을 향상시킬 수 있음을 입증하기 위해.
제안 방법
- 작업별 입력 데이터에 대해 일반적인 사전 훈련된 생성 모델(GPT-2-large)을 미세조정하여 작업별 생성 모델을 구축하기 위해.
- 미세조정된 생성 모델을 사용해 다운스트림 작업을 위한 도메인 내 무라벨 예제를 합성하기 위해.
- 기존 분류기를 적용하여 생성된 샘플에 소프트 가짜 레이블을 할당하기 위해.
- 생성된, 가짜 레이블이 부여된 데이터를 사용해 학생 모델의 성능을 향상시키기 위해 자기 훈련을 수행하기 위해.
- 생성된 데이터를 기반으로 지식 정복을 적용하여 더 작은 모델을 훈련함으로써 성능과 효율성을 향상시키기 위해.
- 다양한 벤치마크에서 훈련 및 평가 수행: NLP용 GLUE, 비전용 CIFAR-10, UCI 테이블러 데이터셋.
실험 결과
연구 질문
- RQ1무조건적 생성 모델은 다운스트림 작업을 위한 고품질의 도메인 내 무라벨 데이터를 생성하기 위해 미세조정될 수 있는가?
- RQ2미세조정된 GPT-2로 생성된 합성 데이터를 사용한 자기 훈련이 GLUE 및 기타 벤치마크에서 성능 향상에 기여하는가?
- RQ3생성된 데이터 기반의 지식 정복이 더 작은 트랜스포머 모델에서 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ4GAL 프레임워크는 NLP, 비전, 테이블러 데이터를 포함한 다양한 도메인에서 얼마나 효과적인가?
- RQ5생성된 데이터에 소프트 가짜 레이블을 적용할 경우, 모든 태스크에서 일관된 일반화 성능 향상이 이루어지는가?
주요 결과
- 미세조정된 GPT-2-large에서 생성된 GAL 데이터를 사용한 자기 훈련은 GLUE 벤치마크에서 강력한 RoBERTa-large 베이스라인을 능가한다.
- GPT-2에서 생성된 샘플을 기반으로 한 지식 정복은 6층 트랜스포머에 대해 GLUE 랭킹에서 새로운 최신 기술 수준의 성능을 달성한다.
- GAL을 사용한 자기 훈련은 CIFAR-10 이미지 분류에서 뚜렷한 성능 향상을 이룬다.
- 이 프레임워크는 UCI 저장소의 네 가지 테이블러 학습 태스크에서 성능 향상을 이룬다.
- 생성된 데이터에 소프트 가짜 레이블을 적용함으로써 모든 평가된 태스크에서 일관되고 측정 가능한 성능 향상이 이루어진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.