Skip to main content
QUICK REVIEW

[논문 리뷰] Guess the Instruction! Flipped Learning Makes Language Models Stronger Zero-Shot Learners

Seonghyeon Ye, Doyoung Kim|arXiv (Cornell University)|2022. 10. 06.
Topic Modeling인용 수 10
한 줄 요약

이 논문은 입력-라벨 쌍에서 작업 지시어를 생성하도록 언어 모델을 훈련하는 메타훈련 방법인 Flipped Learning을 제안한다. 이는 새로운 라벨에 대해 특히 더 나은 zero-shot 일반화를 향상시킨다. 11B Flipped 모델은 14개의 BIG-Bench 작업 평균에서 T0-11B보다 8.4% 높고, 3-shot GPT-3 (175B)보다 9.7% 높으며, 새로운 라벨 쌍에 대해 최대 20% 높은 F1 점수를 기록한다.

ABSTRACT

Meta-training, which fine-tunes the language model (LM) on various downstream tasks by maximizing the likelihood of the target label given the task instruction and input instance, has improved the zero-shot task generalization performance. However, meta-trained LMs still struggle to generalize to challenging tasks containing novel labels unseen during meta-training. In this paper, we propose Flipped Learning, an alternative method of meta-training which trains the LM to generate the task instruction given the input instance and label. During inference, the LM trained with Flipped Learning, referred to as Flipped, selects the label option that is most likely to generate the task instruction. On 14 tasks of the BIG-bench benchmark, the 11B-sized Flipped outperforms zero-shot T0-11B and even a 16 times larger 3-shot GPT-3 (175B) on average by 8.4% and 9.7% points, respectively. Flipped gives particularly large improvements on tasks with unseen labels, outperforming T0-11B by up to +20% average F1 score. This indicates that the strong task generalization of Flipped comes from improved generalization to novel labels. We release our code at https://github.com/seonghyeonye/Flipped-Learning.

연구 동기 및 목표

  • 새로운 라벨이 포함된 작업에서 메타훈련된 언어 모델의 열악한 zero-shot 일반화 문제를 해결하기 위해.
  • 지시어에서 라벨을 생성하는 표준 메타훈련 파라다임을 재고함으로써 라벨 일반화를 향상시키기 위해.
  • 보면 라벨 형태에 과적합되는 것을 줄이고 더 효율적이고 효과적인 zero-shot 학습 방법을 개발하기 위해.
  • 훈련 시 라벨에 조건을 주는 것이 새로운 작업과 라벨 변형에 대한 일반화를 향상시키는지 확인하기 위해.

제안 방법

  • Flipped Learning는 입력 예시와 정답 라벨이 주어졌을 때 작업 지시어를 예측하도록 언어 모델을 훈련시키며, 표준 생성 방향을 뒤집는다.
  • 표준 교차 엔트로피 손실을 사용하여 입력-라벨 쌍이 주어졌을 때 정답 지시어의 확률을 최대화한다.
  • 모델이 잘못된 라벨 옵션에 대해 정답 지시어를 생성하지 않도록 하기 위해 비확률 손실(Unlikelihood loss)을 적용하여 분류 성능를 향상시킨다.
  • 추론 시에는 주어진 지시어를 가장 잘 생성할 수 있는 라벨을 선택함으로써, 예시 없이 zero-shot 예측을 가능하게 한다.
  • 이 방법은 T5 기반 모델에 적용되며, T0의 계산 자원의 약 5%와 데이터셋 수의 절반만 사용하여 효율적이다.
  • 이 방법은 52개의 데이터셋(Flipper+)으로 확장되어 MMLU에서 평가되었으며, 매우 적은 데이터로도 뛰어난 성능을 기록했다.

실험 결과

연구 질문

  • RQ1입력과 라벨에서 지시어를 생성하도록 언어 모델을 훈련시키는 것이 새로운 작업에서의 zero-shot 일반화를 향상시키는가?
  • RQ2Flipped Learning는 '예/아니요'와 같은 특정 라벨 형태에 과적합되는 것을 줄이는가? (예: '동의/반대')
  • RQ3Flipped Learning는 표준 메타훈련(예: Direct)과 비교해 새로운 라벨 쌍에서 성능이 어떻게 되는가?
  • RQ4Flipped Learning로 훈련된 더 작은 모델이 zero-shot 환경에서 GPT-3 (175B)와 같은 더 큰 모델을 능가하는가?
  • RQ5Flipped Learning에서 훈련 데이터셋의 수를 늘리면 MMLU와 같은 도전적인 벤치마크에서 성능이 더 향상되는가?

주요 결과

  • 11B Flipped 모델은 14개의 BIG-Bench 작업 평균에서 T0-11B보다 8.4% 높은 성능을 기록하여, 더 뛰어난 zero-shot 일반화 능력을 입증했다.
  • Flipped는 3-shot GPT-3 (175B)보다 평균 9.7% 높은 성능을 기록했으며, zero-shot 모델임에도 불구하고 훨씬 더 작은 크기임에도 불구하고 성능을 뛰어넘었다.
  • 새로운 라벨 쌍(예: '예/아니요' 대비 '동의/반대')이 포함된 작업에서 Flipped는 T0-11B 대비 F1 점수를 최대 20% 향상시켰다. 이는 향상된 라벨 일반화 능력을 확인한다.
  • 52개의 데이터셋에서 훈련된 Flipped+는 MMLU에서 뛰어난 성능을 기록했으며, 데이터셋 수가 10배 많은 FLAN-T5와의 정확도 격차를 10% 줄였다.
  • Flipped는 14개의 일반 NLP 작업에서 최상의 zero-shot 성능을 기록했으며, 평균적으로 모든 기준 모델을 능가했다.
  • 이 방법은 효율적이다: Flipped는 T0의 계산 자원의 약 5%와 데이터셋 수의 절반만 사용했지만, 더 뛰어난 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.