Skip to main content
QUICK REVIEW

[논문 리뷰] Finetuned Language Models Are Zero-Shot Learners

Jason Wei, Maarten Bosma|arXiv (Cornell University)|2021. 09. 03.
Topic Modeling참고 문헌 119인용 수 69
한 줄 요약

자연어 지시문으로 설명된 60개가 넘는 데이터셋에서 137B 언어 모델을 지시문 튜닝하면 보지 못한 작업에 대한 제로샷 성능이 크게 향상되며, 많은 데이터셋에서 GPT-3 제로샷을 능가하고 몇몇 벤치마크에서 GPT-3 소샷도 앞선다.

ABSTRACT

This paper explores a simple method for improving the zero-shot learning abilities of language models. We show that instruction tuning -- finetuning language models on a collection of tasks described via instructions -- substantially improves zero-shot performance on unseen tasks. We take a 137B parameter pretrained language model and instruction-tune it on over 60 NLP tasks verbalized via natural language instruction templates. We evaluate this instruction-tuned model, which we call FLAN, on unseen task types. FLAN substantially improves the performance of its unmodified counterpart and surpasses zero-shot 175B GPT-3 on 20 of 25 tasks that we evaluate. FLAN even outperforms few-shot GPT-3 by a large margin on ANLI, RTE, BoolQ, AI2-ARC, OpenbookQA, and StoryCloze. Ablation studies reveal that number of finetuning datasets, model scale, and natural language instructions are key to the success of instruction tuning.

연구 동기 및 목표

  • 자연어 지시문으로 기술된 작업에 대해 언어 모델을 미세조정하면 제로샷 작업 성능이 향상됨을 입증한다.
  • 크고 다양한 데이터셋 혼합으로 인한 지시문 튜닝이 보지 못한 작업 유형에 대한 일반화에 어떤 영향을 미치는지 보여준다.
  • 제로샷 이득에서 모델 규모, 학습 작업 수, 지시문 품질의 역할을 평가한다.

제안 방법

  • 자연어 지시 템플릿으로 표현된 60개가 넘는 NLP 데이터셋의 혼합에서 137B 파라미터의 디코더 전용 언어 모델(LaMDA-PT)을 미세조정한다.
  • 각 데이터셋마다 10개의 지시 템플릿을 만들어 작업을 설명하고, prompt를 다양화하기 위해 작업을 반대로 바꾸는 템플릿도 포함한다.
  • 지시문 튜닝 중에 보지 못한 보류된 태스크 클러스터에서 제로샷 성능을 평가하며, 클러스터 기반 평가 분할을 사용한다.
  • 추론 시 허용된 선택지를 지정하여 분류 작업 출력을 개선하기 위해 옵션 접미사를 사용한다.
  • 평가된 데이터셋 전반에서 제로샷 및 소샷 GPT-3, GPT-3 175B, 그리고 GLaM을 비교한다.
  • 지시문 튜닝 클러스터 수, 모델 규모, 지시문의 역할, 소샷 예시의 영향에 대한 제거/변형 실험을 수행한다.

실험 결과

연구 질문

  • RQ1지시 형식의 작업으로 언어 모델을 미세조정하면 보지 못한 작업 유형에 대한 제로샷 성능이 향상되는가?
  • RQ2지시문 콘텐츠의 수, 모델 규모, 지시 내용과 같은 요인이 제로샷 일반화에 어떤 영향을 미치는가?
  • RQ3다양한 NLP 과제에서 지시문 튜닝된 모델이 제로샷 및 소샷 설정에서 GPT-3를 어느 정도 능가할 수 있는가?
  • RQ4지시문만이 이득의 원인인가, 아니면 데이터셋 템플릿과 작업 클러스터링이 중요한 역할을 하는가?
  • RQ5지시문 튜닝과 다른 프롬팅 방법들(소샷 프롬프트, 프롬프트 튜닝) 사이의 상호작용은 무엇인가?

주요 결과

  • 지시문 튜닝은 비튜닝 기본 모델에 비해 보지 못한 작업에서 제로샷 성능을 현저히 향상시킨다.
  • FLAN은 평가된 25개 데이터셋 중 20개에서 제로샷 GPT-3를 능가하고, 여러 작업에서 GPT-3 소샷 성능을 능가할 수 있다.
  • 지시문 튜닝의 이점은 더 많은 작업 클러스터와 더 큰 모델 규모에서 커지며, 더 작은 모델일수록 이점이 감소한다.
  • 지시문 튜닝이 모든 작업에서 균일하게 개선되지는 않으며, 지시문으로 서술 가능한 작업(NLI, QA, 번역)에서 가장 큰 이득이 있고, 일부 일반상식/코어퍼런스 작업처럼 언어 모델링으로 간주되는 작업에서는 이득이 작다.
  • 소샷 예시는 FLAN 성능을 더 향상시키고 템플릿 민감도를 줄이며, 특히 출력 공간이 큰 작업에서 그렇다.
  • 지시문 튜닝은 프롬프트 튜닝과의 호환성도 향상시켜 다양한 설정에서 개선을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.