Skip to main content
QUICK REVIEW

[논문 리뷰] PERFECT: Prompt-free and Efficient Few-shot Learning with Language Models

Rabeeh Karimi Mahabadi, Luke Zettlemoyer|arXiv (Cornell University)|2022. 04. 03.
Topic Modeling인용 수 8
한 줄 요약

이 논문은 사전에 정의된 프롬프트와 어휘자료를 필요로 하지 않으며, 사전에 학습된 언어 모델(PLMs)을 위한 프롬프트 없는 효율적인 few-shot 학습 방법인 Perfect을 제안한다. 작업별 어댑터와 학습 가능한 다중 토큰 레이블 임베딩을 사용함으로써, 32개의 예시만으로도 12개의 NLP 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 이전 방법에 비해 학습 시간을 최대 100배 단축하고 저장 비용을 100배 감소시킨다.

ABSTRACT

Current methods for few-shot fine-tuning of pretrained masked language models (PLMs) require carefully engineered prompts and verbalizers for each new task to convert examples into a cloze-format that the PLM can score. In this work, we propose PERFECT, a simple and efficient method for few-shot fine-tuning of PLMs without relying on any such handcrafting, which is highly effective given as few as 32 data points. PERFECT makes two key design choices: First, we show that manually engineered task prompts can be replaced with task-specific adapters that enable sample-efficient fine-tuning and reduce memory and storage costs by roughly factors of 5 and 100, respectively. Second, instead of using handcrafted verbalizers, we learn new multi-token label embeddings during fine-tuning, which are not tied to the model vocabulary and which allow us to avoid complex auto-regressive decoding. These embeddings are not only learnable from limited data but also enable nearly 100x faster training and inference. Experiments on a wide range of few-shot NLP tasks demonstrate that PERFECT, while being simple and efficient, also outperforms existing state-of-the-art few-shot learning methods. Our code is publicly available at https://github.com/facebookresearch/perfect.git.

연구 동기 및 목표

  • 사전에 수작업으로 정의된 프롬프트와 어휘자료 엔지니어링이 필요한 사전에 학습된 언어 모델의 few-shot 미세조정에서 이를 제거하는 것.
  • 최소 32개의 예시로도 샘플 효율성과 학습 안정성을 향상시키기 위한 저자원 환경에서의 개선.
  • 프롬프트 기반 미세조정 방법에 비해 메모리, 저장 비용, 추론 비용을 줄이는 것.
  • 기존의 프롬프트 기반 및 어댑터 기반 few-shot 학습 접근법보다 뛰어난 성능을 내는 단순하고 일반화 가능한 프레임워크 개발.
  • 특수 작업용 프롬프트나 어휘화 없이도 효과적인 few-shot 학습을 달성할 수 있음을 입증하는 것.

제안 방법

  • Transformer 아키텍처에 삽입된 작업별 어댑터 레이어로 수작업으로 정의된 프롬프트를 대체하여, 주요 PLM 가중치는 동결하고 오직 어댑터만 미세조정한다.
  • 모델의 어휘와 독립적인 고정 길이의 다중 토큰 레이블 임베딩을 도입하며, 이는 학습 도중 종단 간(end-to-end)으로 학습된다.
  • 자기회귀적 디코딩이 필요 없이 다중 토큰에 대한 원형 네트워크(prototypical network)를 사용해 로짓을 계산함으로써 빠른 추론을 가능하게 한다.
  • 동적 마스크 토큰 삽입을 통한 마스크된 언어 모델링 목표를 사용하며, 마스크 수는 각 작업에 맞게 최적화되어 성능을 극대화한다.
  • 저샷 환경에서 일반화 능력을 향상시키기 위해 레이블 임베딩 간의 대비 학습(contrastive learning) 목표를 적용한다.
  • 소규모 검증 세트(16개 예시)를 사용해 하이퍼파rameter를 튜닝하여 few-shot 학습 설정과 일치시킨다.

실험 결과

연구 질문

  • RQ1사전에 학습된 언어 모델을 위한 few-shot 학습에서 수작업으로 정의된 프롬프트와 어휘자료 없이도 달성할 수 있는가?
  • RQ2작업별 어댑터는 메모리와 저장 비용을 줄이며 샘플 효율적인 미세조정을 가능하게 할 수 있는가?
  • RQ3학습 가능한 다중 토큰 레이블 임베딩은 저샷 환경에서 수작업으로 설계된 어휘자료보다 성능이 뛰어나게 할 수 있는가?
  • RQ4레이블 예측을 위한 자기회귀적 디코딩을 제거하면 성능 손실 없이 상당한 속도 향상을 이룰 수 있는가?
  • RQ5프롬프트 없는 어댑터 기반 방법이 다양한 few-shot NLP 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • Perfect는 12개의 다양한 NLP 벤치마크에서 최신 기술 수준의 성능을 달성하며, 기존의 프롬프트 기반 방법을 모두 앞서며 성능을 뛰어넘는다.
  • SST-2 데이터셋에서 Perfect는 32개의 예시로 90.7%의 테스트 정확도를 달성하며, 어댑터 없이 기준선보다 2.5%포인트 높은 성능을 보였다.
  • Perfect를 사용한 학습은 자기회귀적 디코딩이 필요한 방법 대비 최대 100배 빠르며, 저장 비용은 100배 감소했다.
  • 다양한 few-shot 학습 세트 간 성능의 변동성을 줄이고 악성 케이스 정확도를 향상시켜 더 높은 안정성을 보였다.
  • 어댑터의 사용으로 학습 가능한 파라미터 수가 크게 감소하여, 저자원 환경에서 샘플 효율성 향상과 더 나은 수렴 성능을 달성했다.
  • 최적의 마스크 토큰 수는 작업에 따라 달라지며, 대부분의 작업에서 두 개의 마스크가 가장 우수한 성능을 보였지만, 일부 작업(예: MRPC)은 더 많은 마스크를 필요로 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.