Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Few-Shot Learning Without Prompts

Lewis Tunstall, Nils Reimers|arXiv (Cornell University)|2022. 09. 22.
Topic Modeling인용 수 98
한 줄 요약

SetFit은 프롬프트 없는 시암니스-스타일 파인튜닝 프레임워크로서 프롬프팅 기반 방법보다 훨씬 작은 모델과 더 빠른 학습/추론으로 강력한 소수 예시(text) 분류를 가능하게 한다.

ABSTRACT

Recent few-shot methods, such as parameter-efficient fine-tuning (PEFT) and pattern exploiting training (PET), have achieved impressive results in label-scarce settings. However, they are difficult to employ since they are subject to high variability from manually crafted prompts, and typically require billion-parameter language models to achieve high accuracy. To address these shortcomings, we propose SetFit (Sentence Transformer Fine-tuning), an efficient and prompt-free framework for few-shot fine-tuning of Sentence Transformers (ST). SetFit works by first fine-tuning a pretrained ST on a small number of text pairs, in a contrastive Siamese manner. The resulting model is then used to generate rich text embeddings, which are used to train a classification head. This simple framework requires no prompts or verbalizers, and achieves high accuracy with orders of magnitude less parameters than existing techniques. Our experiments show that SetFit obtains comparable results with PEFT and PET techniques, while being an order of magnitude faster to train. We also show that SetFit can be applied in multilingual settings by simply switching the ST body. Our code is available at https://github.com/huggingface/setfit and our datasets at https://huggingface.co/setfit .

연구 동기 및 목표

  • 프롬프트 기반 및 대형 모델 소수-shot 방법의 한계(프롬프트 엔지니어링, 높은 계산량, 불안정성)를 다룬다.
  • 프롬프트 없는 두 단계 파인튜닝 프레임워크로 SetFit를 제안하여 소수-shot 설정에서 문장 변환기를 활용한다.
  • 다양한 데이터셋, 언어 및 증류(distillation) 시나리오에서 SetFit의 성능을 입증한다.
  • 정확도 및 효율성 측면에서 SetFit를 최첨단 PET/PEFT 기반 방법 및 프롬프트 기반 접근법과 비교한다.
  • 실용적인 소수-shot 작업에서 채택을 촉진하기 위해 공개 코드와 데이터를 제공한다.

제안 방법

  • 사전학습된 Sentence Transformer(ST)를 소규모 표기 데이터 세트에 대조적 시암성 목적을 사용하여 미세 조정해 풍부한 임베딩을 생성한다.
  • 클래스 간 양의 문장 트리플(R positive, R negative per class)을 통해 대조적 미세 조정을 위한 증강 학습 데이터를 생성한다.
  • 미세 조정된 ST로 라벨이 부여된 예제를 임베딩으로 인코딩한 후, 이 임베딩에 로지스틱 회귀 분류 헤드를 학습한다.
  • 새로운 입력을 ST로 인코딩하고 학습된 헤드를 이용해 추론을 수행한다.
  • ST 미세 조정에 대한 코사인 유사도 손실을 사용하고 학습률 1e-3, 배치 크기 16, 최대 길이 256 토큰으로 1epoch 수행한다.

실험 결과

연구 질문

  • RQ1프롬프트 없는 문장 변환기 기반 접근 방식이 PET/PEFT 및 프롬프트 기반 방법에 비해 소수-shot 학습에서 경쟁력 있는 정확도를 달성할 수 있는가?
  • RQ2SetFit가 다국어 데이터 및 제한된 라벨 데이터를 가진 다양한 텍스트 분류 작업에서 어떤 성능을 보이는가?
  • RQ3대규모 프롬프트 기반 접근법에 비해 SetFit의 학습/추론 측면에서의 효율성 차이는 무엇인가?
  • RQ4리소스 제약 하의 하드웨어 조건에서 SetFit가 소수-shot 증류(distillation)에서 효과적인가?

주요 결과

  • SetFit MPNet은 소수-shot에서 강력한 성능을 달성하며, N=8에서 FineTune보다 평균 19.3포인트 우수하고 N=64에서 격차를 좁힌다.
  • SetFit MPNet은 작은 N에서 Perfect 및 Adapet보다 우수하고, T-Few 3B와도 프롬프트 없는 상태로 경쟁하며 훨씬 더 작다.
  • RAFT에서 SetFit RoBERTa는 GPT-3 및 PET를 능가하고 여러 작업에서 인간 기준선을 넘어서는 성과를 보였으나, T-Few 11B를 넘어서는 것은 아니다.
  • 다국어 MARC 실험에서 8-shot 구간에서 SetFit의 다국어 ST 임베딩이 언어 간에 FineTune 및 Adapet보다 일관되게 우수하다.
  • 증류 실험에서 작은 unlabeled 데이터로도 학생-교사 SetFit 구조가 기초 학생보다 더 나은 또는 동일한 성능을 보이는 경우가 많으며, 특히 매우 작은 N에서 그렇다.
  • SetFit은 T-Few 3B에 비해 학습/추론 속도가 1자릿수 차이로 크게 빠르고 저장 공간도 훨씬 작아 실제 배치에서의 이점이 크다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.