Skip to main content
QUICK REVIEW

[논문 리뷰] P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks

Xiao Liu, Kaixuan Ji|arXiv (Cornell University)|2021. 10. 14.
Topic Modeling참고 문헌 46인용 수 262
한 줄 요약

P-Tuning v2는 모든 계층에 걸친 심층 프롬프트를 통해 신중하게 최적화된 프롬프트 튜닝이 모델 규모(300M–10B 매개변수) 및 NLU 작업 전반에 대해 파인 튜닝과 비슷한 성능을 내면서도 태스크별 매개변수의 아주 작은 비율만을 사용한다는 것을 보여준다.

ABSTRACT

Prompt tuning, which only tunes continuous prompts with a frozen language model, substantially reduces per-task storage and memory usage at training. However, in the context of NLU, prior work reveals that prompt tuning does not perform well for normal-sized pretrained models. We also find that existing methods of prompt tuning cannot handle hard sequence labeling tasks, indicating a lack of universality. We present a novel empirical finding that properly optimized prompt tuning can be universally effective across a wide range of model scales and NLU tasks. It matches the performance of finetuning while having only 0.1%-3% tuned parameters. Our method P-Tuning v2 is an implementation of Deep Prompt Tuning \cite{li2021prefix,qin2021learning} optimized and adapted for NLU. Given the universality and simplicity of P-Tuning v2, we believe it can serve as an alternative to finetuning and a strong baseline for future research.Our code and data are released at https://github.com/THUDM/P-tuning-v2.

연구 동기 및 목표

  • 적절히 최적화된 프롬프트 튜닝이 넓은 모델 크기와 NLU 작업 범위 전반에서 파인 튜닝과 일치할 수 있음을 입증한다.
  • 입력 계층뿐 아니라 다수의 계층에서 프롬 prompts를 사용하는 깊은 프롬프트 튜닝 접근법을 개발 및 검증한다.
  • 제한된 태스크별 매개변수로도 경쟁력 있는 성능을 가능하게 하는 실용적 최적화 및 구현 세부사항을 식별한다.

제안 방법

  • 다양한 트랜스포머 계층에 학습 가능한 프롬프트를 삽입하여 입력에만 국한되지 않고 깊은 프롬프트 튜닝을 도입한다.
  • 태스크별로 유연한 프롬프트 길이를 사용하는 연속 프롬프트를 적용하되, 일반적으로 간단한 태스크는 더 짧고 어려운 시퀀스 라벨링 태스크는 더 길게(대략 100) 설정한다.
  • 임베딩 대 MLP 재매개변 옵션을 실험하고 태스크 의존적 효과를 분석한다.
  • 감정화(verbalizer) 대신에 감독 학습 설정에서 무작위로 초기화된 선형 분류 헤드를 적용한다.
  • 공유 프롬프트를 다수의 태스크에 대해 공동으로 학습시키고 태스크별 분류기를 사용하는 다태스크 학습을 평가한다.

실험 결과

연구 질문

  • RQ1다수의 계층에 걸친 프롬프트 튜닝이 300M–10B 매개변수의 다양한 모델 규모에서 파인 튜닝과 비슷한 성능을 달성할 수 있는가?
  • RQ2P-Tuning v2가 단순 분류와 어려운 시퀀스 라벨링 NLU 태스크 모두에 보편적으로 효과적인가?
  • RQ3깊이와 프롬프트 길이가 성능에 어떤 영향을 미치며 프롬프트 튜닝과 파인 튜닝 사이의 차이를 좁히기 위해 필요한 최적화 및 구현 세부사항은 무엇인가?
  • RQ4공유 프롬프트를 활용한 다태스크 학습이 태스크 전반에서 P-Tuning v2의 추가 이득을 제공하는가?

주요 결과

  • P-Tuning v2는 300M에서 10B 매개변수까지 모델 규모에 걸쳐 파인 튜닝과 일치한다.
  • P-Tuning v2는 태스크당 0.1%–3%의 태스크별 매개변수만으로도 경쟁력 있는 성능을 달성한다.
  • 다수의 계층에 도입된 심층 프롬프트는 특히 더 작은 모델과 어려운 태스크에서 성능을 향상시킨다.
  • 다태스크 학습은 대부분의 태스크에서 P-Tuning v2의 성능을 일반적으로 향상시키지만, 일부 설정에서 QA는 예외이다.
  • 망각 연구(ablation) 결과, 감독 학습 설정에서 언어화(verbalizer)와 선형 헤드의 차이가 유의미하지 않으며, 더 깊은 프롬프트 깊이가 얕은 프롬프트 삽입보다 도움이 되는 경향이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.