Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Universal Intrinsic Task Subspace via Prompt Tuning

Yujia Qin, Xiaozhi Wang|arXiv (Cornell University)|2021. 10. 15.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 소프트 프롬프트를 자동에코드를 통해 분해함으로써 다양한 자연어 처리(NLP) 작업 간에 공유되는 통합적이고 저차원적인 내재된 작업 부분공간을 식별하는 Intrinsic Prompt Tuning(IPT)을 제안한다. 이 250차원 부분공간 내에서 오직 250개의 파라미터만 조정함으로써 IPT는 볼 수 있는 작업에서 전체 프롬프트 튜닝 성능의 97%를 회복하고, 볼 수 없는 작업에서는 83%를 달성하여 강력한 일반화 능력을 보이며 사전 훈련된 언어 모델의 보편성을 설명한다.

ABSTRACT

Why can pre-trained language models (PLMs) learn universal representations and effectively adapt to broad NLP tasks differing a lot superficially? In this work, we empirically find evidence indicating that the adaptations of PLMs to various few-shot tasks can be reparameterized as optimizing only a few free parameters in a unified low-dimensional intrinsic task subspace, which may help us understand why PLMs could easily adapt to various NLP tasks with small-scale data. To find such a subspace and examine its universality, we propose an analysis pipeline called intrinsic prompt tuning (IPT). Specifically, we resort to the recent success of prompt tuning and decompose the soft prompts of multiple NLP tasks into the same low-dimensional nonlinear subspace, then we learn to adapt the PLM to unseen data or tasks by only tuning parameters in this subspace. In the experiments, we study diverse few-shot NLP tasks and surprisingly find that in a 250-dimensional subspace found with 100 tasks, by only tuning 250 free parameters, we can recover 97% and 83% of the full prompt tuning performance for 100 seen tasks (using different training data) and 20 unseen tasks, respectively, showing great generalization ability of the found intrinsic task subspace. Besides being an analysis tool, IPT could further help us improve the prompt tuning stability.

연구 동기 및 목표

  • 사전 훈련된 언어 모델(PLMs)이 다양한 NLP 작업에 적응하는 방식이 공통의 저차원 내재된 작업 부분공간을 통해 이루어지는지 조사하기 위해.
  • 소수의 예제 학습 환경에서 PLMs의 보편성과 데이터 효율성에 대해 설명하기 위해.
  • 최적화를 통합된 저차원 부분공간으로 제한함으로써 파라미터 효율적인 적응을 가능하게 하는 방법을 개발하기 위해.
  • 부분공간 분석을 통해 프롬프트 튜닝의 안정성을 향상시키고 작업 간 차이에 대한 통찰을 제공하기 위해.

제안 방법

  • IPT는 두 단계로 구성된다: 다중 작업 부분공간 탐색(MSF) 및 내재 부분공간 튜닝(IST).
  • MSF 단계에서 100개의 다양한 NLP 작업에서 유도된 소프트 프롬프트들이 자동에코드 아키텍처를 사용해 저차원 비선형 부분공간으로 투영된다.
  • 자동에코드는 원본 프롬프트와 투영된 프롬프트 간의 재구성 오차를 최소화함으로써 내재된 작업 부분공간을 위한 공통 기저를 학습한다.
  • IST 단계에서 PLM은 고정된 부분공간 내의 저차원 파라미터만 조정함으로써 새로운 작업에 적응되며, 전체 파라미터 공간으로의 고정된 역투영이 이루어진다.
  • 이 방법은 전체 미세조정 대비 파라미터 효율적인 대안으로서 프롬프트 튜닝을 활용하며, 확장 가능한 부분공간 학습을 가능하게 한다.
  • 내재된 작업 부분공간은 소수의 다양한 소수 예제 작업을 사용해 발견되며, 균형 잡힌 데이터 스케일과 일반화 능력을 보장한다.

실험 결과

연구 질문

  • RQ1다양한 NLP 작업 간에 사전 훈련된 언어 모델의 적응을 포괄하는 통합적이고 저차원 내재된 작업 부분공간이 존재하는가?
  • RQ2이 내재된 부분공간은 성능 저하가 최소한이 되도록 볼 수 없는 작업으로 일반화될 수 있는가?
  • RQ3부분공간의 차원 수가 소수 예제 학습 환경에서 성능와 데이터 효율성에 어떤 영향을 미치는가?
  • RQ4내재된 부분공간은 프롬프트 튜닝의 안정성을 향상시키고 작업 간 차이에 대한 통찰을 제공할 수 있는가?
  • RQ5학습 작업 수와 데이터 스케일의 변화가 학습된 부분공간의 품질과 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • 100개의 작업에서 학습된 250차원 내재된 작업 부분공간에서 IPT는 다른 학습 데이터를 사용한 100개의 볼 수 있는 작업에서 전체 프롬프트 튜닝 성능의 97%를 회복한다.
  • 20개의 볼 수 없는 작업에 대해서는 IPT가 전체 프롬프트 튜닝 성능의 83%를 달성하여 강력한 제로샷 일반화 능력을 보여준다.
  • 내재된 작업 부분공간은 매우 효과적이며, 다양한 NLP 작업의 적응을 저차원 파라미터 공간으로 압축한다.
  • 이 방법은 프롬프트 튜닝의 안정성을 향상시키며, 제약이 있고 공통된 부분공간에서 최적화함으로써 학습 분산을 줄인다는 점을 시사한다.
  • 부분공간의 품질은 학습 작업 수와 데이터 스케일의 변화에 대해 강건하며, 더 다양한 작업이 포함될수록 성능이 향상된다.
  • 분석 결과, 내재된 부분공간은 작업 간 공통된 표현적 구조를 포착하며, 작업 간 유사성과 차이에 대한 통찰을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.