Skip to main content
QUICK REVIEW

[논문 리뷰] ATTEMPT: Parameter-Efficient Multi-task Tuning via Attentional Mixtures of Soft Prompts

Akari Asai, Mohammadreza Salehi|arXiv (Cornell University)|2022. 05. 24.
Domain Adaptation and Few-Shot Learning인용 수 16
한 줄 요약

ATTEMPT는 언어 모델을 동결한 채로 고자원 소스 태스크의 소프트 프롬프트를 주의 메커니즘을 통해 동적으로 조합하고 새로운 타겟 태스크 프롬프트와 결합하는 파rameter 효율적인 다중태스크 튜닝 방법을 제안한다. 전체 미세조정 대비 0.4%의 파라미터만 업데이트하면서도 21개의 NLP 데이터셋에서 최신 기준 성능을 달성하며, 프롬프트 튜닝을 뛰어넘고 전체 미세조정 모델과 맞먹는 성능을 내며 매우 효율적이고 모odu lar한 성능을 발휘한다.

ABSTRACT

This work introduces a new multi-task, parameter-efficient language model (LM) tuning method that learns to transfer knowledge across different tasks via a mixture of soft prompts-small prefix embedding vectors pre-trained for different tasks. Our method, called ATTEMPT (ATTEntional Mixtures of Prompt Tuning), obtains source prompts as encodings of large-scale source tasks into a small number of parameters and trains an attention module to interpolate the source prompts and a newly initialized target prompt for every instance in the target task. During training, only the target task prompt and the attention weights, which are shared between tasks in multi-task training, are updated, while the original LM and source prompts are intact. ATTEMPT is highly parameter-efficient (e.g., updates 2,300 times fewer parameters than full fine-tuning) while achieving high task performance using knowledge from high-resource tasks. Moreover, it is modular using pre-trained soft prompts, and can flexibly add or remove source prompts for effective knowledge transfer. Our experimental results across 21 diverse NLP datasets show that ATTEMPT significantly outperforms prompt tuning and outperforms or matches fully fine-tuned or other parameter-efficient tuning approaches that use over ten times more parameters. Finally, ATTEMPT outperforms previous work in few-shot learning settings.

연구 동기 및 목표

  • 기존 파rameter 효율적인 튜닝 방법이 타겟 태스크 데이터에만 의존함으로써 발생하는 비효율성과 제한된 지식 전이 문제를 해결하기 위해.
  • 언어 모델을 미세조정하지 않고도 고자원 소스 태스크에서 저자원 타겟 태스크로 효과적인 지식 전이를 가능하게 하기 위해.
  • 사전 학습된 소프트 프롬프트를 활용한 다중태스크 학습을 위한 모듈식, 해석 가능하고 재사용 가능한 프레임워크를 개발하기 위해.
  • 다양한 NLP 태스크, 특히 소수의 샘플(파라미터)에서의 성능 유지를 또는 향상시키면서 파라미터 업데이트를 최소화하기 위해.
  • 태스크 유사성에 대한 사전 계산된 사전 확률이 필요 없이, 관련된 소스 태스크를 식별하는 주의 가중치를 학습함으로써 이를 제거하기 위해.

제안 방법

  • 대규모 소스 태스크에서 소프트 프롬프트를 사전 학습하여 재사용 가능하고 이식 가능한 프롬프트 임베딩를 생성한다.
  • 타겟 태스크 전용으로 새로운 소프트 프롬프트를 초기화하고, 이를 주의 메커니즘과 함께 학습한다.
  • 각 입력 토큰에 대해 소스 프롬프트와 타겟 프롬프트의 인стан스별 가중 조합을 계산하기 위해 경량의 공유 주의 네트워크를 사용한다.
  • 학습 중에는 언어 모델과 소스 프롬프트를 동결하고, 타겟 프롬프트와 공유 주의 가중치만 업데이트한다.
  • 주의 가중치가 부여된 프롬프트 혼합을 입력 시퀀스의 접두어로 적용하고, 이를 동결된 언어 모델이 처리한다.
  • 단일 동결된 모델에서 사전 로드된 여러 소프트 프롬프트를 활용한 추론을 가능하게 하여 재학습 없이도 다중태스크 추론을 지원한다.

실험 결과

연구 질문

  • RQ1언어 모델을 미세조정하지 않고도 다수의 고자원 소스 태스크에서 저자원 타겟 태스크로 지식을 효과적으로 전이할 수 있는 파rameter 효율적인 방법이 존재하는가?
  • RQ2주의 기반의 소프트 프롬프트 혼합 방식은 표준 프롬프트 튜닝 및 전체 미세조정 대비 성능과 파라미터 효율성 측면에서 어떻게 비교되는가?
  • RQ3사전 계산된 사전 확률이 없이도 주의 메커니즘이 의미 있는 태스크 유사성을 학습하고 관련된 소스 태스크에 집중할 수 있는가?
  • RQ4모듈식 프롬프트 조합이 다중태스크 학습에서 성능 향상과 유연성 향상에 얼마나 기여하는가?
  • RQ5이 방법은 소수의 샘플(파라미터) 설정 및 저자원 환경에서 얼마나 효과적인가?

주요 결과

  • ATTEMPT는 21개의 다양한 NLP 데이터셋에서 프롬프트 튜닝을 뛰어넘으며, 전체 미세조정 대비 0.4%의 파라미터만 업데이트함으로써 최신 기준 성능을 달성한다.
  • 이 방법은 전체 미세조정 모델 및 파라미터를 10배 이상 더 업데이트하는 다른 파라미터 효율적 방법보다 성능이 유사하거나 뛰어나다.
  • 소수의 샘플(4~32샷) 설정에서 ATTEMPT는 일관되게 베이스라인보다 뛰어나며, 강력한 일반화 능력을 보여준다.
  • 절단 실험 결과, 학습된 주의 가중치, 다중태스크 학습, 다수의 소스 태스크로부터의 모듈식 전이가 성능 향상의 핵심 요소임을 확인하였다.
  • 주의 분포는 의미 있는 태스크 유사성(예: 추론과 동의어 탐지 사이의 유사성)을 드러내어 효과적인 지식 전이를 확인한다.
  • 이 방법은 특히 백본 모델이 커질수록 매우 파라미터 효율적이며, 다른 파라미터 효율적 방법은 학습 가능한 파라미터 수가 급격히 증가하는 경향을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.