Skip to main content
QUICK REVIEW

[논문 리뷰] InfoPrompt: Information-Theoretic Soft Prompt Tuning for Natural Language Understanding

Junda Wu, Tong Yu|arXiv (Cornell University)|2023. 06. 08.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

InfoPrompt는 소프트 프롬프트 튜닝을 위한 정보이론적 프레임워크를 제안하며, 프롬프트와 모델 파라미터 또는 표현 간의 상호정보량을 최대화함으로써 프롬프트 초기화 및 표현 인식을 향상시킵니다. 이는 두 가지 새로운 상호정보량 기반 손실 함수를 사용하여 달성되며, 이는 기존의 소프트 프롬프트 튜닝 방법보다 적은 샘플 환경에서 더 빠른 수렴과 뛰어난 성능을 보입니다.

ABSTRACT

Soft prompt tuning achieves superior performances across a wide range of few-shot tasks. However, the performances of prompt tuning can be highly sensitive to the initialization of the prompts. We also empirically observe that conventional prompt tuning methods cannot encode and learn sufficient task-relevant information from prompt tokens. In this work, we develop an information-theoretic framework that formulates soft prompt tuning as maximizing mutual information between prompts and other model parameters (or encoded representations). This novel view helps us to develop a more efficient, accurate and robust soft prompt tuning method InfoPrompt. With this framework, we develop two novel mutual information based loss functions, to (i) discover proper prompt initialization for the downstream tasks and learn sufficient task-relevant information from prompt tokens and (ii) encourage the output representation from the pretrained language model to be more aware of the task-relevant information captured in the learnt prompt. Extensive experiments validate that InfoPrompt can significantly accelerate the convergence of the prompt tuning and outperform traditional prompt tuning methods. Finally, we provide a formal theoretical result for showing to show that gradient descent type algorithm can be used to train our mutual information loss.

연구 동기 및 목표

  • 소프트 프롬프트 튜닝의 초기화 민감성과 프롬프트 토큰으로부터 임무 관련 정보를 학습하는 데 한계가 있는 문제를 해결하기 위해.
  • 프롬프트와 모델 구성 요소 간의 상호정보량 최대화로 포지셔닝되는 통합된 정보이론적 프레임워크를 개발하기 위해.
  • 프롬프트 초기화를 이끄는 데 사용되고, 임무 관련 정보에 대한 표현 인식 능력을 향상시키는 두 가지 새로운 손실 함수를 설계하기 위해.
  • 제안된 상호정보량 손실 함수에 대한 경사하강법 최적화의 수렴에 대한 이론적 보장을 제공하기 위해.

제안 방법

  • 프롬프트 토큰과 언어 모델 헤드 간의 상호정보량을 최대화하는 방식으로 소프트 프롬프트 튜닝을 설정하여, 임무 관련 정보 인코딩을 향상시키기 위해.
  • 프롬프트와 언어 헤드 간의 상호정보량을 최대화하는 헤드 손실을 도입하여, 초기 단계에서의 프롬프트 학습을 향상시키기 위해.
  • 입력 컨텍스트 조건 하에 프롬프트와 인코딩된 표현 간의 조건부 상호정보량을 최대화하는 표현 손실을 설계하기 위해.
  • 표준 경사하강법을 사용하여 두 손실을 최적화하며, 헤시안 분석과 리프시츠 유계 조건을 통한 이론적 수렴 보장을 제공하기 위해.
  • 헤시안 근사값을 활용하여 행렬 희소성과 다항로그 시간 복잡도를 이용해 학습을 가속화하는 근사 뉴턴 방법을 적용하기 위해.
  • 표준 분류 설정과의 호환성을 유지하기 위해 전체 목표 함수에 교차 엔트로피 손실을 통합하기 위해.

실험 결과

연구 질문

  • RQ1상호정보량 최대화가 소프트 프롬프트 튜닝의 프롬프트 초기화를 향상시키고, 무작위 초기화에 대한 민감성을 감소시킬 수 있는가?
  • RQ2상호정보량 목표 함수에 따라 최적화된 프롬프트 토큰이 임무 관련 정보를 효과적으로 인코딩할 수 있는가?
  • RQ3프롬프트와 표현 간의 조건부 상호정보량을 최대화하면 최종 성능 향상에 기여하는가?
  • RQ4상호정보량 손실 함수에 대한 경사 기반 최적화가 이론적으로 수렴 보장을 받을 수 있는가?

주요 결과

  • InfoPrompt는 특히 저샘플 설정에서 기존 방법 대비 프롬프트 튜닝의 수렴 속도를 크게 향상시킵니다.
  • 제안된 상호정보량 기반 손실 함수는 수작업 또는 표준 학습 프롬프트보다 프롬프트와 표현 간의 조건부 상호정보량(CMI)을 더 높게 만듭니다.
  • InfoPrompt는 MRPC 및 SST-2에서 기존의 소프트 프롬프트 튜닝 기반 모델들을 능가하며, 정확도와 강인성 모두 향상됩니다.
  • 이론적 분석을 통해 경사하강법이 상호정보량 손실 함수를 학습하는 데 사용될 수 있으며, 유계 헤시안 및 리프시츠 조건 하에서 수렴 보장이 있음을 확인했습니다.
  • 표준 프롬프트 튜닝보다 수렴 속도가 더 빠르며, 일반적으로 더 많은 에포크가 필요한 경우가 많습니다.
  • 실증 결과에 따르면, InfoPrompt의 프롬프트 토큰은 CMI 측정 기준으로 랜덤 또는 WARP-학습 프롬프트보다 더 많은 임무 관련 정보를 인코딩하고 있음을 확인했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.