[논문 리뷰] Black-Box Tuning for Language-Model-as-a-Service
블랙박스 튜닝은 랜덤 서브스페이스에서 도함수 미사용 최적화를 사용하여 LMaaS용 연속 프롬프트를 최적화하고, PTMs를 서비스로 유지하면서 기울기 기반 방법과 비교해 경쟁력 있거나 더 우수한 성과를 달성한다.
Extremely large pre-trained language models (PTMs) such as GPT-3 are usually released as a service. It allows users to design task-specific prompts to query the PTMs through some black-box APIs. In such a scenario, which we call Language-Model-as-a-Service (LMaaS), the gradients of PTMs are usually unavailable. Can we optimize the task prompts by only accessing the model inference APIs? This paper proposes the black-box tuning framework to optimize the continuous prompt prepended to the input text via derivative-free optimization. Instead of optimizing in the original high-dimensional prompt space, which is intractable for traditional derivative-free optimization, we perform optimization in a randomly generated subspace due to the low intrinsic dimensionality of large PTMs. The experimental results show that the black-box tuning with RoBERTa on a few labeled samples not only significantly outperforms manual prompt and GPT-3's in-context learning, but also surpasses the gradient-based counterparts, i.e., prompt tuning and full model tuning.
연구 동기 및 목표
- 그라디언트가 이용 불가능하고 프롬프트를 API 접속만으로 최적화해야 하는 LMaaS 시나리오를 제시한다.
- 무작위로 임베딩된 서브스페이스에서 도함수 미사용 최적화를 통해 연속 프롬프트를 최적화하기 위한 블랙박스 튜닝(BBT)을 제안한다.
- 소수샷 설정에서 수동 프롬프트, 인-컨텍스트 학습, 그리고 기울기 기반의 프롬프트/전체 모델 튜닝을 능가할 수 있음을 보인다.
- BBT가 기울기 기반 및 특징 기반 베이스라인에 비해 LMaaS에 대한 배포 및 효율성 이점을 보여준다.
제안 방법
- 연속 프롬프트 p를 입력에 추가하고 로짓을 출력하는 블랙박스 PTM API f를 가진 분류로 작업을 형식화한다.
- 임의 사영 Az + p0를 통해 저차원 서브스페이스에서 z를 최적화하여 프롬프트 공간 차원을 축소하고, p0는 임의 토큰에서 초기화한다.
- 역전파 대신 도함수 미사용 최적화기인 CMA-ES로 최적화한다.
- 최적화를 이끄는 목적 함수로 교차엔트로피 또는 힌지 손실(또는 음의 정확도)을 사용한다.
- 문장-쌍 작업의 경우 MNLI에서 프롬프트 임베딩 p0를 사전 학습하거나, 다른 작업의 경우 무작위 임베딩으로 초기화한다.
- RoBERTa LARGE를 백본으로 사용하여 여러 데이터세트에서 소수샷 설정으로 평가한다.
실험 결과
연구 질문
- RQ1그라디언트가 없고 PTM 추론 API만 접근 가능한 경우에도 연속 프롬프트를 효과적으로 최적화할 수 있는가?
- RQ2무작위 저차원 서브스페이스에서의 도함수 미사용 최적화가 LMaaS 설정의 표준 작업에서 기울기 기반 프롬프트 튜닝 및 전체 모델 튜닝과 동등하거나 이를 능가하는가?
- RQ3손실 함수(교차 엔트로피, 힌지, 음의 정확도)와 서브스페이스 차원이 블랙박스 프롬프트 튜닝의 성능에 어떻게 영향을 미치는가?
- RQ4블랙박스 튜닝의 배포, 학습 시간, 메모리 및 데이터 전송 영향은 기울기 기반 및 특징 기반 베이스라인과 비교하여 어떤가?
- RQ5LMaaS 프레임워크에서 문장-쌍 작업에 대한 프롬프트 임베딩의 사전 학습이 성능을 어느 정도 개선하는가?
주요 결과
- BBT는 평가된 작업에서 종종 수동 프롬프트 및 인-컨텍스트 학습보다 우수하다.
- BBT는 16-shot 설정에서 일곱 가지 작업의 평균 성능에서 기울기 기반 방법(프롬프트 튜닝, P-Tuning v2) 및 전체 모델 튜닝을 능가한다.
- 교차엔트로피 및 힌지 손실은 소수샷 구간에서 음의 정확도보다 더 나은 가이드를 제공한다.
- 작은 서브스페이스(100에서 1000의 d)와 CMA-ES가 효과적일 수 있으며, 작업 의존적 최적 d가 있다.
- 사전 학습된 프롬프트 임베딩이 LMaaS에서 프롬프트 기반 접근을 사용할 때 NLI 작업 성능을 향상시킬 수 있다.
- BBT는 최적화 비용이 PTM 크기와 독립되고 서버 측 호스팅이 가능한 배포 및 효율성 측면에서 이점을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.