[논문 리뷰] RLPrompt: Optimizing Discrete Text Prompts with Reinforcement Learning
RLPrompt는 고凍결된 대규모 언어 모델을 위한 이산 텍스트 프롬프트를 강화학습 기반으로 최적화하는 방법을 제안한다. 이는 기울기 없고, 이식 가능하며, 해석 가능한 프롬프트 튜닝을 가능하게 한다. 이 방법은 종종 문법적으로 어색하거나 의미 없는 난문처럼 보이는 효과적인 프롬프트를 생성하는 정책 네트워크를 훈련시켜, 소수의 예제나 전혀 자료가 없는 설정에서 기존의 프롬프트 기반 및 미세조정 방법보다 뛰어난 성능을 낸다.
Prompting has shown impressive success in enabling large pretrained language models (LMs) to perform diverse NLP tasks, especially when only few downstream data are available. Automatically finding the optimal prompt for each task, however, is challenging. Most existing work resorts to tuning soft prompt (e.g., embeddings) which falls short of interpretability, reusability across LMs, and applicability when gradients are not accessible. Discrete prompt, on the other hand, is difficult to optimize, and is often created by "enumeration (e.g., paraphrasing)-then-selection" heuristics that do not explore the prompt space systematically. This paper proposes RLPrompt, an efficient discrete prompt optimization approach with reinforcement learning (RL). RLPrompt formulates a parameter-efficient policy network that generates the desired discrete prompt after training with reward. To overcome the complexity and stochasticity of reward signals by the large LM environment, we incorporate effective reward stabilization that substantially enhances the training efficiency. RLPrompt is flexibly applicable to different types of LMs, such as masked (e.g., BERT) and left-to-right models (e.g., GPTs), for both classification and generation tasks. Experiments on few-shot classification and unsupervised text style transfer show superior performance over a wide range of existing finetuning or prompting methods. Interestingly, the resulting optimized prompts are often ungrammatical gibberish text; and surprisingly, those gibberish prompts are transferrable between different LMs to retain significant performance, indicating LM prompting may not follow human language patterns.
연구 동기 및 목표
- 대규모 언어 모델의 기울기를 활용하지 않고도 이산 텍스트 프롬프트를 효율적으로 최적화하는 데 도전한다.
- 다양한 언어 모델 간에 해석 가능하고 재사용 가능하며 이식 가능한 프롬프트를 생성하는 방법을 개발한다.
- 보상 기반 강화학습을 통해 레이블이 없는 데이터(제로샷)나 소수의 예제(소수샷)가 있는 상황에서도 효과적인 프롬프트 최적화를 가능하게 한다.
- 소프트 프롬프트 튜닝, 수동 프롬프트 작성, 히우리스틱적 순열 탐색의 한계를 극복하기 위해 학습 가능한 정책 기반의 이산 프롬프트 생성기를 도입한다.
- 언어적으로 타당하지 않은 '난문' 형태의 프롬프트가 다양한 모델 간에 높은 성능과 이식성을 달성할 수 있음을 입증한다.
제안 방법
- RLPrompt는 정책 네트워크가 이산 프롬프트 토큰을 생성하는 방식으로 이산 프롬프트 최적화 문제를 강화학습 문제로 재정의한다.
- 정책 네트워크는 하류 작업에서 언어 모델의 출력에서 유도된 보상 신호를 사용하여 상용 강화학습 알고리즘을 통해 훈련된다.
- 블랙박스 언어 모델 환경에서 유도되는 복잡하고 확률적인 보상 신호를 다루기 위해 보상 안정화 메커니즘을 도입한다.
- 작은, 파rameter 효율적인 정책 네트워크(예: MLP)를 distilGPT-2와 같은 고정된 컴act 언어 모델에 통합한다.
- 이 방법은 분류 및 생성 작업에 대해 마스크된 언어 모델(BERT 등)과 자동회귀 언어 모델(GPT 등)을 모두 지원한다.
- 레이블이 없는 경우 약한 신호 기반 보상 함수를 정의함으로써 제로샷 프롬프팅을 가능하게 한다.
실험 결과
연구 질문
- RQ1언어 모델의 기울기가 필요 없이 강화학습이 이산 텍스트 프롬프트를 효과적으로 최적화할 수 있는가?
- RQ2기울기가 없고 의미가 없어 보이는 프롬프트가 다양한 언어 모델 간에 일반화될 수 있는가?
- RQ3강화학습 기반의 이산 프롬프트 최적화가 소수샷 및 제로샷 학습 설정에서 기존 방법보다 뛰어난 성능을 낼 수 있는가?
- RQ4보상 안정화가 강화학습 기반 프롬프트 최적화에서 훈련 효율성과 수렴성에 미치는 영향은 무엇인가?
- RQ5언어적으로 일관되지 않은 프롬프트가 하류 작업에서 왜 높은 성능을 달성할 수 있는가?
주요 결과
- RLPrompt는 소수샷 텍스트 분류 작업에서 최고의 성능을 기록하여 수동 프롬프트, 소프트 프롬프트 튜닝, AutoPrompt를 모두 능가한다.
- 비지도 텍스트 스타일 전이 작업에서 RLPrompt는 수동으로 작성된 프롬프트와 어휘 제약이 있는 프롬프트를 포함한 모든 베이스라인을 뛰어넘으며, 셰익스피어 스타일 전이에서 28.3%의 GM 점수를 기록한다.
- 최적화된 프롬프트는 종종 문법적으로 어색하고 의미 없는 난문(예: 'Fixed ( $-$ contrasts ( $-$ contrasts Dutch English excellent Correct )')이지만, 높은 효과성을 유지한다.
- 이러한 비논리적인 프롬프트는 강력한 이식성을 보이며, GPT-2나 BERT와 같은 다른 언어 모델에 적용해도 높은 성능을 유지한다.
- 레이블이 없는 데이터가 있는 상황에서 약한 지도 신호와 보상 형태 조정을 활용함으로써 제로샷 설정에서도 높은 성능을 달성한다.
- 보상 안정화 기법은 훈련 효율성과 수렴성을 크게 향상시켜, 복잡하고 고차원적인 프롬프트 공간에서 안정적인 강화학습 훈련을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.