Skip to main content
QUICK REVIEW

[논문 리뷰] TEMPERA: Test-Time Prompting via Reinforcement Learning

Tianjun Zhang, Xuezhi Wang|arXiv (Cornell University)|2022. 11. 21.
Topic Modeling인용 수 8
한 줄 요약

TEMPERA는 대규모 언어 모델에서 테스트 시간 프롬프트 편집을 위한 강화학습 기반 방법을 제안하며, 지시문, 흐름 예시, 언어자극자 등을 민첩하게 수정함으로써 동적이고 질의 기반의 프롬프트 최적화를 가능하게 한다. 이는 다양한 NLP 작업에서 최신 기술 성능을 달성하며, 표준 미세조정 대비 4배 높은 샘플 효율성을 보이며, 프롬프트 튜닝 및 이산 프롬프트 최적화 방법보다도 뚜렷한 향상을 이룬다.

ABSTRACT

Careful prompt design is critical to the use of large language models in zero-shot or few-shot learning. As a consequence, there is a growing interest in automated methods to design optimal prompts. In this work, we propose Test-time Prompt Editing using Reinforcement learning (TEMPERA). In contrast to prior prompt generation methods, TEMPERA can efficiently leverage prior knowledge, is adaptive to different queries and provides an interpretable prompt for every query. To achieve this, we design a novel action space that allows flexible editing of the initial prompts covering a wide set of commonly-used components like instructions, few-shot exemplars, and verbalizers. The proposed method achieves significant gains compared with recent SoTA approaches like prompt tuning, AutoPrompt, and RLPrompt, across a variety of tasks including sentiment analysis, topic classification, natural language inference, and reading comprehension. Our method achieves 5.33x on average improvement in sample efficiency when compared to the traditional fine-tuning methods.

연구 동기 및 목표

  • 대규모 언어 모델의 프롬프트 설계 민감성 문제를 해결하기 위해 테스트 시간에 동적이고 질의에 따라 달라지는 프롬프트 최적화를 가능하게 한다.
  • 기존의 미세조정을 대체하거나 보완함으로써 소수의 예시 학습에서 샘플 효율성을 향상시키기 위해 적응형 프롬프트 편집을 도입한다.
  • 구조화된 편집 액션 공간을 통해 해석 가능성, 유연성, 구현 가능성의 균형을 이루는 프롬프트 최적화를 실현한다.
  • 수동으로 설계된 초기 프롬프트에서 시작해 학습 가능한 편집 과정을 통해 인간의 사전 지식을 프롬프트 최적화에 통합한다.
  • 최소한의 초모수 조정으로 다양한 NLP 벤치마크, 특히 GLUE 및 SuperGLUE에서 최신 기술 성능을 달성한다.

제안 방법

  • 에이전트가 사전 정의된 액션 공간을 사용해 초기 프롬프트를 편집함으로써 이산 프롬프트 최적화를 강화학습 문제로 재구성한다.
  • 교체, 삽입, 삭제와 같은 자연어 연산을 사용해 지시문, 맥락 기반 예시, 언어자극자를 편집할 수 있는 새로운 액션 공간을 설계한다.
  • 편집 이전과 이후의 프롬프트 간 점수 차이를 주 보상 신호로 사용하며, 학습 안정화를 위해 보상 정규화를 적용한다.
  • 후보 편집 및 설계 선택에 대해 주의 메커니즘을 적용하는 정책 네트워크를 사용해 탐색 및 정책 학습을 향상시킨다.
  • 수동으로 제작된 프롬프트로 초기화하고, 질의에 따라 RL이 이를 개선하도록 하여 인간의 사전 지식을 통합한다.
  • 수렴성과 성능 향상을 위해 학습 중에 커리큘럼 학습과 온도 스케일링을 적용한다.

실험 결과

연구 질문

  • RQ1강화학습 기반 테스트 시간 프롬프트 편집이 다양한 NLP 작업에서 대규모 언어 모델의 제로샷 및 소수의 예시 학습 성능을 뚜렷이 향상시킬 수 있는가?
  • RQ2표준 미세조정 및 기타 프롬프트 튜닝 기법 대비 제안된 방법의 샘플 효율성은 어떠한가?
  • RQ3편집 액션 공간의 민첩성이 고정 또는 블랙박스 기반 프롬프트 생성 대비 성능 향상에 얼마나 기여하는가?
  • RQ4소수의 예시 수와 프롬프트 풀 크기의 변동에 대해 이 방법은 얼마나 강건한가?
  • RQ5의미적으로 일관된 편집을 통해 가시성 있는 프롬프트를 유지하면서도 높은 성능을 유지를 할 수 있는가?

주요 결과

  • TEMPERA는 다양한 벤치마크에서 최신 기술 성능을 달성하였으며, 소수의 예시 학습 대비 SST-2에서 1.8%p의 절대적 향상과 CR에서 3.9%p의 향상을 기록했다.
  • 표준 미세조정 대비 평균 5.33배 높은 샘플 효율성을 확보하였으며, 성능을 동일하게 유지하기 위해 필요한 예시 수가 4배 줄어들었다.
  • 맥락 기반 예시 수가 늘어날수록 성능이 일관되게 향상되었으며(최대 4개 예시까지), AG News에서는 입력 길이 제한으로 8개 예시에서 성능 저하가 발생했다.
  • 프롬프트 풀 크기에 대해 강건하며, 풀 크기가 8에서 32로 증가함에 따라 성능이 약간 향상되었고, AG News에서 최대 0.6%p 향상되었다.
  • 언어자극자 편집이 성능 향상에 기여하며, AG News에서 1.2%p의 향상 효과를 보여, 작업 기반 프롬프트 설계에서의 중요성을 입증했다.
  • 제거 실험 결과, 언어자극자, 지시문, 예시 등 각 편집 구성 요소가 측정 가능한 기여를 하며, 하나라도 제거하면 최종 성능이 떨어짐을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.