[논문 리뷰] Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 파라미터 미세조정 없이도 인간의 선호도와 일치시키는 데 목적이 있는 블랙박스 프롬프트 최적화(Black-Box Prompt Optimization, BPO)를 제안한다. 피드백 데이터와 시퀀스 투 시퀀스 모델을 사용하여 사용자 프롬프트를 자동으로 재작성함으로써, 응답 품질과 일치도를 향상시키며, GPT-3.5-turbo에서 최대 22%의 승리율 향상과 GPT-4에서 10%의 향상을 기록하여 PPO 및 DPO를 능가한다. 이 방법은 모델에 종속되지 않으며 해석 가능성도 유지한다.
Large language models (LLMs) have shown impressive success in various applications. However, these models are often not well aligned with human intents, which calls for additional treatments on them; that is, the alignment problem. To make LLMs better follow user instructions, existing alignment methods primarily focus on further training them. However, the extra training of LLMs is usually expensive in terms of GPU computing; even worse, some LLMs are not accessible for user-demanded training, such as GPTs. In this work, we take a different perspective -- Black-Box Prompt Optimization (BPO) -- to perform alignments. The idea is to optimize user prompts to suit LLMs' input understanding, so as to best realize users' intents without updating LLMs' parameters. BPO leverages human preferences to optimize prompts, thus making it superior to LLM (e.g., ChatGPT) as a prompt engineer. Moreover, BPO is model-agnostic, and the empirical results demonstrate that the BPO-aligned ChatGPT yields a 22% increase in the win rate against its original version and 10% for GPT-4. Notably, the BPO-aligned LLMs can outperform the same models aligned by PPO and DPO, and it also brings additional performance gains when combining BPO with PPO or DPO. Code and datasets are released at https://github.com/thu-coai/BPO.
연구 동기 및 목표
- 파라미터 미세조정이나 모델 가중치 접근 없이도 LLM을 인간의 의도에 맞추는 데 도전하는 데 목적이 있다.
- 모델에 종속되지 않고 효율적이며 해석 가능한 방법을 개발하여, 프롬프트 최적화를 통해 LLM의 일치도를 향상시키는 데 목적이 있다.
- GPT-4나 Claude-2와 같은 폐쇄소스 LLM을 프롬프트 재작성으로써 일치도를 달성함으로써, 훈련 기반 방법의 한계를 극복하는 데 목적이 있다.
- 강화학습 기반 일치 기법인 PPO 및 DPO와 비교해도 프롬프트 최적화가 성능을 뛰어넘거나 보완할 수 있음을 입증하는 데 목적이 있다.
- 다양한 LLM에 적용 가능한 확장 가능하고 해석 가능한 파라미터 기반 일치 기법의 대안을 제공함으로써, API 기반 및 오픈소스 모델을 포함한 다양한 LLM에서 기능하도록 하는 데 목적이 있다.
제안 방법
- BPO는 공개된 선호도 데이터셋에서 유래한 14,000개의 지시-최적화 쌍을 사용하여 프롬프트 최적화 모델을 구축한다.
- LLM을 활용해 응답 쌍(선호도가 높은 것과 낮은 것)을 분석하고 핵심 차이점을 파악하며, 인간이 선호하는 응답을 유도하는 데 도움이 되는 특징을 포함한 개선된 프롬프트를 생성한다.
- 이 방법은 LLM을 블랙박스로 간주하며, 모델 파라미터를 수정하는 대신 입력 프롬프트만 최적화하는 데 집중한다.
- 원래 사용자 프롬프트를 더 인간 선호도에 부합하는 응답을 이끌어내는 최적화된 버전으로 매핑하는 시퀀스 투 시퀀스 모델을 훈련시킨다.
- 최적화 전략으로는 설명 생성, 프롬프트 확장, 힌트 제공, 안전성 향상 등이 있으며, 이는 피드백 분석에서 유도된다.
- 비교 평가를 위해 Vicuna Eval, Self-Instruct Eval, Dolly Eval 등의 쌍대 인간 선호 평가 벤치마크를 사용하여 평가한다.

실험 결과
연구 질문
- RQ1파라미터 미세조정이나 업데이트 없이도 프롬프트 최적화만으로 LLM의 일치도를 크게 향상시킬 수 있는가?
- RQ2GPT-4나 Claude-2와 같은 폐쇄소스 모델에서 BPO는 PPO 및 DPO와 비교해 성능가능성이 어떻게 되는가?
- RQ3BPO는 오픈소스 및 API 기반 모델을 포함한 다양한 LLM 아키텍처로 얼마나 일반화되는가?
- RQ4응답 품질과 인간 선호도를 지속적으로 향상시키는 데 가장 효과적인 프롬프트 최적화 전략은 무엇인가?
- RQ5BPO는 기존의 일치 기법과 조합하여 모델 일치도 향상에 추가로 기여할 수 있는가?
주요 결과
- BPO는 GPT-3.5-turbo에서 22%의 승리율 향상과 GPT-4에서 10%의 승리율 향상을 기록하며, PPO 및 DPO를 모두 능가한다.
- BPO로 최적화된 모델는 이미 미세조정된 PPO 및 DPO 기반 모델의 성능을 뛰어넘는다.
- BPO는 PPO나 DPO와 조합될 경우 상호 보완적인 개선 효과를 보이며, 일치도 성능을 더욱 향상시킨다.
- 이 방법은 모델 접근이나 훈련 없이도 오픈소스 모델(Vicuna, Llama-2 등)과 폐쇄소스 모델(GPT-4, Claude-2 등) 모두에서 일치도를 성공적으로 향상시킨다.
- 설명 생성, 확장, 힌트 제공, 안전성 향상 등으로 식별된 프롬프트 최적화 전략은 응답 품질과 제어 가능성에 크게 기여한다.
- 오류 분석 결과, 훈련 데이터의 불균형으로 인해 장문의 컨텍스트나 수학 관련 프롬프트 처리에 한계가 있음을 확인하였으며, 더 다양한 데이터셋을 활용할 경우 향상 가능성이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.