[논문 리뷰] Large Language Models as Optimizers
이 논문은 PROMPTing으로 최적화(OPRO)를 도입하고, LLM을 최적화기로 활용해 프롬프트 주도 루프에서 새로운 해를 생성하고 평가하며, LLM을 이용한 프롬프트 최적화를 GSM8K와 BBH에서 입증하고, LLM이 최적화한 프롬프트가 일부 작업에서 인간이 설계한 프롬프트를 능가할 수 있음을 보인다.
Optimization is ubiquitous. While derivative-based algorithms have been powerful tools for various problems, the absence of gradient imposes challenges on many real-world applications. In this work, we propose Optimization by PROmpting (OPRO), a simple and effective approach to leverage large language models (LLMs) as optimizers, where the optimization task is described in natural language. In each optimization step, the LLM generates new solutions from the prompt that contains previously generated solutions with their values, then the new solutions are evaluated and added to the prompt for the next optimization step. We first showcase OPRO on linear regression and traveling salesman problems, then move on to our main application in prompt optimization, where the goal is to find instructions that maximize the task accuracy. With a variety of LLMs, we demonstrate that the best prompts optimized by OPRO outperform human-designed prompts by up to 8% on GSM8K, and by up to 50% on Big-Bench Hard tasks. Code at https://github.com/google-deepmind/opro.
연구 동기 및 목표
- 과거 솔루션과 그 점수에 기반한 반복 생성을 통해 LLM이 최적화기로 작용하는 방법을 설명한다.
- 연속형(선형 회귀) 및 이산형(TSP) 최적화에 대한 사례 연구를 제시하여 능력과 한계를 설명한다.
- LLM이 프롬프트를 최적화해 NLP 벤치마크에서 작업 정확도를 최대화하는 프롬프트 최적화를 시연한다.
- 일반성과 전이성을 평가하기 위해 GSM8K와 BBH 전반에 걸쳐 여러 LLM을 최적화자와 점수자로 평가한다.
제안 방법
- 메타 프롬프트가 주어지면 LLM이 과거 솔루션-점수 기록에 기반해 새로운 후보 해를 생성하는 Optimization by PROMPTing(OPRO)을 정의한다.
- 각 단계에서 새로운 해를 평가하고 그 점수를 메타 프롬프트 내의 최적화 궤적에 추가한다.
- 탐색-활용 균형을 포함시키기 위해 샘플링 온도를 조정하고 단계당 다수의 후보 해를 생성한다.
- optimizer를 안내하기 위해 최적화 문제 설명, 최적화 궤적, 본보기 문제를 포함하는 메타 프롬프트를 사용한다.
- 블랙박스 최적화 능력을 시연하기 위해 수학 과제(선형 회귀와 TSP)에 OPRO를 적용한다.
- 생성된 프롬프트를 평가하는 점수자 LLM과 새로운 프롬프트를 생성하는 최적화자 LLM을 사용하고, 소규모 학습subset가 목표를 안내하도록 하여 프롬프트 최적화를 프롬프트 최적화를 적용한다.
- GSM8K와 BBH 전반에 걸쳐 여러 LLM을 최적화자(text-bison, PaLM 2-L, PaLM 2-L-IT, gpt-3.5-turbo, gpt-4)와 점수자로 비교한다.

실험 결과
연구 질문
- RQ1순수 프롬프트 기반 상호작용만으로 연속적 및 이산적 문제에 대해 LLM이 효과적인 최적화자로 작용할 수 있는가?
- RQ2GSM8K 및 BBH와 같은 NLP 벤치마크에서 작업 정확도를 최대화하도록 프롬프트를 얼마나 잘 최적화하는가?
- RQ3특히 대규모 문제에서 LLM을 최적화자로 사용할 때의 한계와 안정성 고려 사항은 무엇인가?
- RQ4서로 다른 최적화자와 점수자 LLM 조합이 프롬프트 최적화 성능과 전이성에 어떤 영향을 미치는가?
- RQ5최적화된 프롬프트가 관련 벤치마크 간에 얼마나 전이되는가(예: GSM8K에서 MultiArith 및 AQuA로)?
주요 결과
- OPRO는 LLM이 새로운 해를 생성하고 과제 전반에 걸쳐 최적화 궤적을 개선하도록 한다.
- LLM이 최적화한 최적 프롬프트가 GSM8K에서 최대 8%, Big-Bench Hard 과제에서 최대 50%까지 제로샷 인간 설계 프롬프트를 능가할 수 있다.
- GPT-4, text-bison, PaLM 2-L-IT, PaLM 2-L은 다양한 스타일과 강점을 보이며, 일부는 더 빠른 수렴과 더 좋은 최적해를 달성한다.
- TSP에서 GPT-4는 작은 문제에서 다른 LLM보다 현저히 우수하지만, 더 큰 n에서는 성능이 저하되어 전통적 휴리스틱이 최적성 차이에서 LLM보다 나은 경우가 있다.
- 프롬프트 최적화는 최적화를 안내하기에 충분한 소규모 학습subset이 있으며 최적화된 프롬프트가 관련 수학 데이터셋으로 전이됨을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.