[논문 리뷰] Large Language Models As Evolution Strategies
이 논문은 BBOB 함수와 신경진화 과제에서 랜덤 서치 및 가우시안 하이클라이밍보다 성능이 뛰어나며, 교사 알고리즘 트레이젝터리에 대한 지시 프ine-tuning을 통해 성능이 향상되는, 대규모 언어 모델(LLM)을 재조합 연산자로 사용하는 제로샷 블랙박스 최적화 프레임워크인 EvoLLM를 제안한다. LLM은 이산화된, 적합도 기반으로 정렬된 해 후보를 프롬프팅하여 사용된다.
Large Transformer models are capable of implementing a plethora of so-called in-context learning algorithms. These include gradient descent, classification, sequence completion, transformation, and improvement. In this work, we investigate whether large language models (LLMs), which never explicitly encountered the task of black-box optimization, are in principle capable of implementing evolutionary optimization algorithms. While previous works have solely focused on language-based task specification, we move forward and focus on the zero-shot application of LLMs to black-box optimization. We introduce a novel prompting strategy, consisting of least-to-most sorting of discretized population members and querying the LLM to propose an improvement to the mean statistic, i.e. perform a type of black-box recombination operation. Empirically, we find that our setup allows the user to obtain an LLM-based evolution strategy, which we call `EvoLLM', that robustly outperforms baseline algorithms such as random search and Gaussian Hill Climbing on synthetic BBOB functions as well as small neuroevolution tasks. Hence, LLMs can act as `plug-in' in-context recombination operators. We provide several comparative studies of the LLM's model size, prompt strategy, and context construction. Finally, we show that one can flexibly improve EvoLLM's performance by providing teacher algorithm information via instruction fine-tuning on previously collected teacher optimization trajectories.
연구 동기 및 목표
- LLM이 최적화 과제에 대한 명시적 훈련 없이 제로샷 블랙박스 최적화를 수행할 수 있는지 조사하는 것.
- LLM이 텍스트 기반 문맥만을 사용하여 진화 전략에서 재조합 연산자로 기능할 수 있도록 하는 프롬프팅 전략을 설계하는 것.
- 다양한 합성 과제 및 신경진화 과제에서 LLM 기반 최적화의 강건성과 성능을 평가하는 것.
- 교사 알고리즘 트레이젝터리에 대한 지시 프ine-tuning이 LLM 기반 최적화 성능을 향상시키는지 탐색하는 것.
- 해의 표현 방식, 이산화, 문맥 구성과 같은 핵심 설계 선택 사항이 최적화 성공에 미치는 영향을 특정하는 것.
제안 방법
- LLM에 입력으로는 이산화된 해 후보와 그 적합도 값이 가장에서 가장 높은 순서로 정렬된 시퀀스를 사용한다.
- LLM에게 적합도 향상을 위한 질의를 제기하여, 다음 진화 전략 샘플링 분포의 새로운 평균 통계치를 제안하도록 요청한다.
- 연속적인 검색 공간을 이산화하여 정수로 해를 표현하며, 문제에 따라 해상도를 조정한다.
- 고차원 과제에서의 문맥 길이 증가를 관리하기 위해 블록 단위 처리를 지원한다.
- 여러 LLM과 추상화 연구를 통해 BBOB 함수와 소규모 신경진화 제어 과제에서 성능을 평가한다.
- LLM 성능 향상을 위해 교사 알고리즘 트레이젝터리(예: 가우시안 하이클라이밍)를 사용하여 지시 프ine-tuning을 적용한다.

실험 결과
연구 질문
- RQ1LLM은 최적화 과제에 대한 명시적 훈련 없이 제로샷 블랙박스 최적화를 수행할 수 있는가?
- RQ2이산화된, 정렬된, 질의 기반의 프롬프팅 전략이 LLM이 진화 전략에서 효과적인 재조합 연산자로 기능하도록 할 수 있는가?
- RQ3모델 크기, 해의 표현 방식, 문맥 구성은 LLM 기반 진화 전략의 최적화 성능에 어떤 영향을 미치는가?
- RQ4교사 알고리즘의 트레이젝터리에 대한 지시 프ine-tuning이 LLM 기반 최적화기의 성능을 향상시킬 수 있는가?
- RQ5LLM 기반 최적화에 최적의 이산화 해상도가 존재하는가? 그리고 문제 유형에 따라 달라지는가?
주요 결과
- EvoLLM는 8개의 BBOB 테스트 함수와 3개의 신경진화 제어 과제에서 모두 랜덤 서치 및 가우시안 하이클라이밍을 능가하며, 다수의 런에서 일관된 향상을 보였다.
- 작은 LLM(예: PaLM-XS)이 대부분의 경우 더 뛰어난 성능을 보이며, 이는 모델 크기가 성능의 주요 결정 요소가 아님을 시사한다.
- 이산화된 정수 표현 방식의 해가 자연어 기반 지시보다 유의미하게 뛰어나며, 이는 해의 표현 방식의 중요성을 강조한다.
- 최적의 이산화 해상도는 문제에 따라 다르다: 일부 함수(예: Sphere)에서는 1000개의 박스에서 성능이 최고에 이르지만, 10,000개의 박스에서는 문맥 오버로드로 인해 성능이 떨어진다.
- 가우시안 하이클라이밍 교사 알고리즘의 트레이젝터리에 대한 지시 프ine-tuning은 미세하지만 강력한 성능 향상을 이끌어내며, 미리 보지 않은 BBOB 및 신경진화 과제에서 일관되게 성능 향상을 보였다.
- 제한된 문맥(소수의 멤버 또는 세대)이더라도 LLM은 유용한 평균 업데이트를 추론하고 제안할 수 있어, 정렬된 시퀀스에서 패턴 일반화 능력이 뛰어나다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.