[논문 리뷰] Evolution through Large Models
이 논문은 코드에서 훈련된 대규모 언어 모델(LLM)을 사용하여 유전적 프로그래밍(GP)에서 지능적인 변형 연산자로 기능하는, 대규모 모델 통한 진화(ELM)를 소개한다. 이는 검색 효율성을 크게 향상시킨다. 인간이 작성한 기능적인 코드 수정을 유도하는 LLM을 통해 ELM는 복잡한 기능성 있는 파이썬 프로그램—예를 들어 Sodarace 도메인에서 움직이는 로봇—을 단 한 개의 열악한 인간 작성 코드 시드에서 시작하여 진화시킬 수 있으며, 결국 새로운 조건부 모델을 토대 삼아 다양한 지형에 맞는 로봇 설계를 가능하게 한다.
This paper pursues the insight that large language models (LLMs) trained to generate code can vastly improve the effectiveness of mutation operators applied to programs in genetic programming (GP). Because such LLMs benefit from training data that includes sequential changes and modifications, they can approximate likely changes that humans would make. To highlight the breadth of implications of such evolution through large models (ELM), in the main experiment ELM combined with MAP-Elites generates hundreds of thousands of functional examples of Python programs that output working ambulating robots in the Sodarace domain, which the original LLM had never seen in pre-training. These examples then help to bootstrap training a new conditional language model that can output the right walker for a particular terrain. The ability to bootstrap new models that can output appropriate artifacts for a given context in a domain where zero training data was previously available carries implications for open-endedness, deep learning, and reinforcement learning. These implications are explored here in depth in the hope of inspiring new directions of research now opened up by ELM.
연구 동기 및 목표
- 유전적 프로그래밍(GP)에서 LLM의 훈련 분포와 거리가 먼 도메인에서 변형이 비효율적인 문제를 해결하기 위해.
- LLM이 인간과 유사한 변형 연산자로 기능하여 진화적 탐색을 기능성 있는 해답으로 이끌 수 있는지 탐색하기 위해.
- 이미 존재하지 않던 훈련 데이터가 없는 도메인에서 LLM이 생성한 데이터가 새로운 맞춤형 모델을 토대 삼는 데 사용될 수 있음을 입증하기 위해.
- ELM이 LLM의 원래 훈련 데이터 외부에서 다양하고 기능성 있는 산물들을 생성함으로써 분포가 변화하는 발견 과정을 어떻게 지원하는지 조사하기 위해.
- ELM가 생성한 데이터를 기반으로 도메인 특화된 산물(예: 지형에 맞는 로봇)의 조건부 생성을 가능하게 하여 강화 학습 및 딥러닝 분야의 응용을 발전시키기 위해.
제안 방법
- 사전 훈련된 코드 생성 LLM을 유전적 프로그래밍 파이프라인에서 변형 연산자로 사용하여 실제 가능하고 기능성 있는 코드 수정을 생성하기 위해.
- MAP-Elites 알고리즘을 적용하여 LLM이 생성한 변형을 사용해 파이썬 프로그램 공간에서 다양하고 기능성 있는 Sodarace 로봇 설계를 탐색하고 보존하기 위해.
- LLM이 이 도메인에 대해 사전에 노출된 바가 없음에도 불구하고, 수십만 개의 기능성 있는 파이썬 프로그램을 생성하여 Sodarace 도메인의 움직이는 로봇을 표현하기 위해.
- ELM가 생성한 데이터셋에 기존 LLM을 미세조정하여 특정 지형에 맞는 로봇을 생성할 수 있는 조건부 언어 모델을 만들기 위해.
- 강화 학습(RL)을 사용하여 조건부 모델을 추가로 정교화하여 지형 입력에 기반해 적절한 로봇 형태를 생성할 수 있도록 하기 위해.
- 초기 훈련 데이터가 전혀 없는 도메인에서 생성된 데이터를 활용해 새로운 모델을 토대 삼는 것—자기 향상되는, 개방형 발견 루프를 입증하기 위해.
실험 결과
연구 질문
- RQ1사전 훈련된 코드 생성 LLM이 훈련 분포 외부의 도메인에서 GP의 효과적이고 지능적인 변형 연산자로 기능할 수 있는가?
- RQ2라벨이 없는 상황에서 진화적 탐색에서 생성된 LLM 데이터가 새로운 도메인 특화 모델을 훈련시키는 데 얼마나 효과적으로 사용될 수 있는가?
- RQ3ELM와 MAP-Elites의 조합이 단 한 개의 인간 작성 시드에서 새로운 도메인에서 다양하고 기능성 있는 산물(예: Sodarace 로봇)을 생성할 수 있는가?
- RQ4ELM가 생성한 데이터가 특정 지형에 맞는 로봇 설계를 생성할 수 있는 조건부 언어 모델을 훈련시키는 데 기여할 수 있는가?
- RQ5ELM는 어떻게 지속적인 발견을 가능하게 하여 기존 훈련 데이터 외부의 새로운, 분포가 변화한 해답을 계속해서 도출하는가?
주요 결과
- LLM이 이 도메인에 대해 사전에 노출된 바가 없음에도 불구하고, ELM는 Sodarace 도메인에서 움직이는 로봇을 표현하는 수십만 개의 기능성 있는 파이썬 프로그램을 성공적으로 생성했다.
- ELM가 생성한 데이터셋은 단순히 새로운 조건부 언어 모델을 미세조정하는 데 충분했으며, 이 모델은 지형에 맞는 Sodarace 로봇을 생성할 수 있었고, 이는 처음부터 훈련시키는 것과 비교해 불가능한 작업이었다.
- 강화 학습은 조건부 모델을 추가로 향상시켜 지형 입력에 기반해 적절한 로봇 형태를 생성할 수 있도록 했다.
- LLM 기반의 변형 연산자가 기존의 변형 방식보다 복잡하고 낯선 도메인에서 기능성 있는 해답으로의 진화적 탐색을 이끄는 데 뚜렷한 성능 향상을 보였다.
- ELM 파이프라인은 자율적인 발견 루프를 보여주었다: ELM가 생성한 데이터는 새로운 모델 훈련을 가능하게 했고, 그 모델은 더 다양하고 목표에 맞는 해답을 생성할 수 있었다.
- 이 방법은 지속적으로 원래 훈련 분포 외부에서 새로운 기능성 있는 산물을 생성함으로써 개방형 진화를 가능하게 하여 새로운 능력의 출현을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.