[논문 리뷰] LLMatic: Neural Architecture Search via Large Language Models and Quality Diversity Optimization
LLMatic는 코드 기반 신경망 아키텍처 생성을 위한 대규모 언어 모델(Large Language Models, LLMs)과 품질-다양성(Quality-Diversity, QD) 최적화를 조합한 새로운 신경망 아키텍처 탐색(Neural Architecture Search, NAS) 프레임워크를 제안한다. QD 아카이브를 활용한 절차적 프롬프트 기반 접근 방식을 통해, 단지 2,000회의 평가만으로도 CIFAR-10, CIFAR-100, ImageNet16-120에서 준최신 기술 수준의 정확도를 달성하며, 기존 벤치마크 모델에 대한 사전 노출 없이도 효율적이고 효과적인 NAS를 실현한다.
Large Language Models (LLMs) have emerged as powerful tools capable of accomplishing a broad spectrum of tasks. Their abilities span numerous areas, and one area where they have made a significant impact is in the domain of code generation. Here, we propose using the coding abilities of LLMs to introduce meaningful variations to code defining neural networks. Meanwhile, Quality-Diversity (QD) algorithms are known to discover diverse and robust solutions. By merging the code-generating abilities of LLMs with the diversity and robustness of QD solutions, we introduce exttt{LLMatic}, a Neural Architecture Search (NAS) algorithm. While LLMs struggle to conduct NAS directly through prompts, exttt{LLMatic} uses a procedural approach, leveraging QD for prompts and network architecture to create diverse and high-performing networks. We test exttt{LLMatic} on the CIFAR-10 and NAS-bench-201 benchmarks, demonstrating that it can produce competitive networks while evaluating just $2,000$ candidates, even without prior knowledge of the benchmark domain or exposure to any previous top-performing models for the benchmark. The open-sourced code is available in \url{https://github.com/umair-nasir14/LLMatic}.
연구 동기 및 목표
- 시험적이고 오차 중심의 평가에 의존하는 전통적 신경망 아키텍처 탐색(NAS) 방법의 비효율성과 다양성 부족 문제를 해결하기 위해.
- 대규모 언어 모델(Large Language Models, LLMs)이 신경망을 위한 의미 있는 아키텍처 변형을 효과적으로 생성하는 데 활용될 수 있는지 탐색하기 위해.
- LLM 기반 코드 생성과 품질-다양성(Quality-Diversity, QD) 최적화를 통합하여 다양하고 고성능이며 견고한 아키텍처의 집합을 탐색하기 위해.
- 소규모이지만 효율적인 LLM(6.1B 파라미터)이 최소한의 검색 예산으로도 경쟁 가능한 NAS 성능을 달성할 수 있는지 보여주기 위해.
- 제안된 LLMatic 프레임워크의 각 구성 요소의 필요성과 효과성을 추론 분석(ablation study)를 통해 검증하기 위해.
제안 방법
- LLMatic는 코드 생성 기능을 갖춘 LLM(CodeGen-6.1B)을 사용하여 정의된 연산 집합에 제약을 두고 검색 가능한 코드 스니펫 형태로 신경망 아키텍처를 생성한다.
- MAP-Elites의 변종인 품질-다양성(Quality-Diversity, QD) 알고리즘을 사용하여 두 개의 아카이브를 유지한다: 하나는 프롬프트용, 다른 하나는 훈련된 네트워크 아키텍처용.
- 프롬프트 아카이브는 LLM이 다양한 네트워크 셀을 생성하도록 이끄는 다양하고 고성능의 프롬프트를 저장하며, 네트워크 아카이브는 FLOPS, 파라미터 수 등과 같은 행동 기술자(behavior descriptor)를 갖춘 아키텍처를 저장한다.
- 각 세대에서는 QD 아카이브에서 프롬프트를 샘플링하고, LLM을 통해 새로운 네트워크 셀을 생성하며, 생성된 아키텍처를 훈련하고 평가한 후, 성능과 행동 다양성 기반으로 네트워크 아카이브를 업데이트한다.
- 이 프로세스는 절차적이고 반복적인 루프로 구성되며, 다음과 같은 순서를 따른다: 프롬프트 선택 → LLM 기반 아키텍처 생성 → 훈련 및 평가 → 아카이브 업데이트 → 다음 세대.
- 이 프레임워크는 계산 자원을 최소화하여 설계되었으며, 총 2,000회의 평가와 작은 LLM만을 사용하면서도 경쟁 가능한 성능을 달성한다.

실험 결과
연구 질문
- RQ1대규모 언어 모델(LLMs)을 코드 생성을 통해 다양하고 고성능인 신경망 아키텍처를 효과적으로 생성하는 데 활용할 수 있는가?
- RQ2LLM 기반 코드 생성과 품질-다양성 최적화를 융합하면 신경망 아키텍처 탐색의 효율성과 다양성이 어떻게 향상되는가?
- RQ3소규모 6.1B 파라미터 LLM이 2,000회의 시험만으로도 경쟁 가능한 NAS 성능을 달성할 수 있는 정도는 어느 정도인가?
- RQ4LLMatic는 Λ-DARTS나 GPT-4 기반 GENIUS와 같은 최신 기술 수준의 NAS 방법과 정확도와 다양성 측면에서 어떻게 비교되는가?
- RQ5LLMatic의 각 구성 요소가 기여하는 바는 무엇이며, 이 프레임워크는 아키텍처 제약과 제한된 계산 자원에 대해 얼마나 견고한가?
주요 결과
- NAS-bench-201 벤치마크에서 LLMatic는 CIFAR-10에서 테스트 정확도 94.26±0.13을 달성하여 테스트된 모든 방법 중 2위를 기록했으며, 최적의 94.47에 근접하였다.
- CIFAR-100에서는 71.62±1.73의 정확도로 2위를 기록했고, ImageNet16-120에서는 45.87±0.96의 정확도로 11위를 기록하여 다양한 데이터셋에 걸쳐 뛰어난 일반화 능력을 보였다.
- LLMatic는 CIFAR-10에서 20개 이상의 경쟁 가능한 네트워크를 탐색했으며, 행동 공간 전반에 걸쳐 넓은 분포를 보이며 아키텍처 탐색의 효과적인 다양성을 입증했다.
- 추론 분석 결과, LLM 생성, 프롬프트 QD 아카이브, 네트워크 QD 아카이브 등 LLMatic의 각 구성 요소가 필수적임을 확인했으며, 어느 하나라도 제거할 경우 성능이 크게 저하됨을 확인했다.
- 단지 2,000회의 평가와 소규모 6.1B 파라미터 LLM만을 사용했음에도 불구하고, LLMatic는 단순한 GPT-4 기반 NAS(GENIUS)를 능가했고, 최신 기술 수준의 방법인 Λ-DARTS와 동등한 성능을 달성했다.
- LLM과 QD 최적화를 융합함으로써, 최고 성능 모델에 대한 사전 노출 없이도 효율적이고 자원을 적게 소비하는 NAS가 가능하다는 점을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.