Skip to main content
QUICK REVIEW

[논문 리뷰] LLMatic: Neural Architecture Search via Large Language Models and Quality Diversity Optimization

Muhammad Umair Nasir, Sam Earle|arXiv (Cornell University)|2023. 06. 01.
Topic Modeling인용 수 4
한 줄 요약

LLMatic는 코드 기반 신경망 아키텍처 생성을 위한 대규모 언어 모델(Large Language Models, LLMs)과 품질-다양성(Quality-Diversity, QD) 최적화를 조합한 새로운 신경망 아키텍처 탐색(Neural Architecture Search, NAS) 프레임워크를 제안한다. QD 아카이브를 활용한 절차적 프롬프트 기반 접근 방식을 통해, 단지 2,000회의 평가만으로도 CIFAR-10, CIFAR-100, ImageNet16-120에서 준최신 기술 수준의 정확도를 달성하며, 기존 벤치마크 모델에 대한 사전 노출 없이도 효율적이고 효과적인 NAS를 실현한다.

ABSTRACT

Large Language Models (LLMs) have emerged as powerful tools capable of accomplishing a broad spectrum of tasks. Their abilities span numerous areas, and one area where they have made a significant impact is in the domain of code generation. Here, we propose using the coding abilities of LLMs to introduce meaningful variations to code defining neural networks. Meanwhile, Quality-Diversity (QD) algorithms are known to discover diverse and robust solutions. By merging the code-generating abilities of LLMs with the diversity and robustness of QD solutions, we introduce exttt{LLMatic}, a Neural Architecture Search (NAS) algorithm. While LLMs struggle to conduct NAS directly through prompts, exttt{LLMatic} uses a procedural approach, leveraging QD for prompts and network architecture to create diverse and high-performing networks. We test exttt{LLMatic} on the CIFAR-10 and NAS-bench-201 benchmarks, demonstrating that it can produce competitive networks while evaluating just $2,000$ candidates, even without prior knowledge of the benchmark domain or exposure to any previous top-performing models for the benchmark. The open-sourced code is available in \url{https://github.com/umair-nasir14/LLMatic}.

연구 동기 및 목표

  • 시험적이고 오차 중심의 평가에 의존하는 전통적 신경망 아키텍처 탐색(NAS) 방법의 비효율성과 다양성 부족 문제를 해결하기 위해.
  • 대규모 언어 모델(Large Language Models, LLMs)이 신경망을 위한 의미 있는 아키텍처 변형을 효과적으로 생성하는 데 활용될 수 있는지 탐색하기 위해.
  • LLM 기반 코드 생성과 품질-다양성(Quality-Diversity, QD) 최적화를 통합하여 다양하고 고성능이며 견고한 아키텍처의 집합을 탐색하기 위해.
  • 소규모이지만 효율적인 LLM(6.1B 파라미터)이 최소한의 검색 예산으로도 경쟁 가능한 NAS 성능을 달성할 수 있는지 보여주기 위해.
  • 제안된 LLMatic 프레임워크의 각 구성 요소의 필요성과 효과성을 추론 분석(ablation study)를 통해 검증하기 위해.

제안 방법

  • LLMatic는 코드 생성 기능을 갖춘 LLM(CodeGen-6.1B)을 사용하여 정의된 연산 집합에 제약을 두고 검색 가능한 코드 스니펫 형태로 신경망 아키텍처를 생성한다.
  • MAP-Elites의 변종인 품질-다양성(Quality-Diversity, QD) 알고리즘을 사용하여 두 개의 아카이브를 유지한다: 하나는 프롬프트용, 다른 하나는 훈련된 네트워크 아키텍처용.
  • 프롬프트 아카이브는 LLM이 다양한 네트워크 셀을 생성하도록 이끄는 다양하고 고성능의 프롬프트를 저장하며, 네트워크 아카이브는 FLOPS, 파라미터 수 등과 같은 행동 기술자(behavior descriptor)를 갖춘 아키텍처를 저장한다.
  • 각 세대에서는 QD 아카이브에서 프롬프트를 샘플링하고, LLM을 통해 새로운 네트워크 셀을 생성하며, 생성된 아키텍처를 훈련하고 평가한 후, 성능과 행동 다양성 기반으로 네트워크 아카이브를 업데이트한다.
  • 이 프로세스는 절차적이고 반복적인 루프로 구성되며, 다음과 같은 순서를 따른다: 프롬프트 선택 → LLM 기반 아키텍처 생성 → 훈련 및 평가 → 아카이브 업데이트 → 다음 세대.
  • 이 프레임워크는 계산 자원을 최소화하여 설계되었으며, 총 2,000회의 평가와 작은 LLM만을 사용하면서도 경쟁 가능한 성능을 달성한다.
Figure 1: The illustration of the best accuracy per generation for LLMatic and all ablation studies. Each experiment is conducted with 10 seeds. The shaded region is the standard deviation while the solid line represents the mean. EfficientNet-B0 is the best-performing EfficientNet on CIFAR-10.
Figure 1: The illustration of the best accuracy per generation for LLMatic and all ablation studies. Each experiment is conducted with 10 seeds. The shaded region is the standard deviation while the solid line represents the mean. EfficientNet-B0 is the best-performing EfficientNet on CIFAR-10.

실험 결과

연구 질문

  • RQ1대규모 언어 모델(LLMs)을 코드 생성을 통해 다양하고 고성능인 신경망 아키텍처를 효과적으로 생성하는 데 활용할 수 있는가?
  • RQ2LLM 기반 코드 생성과 품질-다양성 최적화를 융합하면 신경망 아키텍처 탐색의 효율성과 다양성이 어떻게 향상되는가?
  • RQ3소규모 6.1B 파라미터 LLM이 2,000회의 시험만으로도 경쟁 가능한 NAS 성능을 달성할 수 있는 정도는 어느 정도인가?
  • RQ4LLMatic는 Λ-DARTS나 GPT-4 기반 GENIUS와 같은 최신 기술 수준의 NAS 방법과 정확도와 다양성 측면에서 어떻게 비교되는가?
  • RQ5LLMatic의 각 구성 요소가 기여하는 바는 무엇이며, 이 프레임워크는 아키텍처 제약과 제한된 계산 자원에 대해 얼마나 견고한가?

주요 결과

  • NAS-bench-201 벤치마크에서 LLMatic는 CIFAR-10에서 테스트 정확도 94.26±0.13을 달성하여 테스트된 모든 방법 중 2위를 기록했으며, 최적의 94.47에 근접하였다.
  • CIFAR-100에서는 71.62±1.73의 정확도로 2위를 기록했고, ImageNet16-120에서는 45.87±0.96의 정확도로 11위를 기록하여 다양한 데이터셋에 걸쳐 뛰어난 일반화 능력을 보였다.
  • LLMatic는 CIFAR-10에서 20개 이상의 경쟁 가능한 네트워크를 탐색했으며, 행동 공간 전반에 걸쳐 넓은 분포를 보이며 아키텍처 탐색의 효과적인 다양성을 입증했다.
  • 추론 분석 결과, LLM 생성, 프롬프트 QD 아카이브, 네트워크 QD 아카이브 등 LLMatic의 각 구성 요소가 필수적임을 확인했으며, 어느 하나라도 제거할 경우 성능이 크게 저하됨을 확인했다.
  • 단지 2,000회의 평가와 소규모 6.1B 파라미터 LLM만을 사용했음에도 불구하고, LLMatic는 단순한 GPT-4 기반 NAS(GENIUS)를 능가했고, 최신 기술 수준의 방법인 Λ-DARTS와 동등한 성능을 달성했다.
  • LLM과 QD 최적화를 융합함으로써, 최고 성능 모델에 대한 사전 노출 없이도 효율적이고 자원을 적게 소비하는 NAS가 가능하다는 점을 입증했다.
Figure 2: The illustration of how many trainable networks are created in a generation. The total number of networks created is 100 per generation.
Figure 2: The illustration of how many trainable networks are created in a generation. The total number of networks created is 100 per generation.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.