[논문 리뷰] Large Language Model (LLM) as a System of Multiple Expert Agents: An Approach to solve the Abstraction and Reasoning Corpus (ARC) Challenge
이 논문은 대규모 언어 모델(Large Language Models, LLMs)에 기반한 다수의 전문가 에이전트 시스템을 제안하여 Abstraction and Reasoning Corpus (ARC) 과제를 해결한다. 입력 격자를 격자, 객체, 픽셀 등의 다중 추상화 공간으로 변환하고 반복적인 환경 피드백을 활용함으로써, 사전 훈련 없이 zero-shot 프롬프팅만으로도 111개 중 50개(45%)의 훈련 세트 문제를 해결하며, LLM이 프로그램 합성 작업에서 기능적 에이전트로 작동할 수 있음을 입증한다.
We attempt to solve the Abstraction and Reasoning Corpus (ARC) Challenge using Large Language Models (LLMs) as a system of multiple expert agents. Using the flexibility of LLMs to be prompted to do various novel tasks using zero-shot, few-shot, context-grounded prompting, we explore the feasibility of using LLMs to solve the ARC Challenge. We firstly convert the input image into multiple suitable text-based abstraction spaces. We then utilise the associative power of LLMs to derive the input-output relationship and map this to actions in the form of a working program, similar to Voyager / Ghost in the MineCraft. In addition, we use iterative environmental feedback in order to guide LLMs to solve the task. Our proposed approach achieves 50 solves out of 111 training set problems (45%) with just three abstraction spaces - grid, object and pixel - and we believe that with more abstraction spaces and learnable actions, we will be able to solve more.
연구 동기 및 목표
- 사전 훈련 없이 zero-shot 및 few-shot 프롬프팅에 의존하여 프로그램 합성 작업에 LLM을 활용할 수 있는지 탐색한다.
- LLM을 다수의 전문가 에이전트로 구성된 시스템으로 활용하여 인간의 인지에 유사한 소수의 예시 기반 추상적 추론을 요구하는 ARC 과제를 해결한다.
- 다양한 추상화 공간(격자, 객체, 픽셀)에 기반한 LLM의 추론 성능 향상을 위해 환경 피드백을 통합한다.
- 반복적인 피드백과 기능적 동작 공간이 시각적 추론 과제에서 LLM이 정확한 프로그램 생성으로 이어질 수 있음을 보여준다.
제안 방법
- 입력 격자를 격자(원시 픽셀), 객체(구조화된 요소), 픽셀(개별 셀 속성) 등의 다중 추상화 공간으로 변환한다.
- zero-shot, few-shot, 그리고 맥락 기반 프롬프팅을 통해 LLM이 입력-출력 관계를 추론하고 도메인 특화 언어(DSL)로 실행 가능한 프로그램을 생성한다.
- 반복적인 환경 피드백을 구현: 생성된 프로그램을 실행하고 출력을 관찰한 후 정확성 또는 컴파일 오류에 따라 프로그램을 보완한다.
- 추가적인 에이전트 유형(예: 객체 관계, 에지 검출, 대칭성, 차이, 대각선 시각 등)을 도입하여 추론 능력을 향상시킨다.
- 기본 기능 함수를 사용한 코드 생성을 통해 기능 라이브러리 시뮬레이션을 구현하며, 마이닝프레임워크의 Voyager나 Ghost in the Minecraft와 유사한 시스템을 모방한다.
- 맥락 길이를 줄이고 집중도를 향상시키기 위해 프롬프트를 최적화한다. 예를 들어 입력 격자와 출력 격자 간의 차이를 명시적으로 강조한다.

실험 결과
연구 질문
- RQ1LLM이 사전 훈련 없이 다수의 전문가 에이전트로 기능할 수 있는가?
- RQ2격자, 객체, 픽셀 등의 다중 추상화 공간이 LLM 기반 시각적 과제 추론 성능 향상에 얼마나 효과적인가?
- RQ3반복적인 환경 피드백이 LLM 기반 시스템에서 프로그램 생성 정확도 향상에 얼마나 기여하는가?
- RQ4프로그램 합성에 기반한 기능적 동작 공간은 소수의 예시 기반 시각적 추론 벤치마크에서 zero-shot 추론을 가능하게 하는가?
- RQ5대칭성, 대각선, 에지 검출 등의 추가 추상화 시각은 ARC 과제에서 LLM 성능 향상에 기여하는가?
주요 결과
- 제안된 방법은 격자, 객체, 픽셀의 세 가지 추상화 공간만을 사용하여 ARC 훈련 세트에서 총 111개 중 50개(45%)의 문제를 해결하였다.
- 반복 피드백을 통해 잘못된 출력과 컴파일 오류를 수정할 수 있었으며, 잘못된 출력으로 인해 6개의 과제가 복구되었고, 컴파일 오류 수정으로 1개의 과제가 해결되었다.
- 객체 색상 수정 및 객체 제거 등의 다단계 추론이 필요한 과제들도 반복 피드백을 통해 성공적으로 해결되었다.
- 객체 관계, 대칭성, 차이 등의 추가 추상화 시각은 특히 복잡하거나 대칭성 기반 문제에서 유용한 것으로 나타났다.
- LLM이 사전 미세조정 없이 자연어 프롬프팅과 환경 피드백만으로도 정확한 프로그램 생성이 가능함을 입증하였다.
- 기본적인 LLM 전용 텍스트-에서-프로그램 변환 방법보다 성능이 뛰어나, 체계적인 추상화 공간과 피드백 루프가 성공에 핵심적임을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.