[論文レビュー] Large Language Model (LLM) as a System of Multiple Expert Agents: An Approach to solve the Abstraction and Reasoning Corpus (ARC) Challenge
本論文は、大規模言語モデル(LLM)を用いた複数の専門エージェントからなるシステムを提案し、Abstraction and Reasoning Corpus(ARC)チャレンジを解決することを目的としている。入力グリッドを複数の抽象化空間(グリッド、オブジェクト、ピクセル)に変換し、反復的な環境フィードバックを用いることで、事前学習なし、微調整なしのゼロショットプロンプトで111問中50問(45%)の訓練セット問題を解けることを示した。これは、LLMがプログラム合成タスクにおいて機能的エージェントとして機能可能であることを示している。
We attempt to solve the Abstraction and Reasoning Corpus (ARC) Challenge using Large Language Models (LLMs) as a system of multiple expert agents. Using the flexibility of LLMs to be prompted to do various novel tasks using zero-shot, few-shot, context-grounded prompting, we explore the feasibility of using LLMs to solve the ARC Challenge. We firstly convert the input image into multiple suitable text-based abstraction spaces. We then utilise the associative power of LLMs to derive the input-output relationship and map this to actions in the form of a working program, similar to Voyager / Ghost in the MineCraft. In addition, we use iterative environmental feedback in order to guide LLMs to solve the task. Our proposed approach achieves 50 solves out of 111 training set problems (45%) with just three abstraction spaces - grid, object and pixel - and we believe that with more abstraction spaces and learnable actions, we will be able to solve more.
研究の動機と目的
- 人間の認知に類似した少数ショットの抽象的推論を要するARCチャレンジを、LLMを専門エージェントのシステムとして活用することで解決すること。
- 事前学習を用いずに、ゼロショットおよび少数ショットプロンプトに依存して、LLMを用いたプログラム合成の可能性を検討すること。
- 複数の抽象化空間(グリッド、オブジェクト、ピクセル)に根ざしたLLMと環境フィードバックを用いることで、推論性能を向上させること。
- 反復的フィードバックと機能的アクション空間が、視覚的推論タスクにおける正しいプログラム生成をLLMに導く可能性を実証すること。
提案手法
- 入力グリッドを複数の抽象化空間に変換する:グリッド(生のピクセル)、オブジェクト(構造化されたエンティティ)、ピクセル(個々のセルの属性)。
- LLMを用いて入力出力の関係を推論し、ゼロショット、少数ショット、コンテキストに根ざしたプロンプトによってドメイン固有の言語(DSL)で実行可能なプログラムを生成する。
- 反復的環境フィードバックを実装する:生成されたプログラムを実行し、出力を観察し、正誤またはコンパイルエラーに基づいてプログラムを改善する。
- オブジェクト関係、エッジ検出、対称性、差分、対角視点などの追加エージェントタイプを導入し、推論能力を強化する。
- 原始関数を用いたコード生成によりスキルライブラリをシミュレートし、MinecraftにおけるVoyager や Ghost に類似したシステムを再現する。
- 文脈長を短縮し、焦点を高めるためにプロンプトを最適化する。例として、入力グリッドと出力グリッドの明確な差異を強調する。

実験結果
リサーチクエスチョン
- RQ1LLMが事前学習なしに、専門エージェントのシステムとしてARCチャレンジを解くことができるか?
- RQ2複数の抽象化空間(グリッド、オブジェクト、ピクセル)は、視覚的タスクにおけるLLMベースの推論をどの程度向上させるか?
- RQ3反復的環境フィードバックは、LLMベースのシステムにおけるプログラム生成の正確性をどの程度向上させるか?
- RQ4プログラム合成に根ざした機能的アクション空間は、少数ショットの視覚的推論ベンチマークでゼロショット推論を可能にするか?
- RQ5対称性、対角視点、エッジ検出などの追加の抽象化ビューは、ARCタスクにおけるLLMのパフォーマンスをどの程度向上させるか?
主な発見
- 提案手法は、グリッド、オブジェクト、ピクセルの3つの抽象化空間のみを用いて、ARC訓練セットで111問中50問(45%)の解決を達成した。
- 反復的フィードバックにより、誤った出力やコンパイルエラーの修正が可能となり、誤った出力の後に6問、コンパイルエラーの修正後に1問が解決された。
- オブジェクトの色変更やオブジェクトの削除といったマルチステップ推論を要するタスクも、反復的フィードバックを用いて正常に解決された。
- オブジェクト関係、対称性、差分などの追加の抽象化ビューの導入は、特に複雑な問題や対称性に基づく問題において有益であることが示された。
- 本手法は、微調整なしに自然言語プロンプトと環境フィードバックのみを用いて、視覚的変換の正しいプログラムをLLMが生成できることを示した。
- ベースラインのLLMオンリーテキストからプログラムへの変換手法よりも優れた性能を示した。これは、構造化された抽象化空間とフィードバックループが成功の鍵であることを示唆している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。