[논문 리뷰] Polycraft World AI Lab (PAL): An Extensible Platform for Evaluating Artificial Intelligence Agents
Polycraft World AI Lab (PAL)는 다양한 작업을 통해 인공지능 에이전트를 평가하기 위해 Polycraft World라는 마인크래프트 모드 기반으로 구축된 확장성 있고 API 기반의 플랫폼이다. 이 플랫폼은 태스크를 영리하게 생성할 수 있으며, 에이전트와 비플레이어 캐릭터(NPC)의 행동을 실시간으로 로깅할 수 있고, 동적 요건이 설정된 복잡한 오픈월드 환경에서 에이전트의 훈련과 평가를 지원한다.
As artificial intelligence research advances, the platforms used to evaluate AI agents need to adapt and grow to continue to challenge them. We present the Polycraft World AI Lab (PAL), a task simulator with an API based on the Minecraft mod Polycraft World. Our platform is built to allow AI agents with different architectures to easily interact with the Minecraft world, train and be evaluated in multiple tasks. PAL enables the creation of tasks in a flexible manner as well as having the capability to manipulate any aspect of the task during an evaluation. All actions taken by AI agents and external actors (non-player-characters, NPCs) in the open-world environment are logged to streamline evaluation. Here we present two custom tasks on the PAL platform, one focused on multi-step planning and one focused on navigation, and evaluations of agents solving them. In summary, we report a versatile and extensible AI evaluation platform with a low barrier to entry for AI researchers to utilize.
연구 동기 및 목표
- 연구가 진전되면서 점점 더 복잡해지는 인공지능 에이전트를 평가하기 위한 적응형이고 확장 가능한 플랫폼의 증가하는 필요를 해결하기 위해.
- 기존의 인공지능 평가 환경의 한계를 극복하기 위해 확장성, 설정 가능성, 작업 동역학에 대한 세밀한 제어를 제공함으로써.
- 다양한 작업, 예를 들어 다단계 계획 수립과 탐색과 같은 작업들에 걸쳐 연구자들이 쉽게 인공지능 에이전트를 생성, 수정, 평가할 수 있도록 지원하기 위해.
- 표준화된 API 인터페이스를 통해 다양한 인공지능 에이전트 아키텍처 간의 상호운용성을 지원하기 위해.
- 에이전트와 NPC의 행동을 실시간으로 로깅하여 재현 가능하고 추적 가능한 성능 분석을 단순화하기 위해.
제안 방법
- 다양한 상호작용 요소를 지닌 지속 가능한 오픈월드 시뮬레이션 환경을 제공하기 위해 Polycraft World 모드를 기반으로 하는 플랫폼을 설계함.
- AI 에이전트가 이산 동작(예: 이동, 제작, 상호작용)을 사용해 환경과 상호작용할 수 있도록 모듈러한 API를 설계함.
- 실행 시점에서 작업 매개변수, 목표, 환경 조건를 설정할 수 있도록 동적 작업 생성을 구현함.
- 행동 시퀀스의 상세한 평가 및 분석을 지원하기 위해 모든 에이전트와 NPC 행동을 구조화된 형식으로 로깅함.
- 평가 중에 복잡한 다중 에이전트 상호작용을 시뮬레이션하기 위해 비플레이어 캐릭터(NPC) 통합을 지원함.
- 두 가지 커스터마이징된 작업을 프로토타이핑하고 평가하기 위해 플랫폼을 활용함: 하나는 다단계 계획 수립에 중점을 두고 있고, 다른 하나는 탐색에 집중함.
실험 결과
연구 질문
- RQ1어떻게 하면 설정 오버헤드를 최소화하면서도 다양한 커스터마이징 가능한 작업을 지원할 수 있는 인공지능 평가 플랫폼을 설계할 수 있는가?
- RQ2동적 작업 매개변수를 가진 오픈월드 환경이 일반적인 인공지능 에이전트의 훈련과 평가를 얼마나 잘 지원할 수 있는가?
- RQ3플랫폼은 다양한 상호작용과 작업 유형에 걸쳐 복잡한 에이전트 행동을 효과적으로 로깅하고 분석할 수 있는가?
- RQ4플랫폼의 확장성은 새로운 평가 벤치마크의 빠른 프로토타이핑을 어떻게 가능하게 하는가?
- RQ5통제된, 설정 가능한 작업 조건 하에서 다양한 인공지능 에이전트의 성능 특성은 어떠한가?
주요 결과
- PAL은 환경 및 목표 매개변수에 대한 세밀한 제어를 통해 복잡하고 커스터마이징 가능한 작업의 생성과 실행을 가능하게 한다.
- 플랫폼은 모든 에이전트와 NPC 행동을 성공적으로 로깅하여 성능 평가에 필수적인 상세하고 추적 가능한 기록을 제공한다.
- 다단계 계획 수립과 탐색을 중점으로 한 두 가지 커스터마이징된 작업이 구현되었으며, 이는 플랫폼의 유연성을 입증한다.
- API 기반 아키텍처는 다양한 인공지능 에이전트 아키텍처의 원활한 통합을 가능하게 하여 연구자들이 접근하기 쉬운 환경을 조성한다.
- 평가 중에 작업 조건을 실시간으로 조작할 수 있어 동적 적응성과 내구성 테스트를 지원한다.
- PAL은 향후 오픈월드 환경에서 인공지능 평가 벤치마크 개발을 위한 확장성 있고 유연한 기반을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.