[논문 리뷰] MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge
이 논문은 Minecraft 기반 프레임워크 MineDojo를 도입합니다. 오픈 엔드(task)와 대규모 멀티모달 지식 베이스, 학습된 보상 함수(MineCLIP)를 결합하여 수작업으로 설계된 밀집 보상 없이 일반적으로 능력 있는 구체화 에이전트를 학습합니다.
Autonomous agents have made great strides in specialist domains like Atari games and Go. However, they typically learn tabula rasa in isolated environments with limited and manually conceived objectives, thus failing to generalize across a wide spectrum of tasks and capabilities. Inspired by how humans continually learn and adapt in the open world, we advocate a trinity of ingredients for building generalist agents: 1) an environment that supports a multitude of tasks and goals, 2) a large-scale database of multimodal knowledge, and 3) a flexible and scalable agent architecture. We introduce MineDojo, a new framework built on the popular Minecraft game that features a simulation suite with thousands of diverse open-ended tasks and an internet-scale knowledge base with Minecraft videos, tutorials, wiki pages, and forum discussions. Using MineDojo's data, we propose a novel agent learning algorithm that leverages large pre-trained video-language models as a learned reward function. Our agent is able to solve a variety of open-ended tasks specified in free-form language without any manually designed dense shaping reward. We open-source the simulation suite, knowledge bases, algorithm implementation, and pretrained models (https://minedojo.org) to promote research towards the goal of generally capable embodied agents.
연구 동기 및 목표
- 세 가지 축(다양한 환경, 인터넷 규모의 지식, 확장 가능한 아키텍처)에 기반한 개방형 엔드의 일반적으로 능력 있는 구체화 에이전트를 제안하는 프레임워크를 제시한다.
- 수천 개의 태스크와 자동화된, crowdsourced 지식 베이스를 갖춘 MineDojo의 Minecraft 기반 시뮬레이션을 소개한다.
- 수동으로 설계된 밀집 보상 없이 에이전트를 학습시키기 위해 대형 사전 학습 비디오-언어 모델을 학습된 보상으로 활용하는 학습 알고리즘을 개발한다.
- MineCLIP 기반 보상이 프로그램적 태스크에서 수작업으로 엔지니어링된 보상과 견줄 만한 성능을 낳고, 보지 못한 시각적 자극에 대해 강건한 제로샷 일반화를 보인다.
제안 방법
- 수천 개의 태스크에 걸쳐 표준화된 관찰/행동 공간을 갖춘 통합된 Minecraft 기반 시뮬레이터를 제공한다.
- ground-truth 성공 기준이 있는 프로그램틱 태스크와 학습된 지표로 평가되는 크리에이티브 태스크의 두 가지 태스크 스위트를 구성한다.
- 학습 Grounding을 위해 730K+ YouTube Minecraft 영상, 6K+ Wiki 페이지, 340K+ Reddit 포스트로 인터넷 규모의 지식 베이스를 구축한다.
- MineCLIP은 16프레임 비디오 클립과 전사를 기반으로 대화형 보상 함수로 작용하도록 비디오-언어 대조 모델로 사전 학습한다.
- 샘플 효율성을 높이기 위해 Self-Imitation Learning이 포함된 PPO 기반 RL 파이프라인에 MineCLIP 보상을 통합한다.
- 제로샷 및 소수샷 일반화를 평가하고, 수작업으로 설계된 보상 및 CLIP 기반 벤치마크와 비교한다.
실험 결과
연구 질문
- RQ1에이전트를 대상으로 인터넷 규모의 비디오 데이터에서 학습된 언어 조건 보상을 사용하여 개방형 Minecraft 태스크의 광범위한 범위를 수행하도록 학습시킬 수 있는가?
- RQ2Programmatic 태스크에서 MineCLIP가 수작업으로 설계된 보상과 비교해 경쟁력 있는 또는 우수한 지침을 제공하는가?
- RQ3MineCLIP 보상으로 학습된 에이전트가 보지 못한 지형, 날씨 및 태스크에 얼마나 잘 일반화하는가?
- RQ4멀티태스크 학습(12태스크)이 개별 태스크 성능과 전이 효과에 미치는 영향은 무엇인가?
- RQ5지식 베이스와 태스크 스위트가 구체화된 에이전트의 협업 및 개방형 학습을 얼마나 확장할 수 있는가?
주요 결과
- MineCLIP 보상은 프로그램틱 태스크에서 수동 밀집 보상과 경쟁적 성능을 달성하고 CLIP OpenAI 벤치마크를 능가한다.
- 12-태스크 멀티그룹 실험에서 MineCLIP 유도 에이전트가 여러 태스크에서 높은 성공률에 도달하고 시각적 분포 변화에 대한 강건성을 보인다.
- Creative 태스크의 경우 MineCLIP은 인간 판단과 높은 일치도를 보이는 자동 평가 지표를 제공한다(F1 점수는 보고된 하위집합에서 인간 정확도에 근접).
- 모든 12 태스크에서 학습된 단일 에이전트는 태스크별 에이전트에 비해 일부 태스크에서 향상을 보이고 다른 태스크에서 감소하는 혼합 전이를 보인다.
- 제로샷 일반화 테스트에서 MineCLIP-보강 에이전트는 보상 벤치마크에 비해 미지의 지형과 조건에 대해 더 뛰어난 강건성을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.