Skip to main content
QUICK REVIEW

[논문 리뷰] Steve-Eye: Equipping LLM-based Embodied Agents with Visual Perception in Open Worlds

Sipeng Zheng, Jiazheng Liu|arXiv (Cornell University)|2023. 10. 20.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

Steve-Eye는 대규모 다중모달 모델로, ChatGPT를 통해 수집된 850만 개의 지시 수행 쌍을 기반으로 사전 훈련된 언어 모델에 시각 인코더를 통합하여 Minecraft와 같은 오픈 월드 환경에서 LLM 기반 몸체화된 에이전트에 시각 인식 능력을 부여한다. 이 모델은 850만 개의 지시 수행 쌍을 훈련 데이터로 사용하여 다중모달 인식, 기초 지식 기반, 스킬 계획 수립에서 최신 기술 수준의 성능을 달성하며, 세 가지 오픈 월드 벤치마크에서 복잡한 작업에서 최대 73%의 성공률을 기록하여 기존 베이스라인을 압도한다.

ABSTRACT

Recent studies have presented compelling evidence that large language models (LLMs) can equip embodied agents with the self-driven capability to interact with the world, which marks an initial step toward versatile robotics. However, these efforts tend to overlook the visual richness of open worlds, rendering the entire interactive process akin to "a blindfolded text-based game." Consequently, LLM-based agents frequently encounter challenges in intuitively comprehending their surroundings and producing responses that are easy to understand. In this paper, we propose Steve-Eye, an end-to-end trained large multimodal model designed to address this limitation. Steve-Eye integrates the LLM with a visual encoder which enables it to process visual-text inputs and generate multimodal feedback. In addition, we use a semi-automatic strategy to collect an extensive dataset comprising 850K open-world instruction pairs, empowering our model to encompass three essential functions for an agent: multimodal perception, foundational knowledge base, and skill prediction and planning. Lastly, we develop three open-world evaluation benchmarks, then carry out extensive experiments from a wide range of perspectives to validate our model's capability to strategically act and plan. Codes and datasets will be released.

연구 동기 및 목표

  • 텍스트 중심의 LLM 기반 에이전트가 오픈 월드 환경에서 시각 이해 능력을 결여하고 있어 직관적이지 않으며 맥락에 따라 모호한 응답을 생성하는 데서 비롯되는 한계를 해결하기 위해.
  • 시각적 입력과 텍스트 입력을 동시에 인식하고, 실제 세계 맥락에 기반한 추론을 수행하며, 실행 가능한 계획을 생성할 수 있는 다중모달 에이전트를 개발하기 위해.
  • 엔드 투 엔드 훈련을 위한 다중모달 인식, 지식 기반 통합, 스킬 계획 수립을 가능하게 하는 대규모 고품질 지시 데이터셋을 구축하기 위해.
  • Minecraft와 같은 개방형 환경에서의 종합적 벤치마크를 통해 모델의 능력을 검증하고, 전략적 계획 수립과 실행 능력을 입증하기 위해.

제안 방법

  • Steve-Eye 모델은 시각 인코더(예: CLIP 기반)와 사전 훈련된 LLM을 결합하여 다중모달 입력(이미지 + 텍스트)을 처리하고 다중모달 출력을 생성한다.
  • 반자동 데이터 수집 파이프라인을 통해 ChatGPT가 시각적 관찰, 텍스트 맥락, 전문가 기반 추론 응답을 포함한 850만 개의 지시 수행 데이터 쌍을 생성한다.
  • 이 데이터셋을 기반으로 모델을 엔드 투 엔드로 미세조정하여 다중모달 인식, 기초 지식 기반, 스킬 예측 및 계획 수립의 세 가지 핵심 기능을 학습한다.
  • 평가를 위해 세 가지 오픈 월드 벤치마크인 스킬 예측, 스킬 계획 수립, 다중모달 인식을 사용하며, 주로 Minecraft를 테스트베드로 활용한다.
  • 규칙 기반 게임 상태 판단을 학습된 스킬 예측으로 대체하여 자율적 운영을 가능하게 하며, 자기 주도 작동을 지원한다.
  • Steve-Eye-auto라는 변종은 외부 게임 판단을 모델 자체의 스킬 예측으로 대체하여 완전히 자율적인 상호작용을 가능하게 한다.

실험 결과

연구 질문

  • RQ1대규모 다중모달 모델은 시각적 입력과 텍스트 입력을 효과적으로 통합하여 오픈 월드 환경에서 에이전트의 환경 이해 능력을 향상시킬 수 있는가?
  • RQ2미세조정된 다중모달 모델은 복잡하고 개방적인 환경에서 스킬 계획 수립 및 실행에서 텍스트 중심 LLM보다 얼마나 뛰어난 성능을 보일 수 있는가?
  • RQ3반자동으로 캐릭터화된 지시 데이터셋은 몸체화된 에이전트의 다중모달 인식, 지식 기반, 계획 수립 능력 향상에 얼마나 효과적인가?
  • RQ4다중모달 에이전트는 규칙 기반 게임 상태 평가를 학습된 자기 예측된 스킬 실행으로 대체할 수 있으며, 복잡한 과제에서 성능 저하 정도는 어떠한가?

주요 결과

  • 13b 파라미터 버전을 사용한 스킬 예측 벤치마크에서 Steve-Eye는 92.1%의 리콜과 84.2%의 정확도를 기록하여 기존 베이스라인 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • 스킬 계획 수립 벤치마크에서 Steve-Eye는 24개의 복잡한 과제 평균 성공률 73%를 달성하여 핵심 지표에서 MineAgent(0.46)와 GPT Assistant(0.57)를 모두 초월했다.
  • 규칙 기반 게임 판단을 모델 예측 스킬로 대체한 Steve-Eye-auto는 가장 도전적인 과제에서 70%의 성공률을 기록하여 뛀아난 자기 주도 능력을 입증했다.
  • 긴 복잡한 과제에서의 성능 저하가 관찰되었지만, 여전히 기존 베이스라인보다 뚜렷이 뛰어나, 장기적 추론 능력에서의 강건성을 보였다.
  • 그림 5의 정성적 분석 결과, Steve-Eye는 작업 목표에 부합하는 일관되고 단계적인 스킬 계획을 생성하며, 예를 들어 나무 도끼에서 돌도끼를 제작하는 과정을 명확히 이해하고 있다.
  • 850만 개의 지시 데이터셋은 모델이 미묘한 시각-텍스트 추론, 일반 지식, 순차적 계획 수립 능력을 습득하도록 하여 오픈 월드 자율성에 필수적인 요소들을 학습시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.