Skip to main content
QUICK REVIEW

[논문 리뷰] Octopus: Embodied Vision-Language Programmer from Environmental Feedback

Jingkang Yang, Yuhao Dong|arXiv (Cornell University)|2023. 10. 12.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

Octopus는 자연어 지시와 자기 중심 시각 입력에서 실행 가능한 코드를 생성하는 시각-언어 모델로, GPT-4가 생성한 시연를 통해 훈련되고 환경 피드백을 사용한 강화학습으로 개선된다. 이는 OctoGibson 및 GTA와 같은 시뮬레이션 환경에서 기존의 zero-shot 모델인 GPT-4V보다 뛰어난 작업 계획 및 실행 성능을 보이며, 복잡한 시각 의존 작업에서 뛰어난 성능을 발휘한다.

ABSTRACT

Large vision-language models (VLMs) have achieved substantial progress in multimodal perception and reasoning. When integrated into an embodied agent, existing embodied VLM works either output detailed action sequences at the manipulation level or only provide plans at an abstract level, leaving a gap between high-level planning and real-world manipulation. To bridge this gap, we introduce Octopus, an embodied vision-language programmer that uses executable code generation as a medium to connect planning and manipulation. Octopus is designed to 1) proficiently comprehend an agent's visual and textual task objectives, 2) formulate intricate action sequences, and 3) generate executable code. To facilitate Octopus model development, we introduce OctoVerse: a suite of environments tailored for benchmarking vision-based code generators on a wide spectrum of tasks, ranging from mundane daily chores in simulators to sophisticated interactions in complex video games such as Grand Theft Auto (GTA) and Minecraft. To train Octopus, we leverage GPT-4 to control an explorative agent that generates training data, i.e., action blueprints and corresponding executable code. We also collect feedback that enables an enhanced training scheme called Reinforcement Learning with Environmental Feedback (RLEF). Through a series of experiments, we demonstrate Octopus's functionality and present compelling results, showing that the proposed RLEF refines the agent's decision-making. By open-sourcing our simulation environments, dataset, and model architecture, we aspire to ignite further innovation and foster collaborative applications within the broader embodied AI community.

연구 동기 및 목표

  • 신체적 에이전트에서 시각-언어 추론과 실행 가능한 동작 생성 간 격차를 메우기 위해.
  • 시각-언어 모델이 뿐만 아니라 계획을 생성하는 것뿐만 아니라 실시간 환경 상호작용을 위한 정확한 실행 가능한 코드 시퀀스를 생성할 수 있도록 하기 위해.
  • 기존의 모델들이 고수준 계획만 생성하거나 복잡한 시각 환경 간에 일반화에 실패하는 한계를 극복하기 위해.
  • 시뮬레이션 환경과 환경 피드백을 활용하여 몸체적 시각-언어 에이전트를 훈련하고 평가하기 위한 확장 가능한 오픈소스 프레임워크를 개발하기 위해.
  • GTA와 같은 다양한, 이전에 본 적 없는 환경으로의 이식 가능성 탐색을 통해 훈련 도메인 외부로의 일반화 능력을 입증하기 위해.

제안 방법

  • OctoVerse 시뮬레이터에서 GPT-4를 교사 에이전트로 활용하여 다양한 작업에 대한 동작 블루프린트와 해당 실행 가능한 코드를 생성하였다.
  • 자기 중심 시각 관측, 자연어 지시, 참조 동작 시퀀스를 포함한 다중모달 훈련 데이터를 수집하였다.
  • 시뮬레이터에서의 환경 피드백을 통합하여 데이터 수집 중 성공 또는 실패한 동작를 구분함으로써 피드백 기반 훈련을 가능하게 하였다.
  • 보상이 시뮬레이터 결과에서 유도되는 강화학습 기반의 환경 피드백(RLEF)을 제안하였다.
  • 정책 정렬 및 의사결정 정확도 향상을 위해 Proximal Policy Optimization(PPO)를 사용하여 시각-언어 모델을 미세조정하였다.
  • 평가 환경 두 개를 구축하였다: 구조화된 가정 작업을 위한 OctoGibson과 개방형 복잡한 비디오 게임 시나리오를 테스트하기 위한 OctoGTA.

실험 결과

연구 질문

  • RQ1시각-언어 모델이 고수준 계획 외에 자연어 및 시각 입력에서 실행 가능한 코드를 생성할 수 있는가?
  • RQ2환경 피드백이 시뮬레이션 환경에서 시각-언어 에이전트의 정책 학습에 얼마나 효과적인가?
  • RQ3한 환경(예: OctoGibson)에서 사전 훈련된 모델이 최소한의 미세조정으로 상당히 다른 환경(예: GTA)으로 일반화할 수 있는 정도는 어느 정도인가?
  • RQ4시각 집약적이고 실제 세계 유사 작업에서 시각-언어 프로그래머의 성능이 GPT-4V와 같은 zero-shot LLM에 비해 어떻게 되는가?
  • RQ5GPT-4가 생성한 시연와 RLEF 훈련을 통합하면 몸체적 AI에서 더 강력하고 정확한 작업 실행이 가능해지는가?

주요 결과

  • GPT-4V는 환경에 익숙하지 않아 OctoGibson 환경에서 병병병병을 찾는 데 실패했지만, Octopus는 이와 같은 시각 의존 작업에서 GPT-4V를 능가하는 성능을 보였다.
  • GTA 환경으로의 소수의 전이 테스트에서 Octopus는 11개의 작업 중 4개를 성공적으로 완료하여 훈련 도메인 외부로의 이식 가능성에 대한 증거를 제시하였다.
  • RLEF 훈련 방식은 복잡한 다단계 작업에서 성공률이 높아짐으로써 의사결정 정확도 향상에 상당한 기여를 하였다.
  • OctoGibson에서의 일상적인 가정 작업에서 높은 성공률를 기록하여, 구조화되고 시각적으로 풍부한 환경에서 뛰어난 성능을 보였다.
  • 모델은 시각 인식과 자연어 지시에 모두 부합하는 실행 가능한 코드 시퀀스 생성 능력에서 뛰어난 강건성을 보였다.
  • 모델, 시뮬레이터(OctoGibson 및 OctoGTA), 데이터셋의 오픈소싱은 몸체적 AI 및 시각-언어 프로그래밍 분야의 추가 혁신을 촉진할 것으로 기대된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.