Skip to main content
QUICK REVIEW

[論文レビュー] Octopus: Embodied Vision-Language Programmer from Environmental Feedback

Jingkang Yang, Yuhao Dong|arXiv (Cornell University)|Oct 12, 2023
Multimodal Machine Learning ApplicationsComputer Science被引用数 3
ひとこと要約

Octopusは、自然言語指示とエゴセントリックな視覚入力を入力として、実行可能なコードを生成する視覚言語モデルであり、GPT-4が生成したデモンストレーションを用いて訓練され、環境フィードバックを用いた強化学習(RLEF)で最適化されている。このモデルは、OctoGibson や GTA といったシミュレーテッド環境において、GPT-4V などのゼロショットモデルを上回る優れたタスク計画および実行性能を発揮し、視覚に依存する複雑なタスクで優れた結果を示している。

ABSTRACT

Large vision-language models (VLMs) have achieved substantial progress in multimodal perception and reasoning. When integrated into an embodied agent, existing embodied VLM works either output detailed action sequences at the manipulation level or only provide plans at an abstract level, leaving a gap between high-level planning and real-world manipulation. To bridge this gap, we introduce Octopus, an embodied vision-language programmer that uses executable code generation as a medium to connect planning and manipulation. Octopus is designed to 1) proficiently comprehend an agent's visual and textual task objectives, 2) formulate intricate action sequences, and 3) generate executable code. To facilitate Octopus model development, we introduce OctoVerse: a suite of environments tailored for benchmarking vision-based code generators on a wide spectrum of tasks, ranging from mundane daily chores in simulators to sophisticated interactions in complex video games such as Grand Theft Auto (GTA) and Minecraft. To train Octopus, we leverage GPT-4 to control an explorative agent that generates training data, i.e., action blueprints and corresponding executable code. We also collect feedback that enables an enhanced training scheme called Reinforcement Learning with Environmental Feedback (RLEF). Through a series of experiments, we demonstrate Octopus's functionality and present compelling results, showing that the proposed RLEF refines the agent's decision-making. By open-sourcing our simulation environments, dataset, and model architecture, we aspire to ignite further innovation and foster collaborative applications within the broader embodied AI community.

研究の動機と目的

  • エンベッデッドエージェントにおける視覚言語推論と実行可能行動生成のギャップを埋める。
  • 視覚言語モデルが計画を生成するのではなく、リアルタイムの環境インタラクションに適した正しい実行可能コードシーケンスを生成できるようにする。
  • 従来のモデルが高レベルの計画しか生成しない、または複雑な視覚環境において一般化に失敗するという限界を克服する。
  • シミュレーテッド環境と環境フィードバックを用いて、エンベッデッド視覚言語エージェントの訓練と評価のためのスケーラブルでオープンソースのフレームワークを開発する。
  • GTA などの多様で事前に見たことのない環境へのモデルの転送可能性を検証し、トレーニングドメインを越えた一般化能力を示す。

提案手法

  • OctoVerseシミュレーター内でGPT-4を教師エージェントとして活用し、多様なタスクのための行動ブループrintと対応する実行可能コードを生成した。
  • エゴセントリックな視覚観測、自然言語指示、正解の行動シーケンスを含むマルチモーダルなトレーニングデータを収集した。
  • シミュレーターからの環境フィードバックを統合し、データ収集段階で成功した行動と失敗した行動を区別することができ、フィードバックに基づく訓練を可能にした。
  • 環境フィードバックを用いた強化学習(RLEF)を提案。報酬はシミュレーターの結果から得られ、モデルの微調整に用いられた。
  • 方策の整合性と意思決定の正確性を向上させるために、Proximal Policy Optimization(PPO)を用いて視覚言語モデルを微調整した。
  • 2つの評価環境を構築した:構造的な家庭内タスクを想定したOctoGibsonと、オープンエンドで複雑なビデオゲームシナリオを想定したOctoGTA。一般化能力と推論能力をテストした。

実験結果

リサーチクエスチョン

  • RQ1視覚言語モデルは、高レベルの計画ではなく、自然言語と視覚入力から実行可能なコードを生成できるか?
  • RQ2環境フィードバックは、シミュレーテッド環境における視覚言語エージェントの方策学習をどの程度効果的に改善するか?
  • RQ31つの環境(例:OctoGibson)で事前学習したモデルが、顕著に異なる環境(例:GTA)に最小限の微調整で一般化できるか、その程度はいかほどか?
  • RQ4視覚に依存する、現実世界に類似したタスクにおいて、視覚言語プログラマーの性能はゼロショットLLM(例:GPT-4V)と比べてどの程度優れているか?
  • RQ5GPT-4が生成したデモンストレーションとRLEF訓練の統合により、エンベッデッドAIにおけるより強固で正確なタスク実行が達成可能か?

主な発見

  • GPT-4VはOctoGibson環境でビーカーの位置特定に失敗したが、Octopusは視覚に依存するタスク(例:ビーカーの特定)においてGPT-4Vを上回った。
  • GTA環境への少データ転送において、Octopusは11タスク中4タスクを正常に完了し、トレーニングドメインを超えた転送可能性を示した。
  • RLEF訓練スキームにより、複雑で多段階のタスクにおける意思決定の正確性が顕著に向上し、成功確率が上昇した。
  • OctoGibsonにおける日常的で構造化された家庭内タスクにおいて、Octopusは高い成功確率を達成し、視覚が豊富な環境での強力な性能を示した。
  • モデルは視覚的認識と自然言語指示の両方に整合する実行可能コードシーケンスを生成するという点で、強靭性を示した。
  • モデル、シミュレーター(OctoGibsonおよびOctoGTA)、データセットのオープンソース化により、エンベッデッドAIおよび視覚言語プログラミング分野におけるさらなるイノベーションが促進されると期待される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。