Skip to main content
QUICK REVIEW

[論文レビュー] Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond

Liang Chen, Yichi Zhang|arXiv (Cornell University)|Oct 3, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、知覚、認知、行動の分野における体化意思決定を評価するためのマルチドメインベンチマークPCA-EVALを紹介し、LLMがマルチモーダルAPIを活用できるマルチエージェントフレームワークHOLMESを提案する。GPT-4-Visionはエンドツーエンド意思決定においてGPT-4-HOLMESを+3%の平均精度で上回り、特に視覚的理解において最先端のパフォーマンスを示しているが、依然として特許モデルに限定されている。

ABSTRACT

In this study, we explore the potential of Multimodal Large Language Models (MLLMs) in improving embodied decision-making processes for agents. While Large Language Models (LLMs) have been widely used due to their advanced reasoning skills and vast world knowledge, MLLMs like GPT4-Vision offer enhanced visual understanding and reasoning capabilities. We investigate whether state-of-the-art MLLMs can handle embodied decision-making in an end-to-end manner and whether collaborations between LLMs and MLLMs can enhance decision-making. To address these questions, we introduce a new benchmark called PCA-EVAL, which evaluates embodied decision-making from the perspectives of Perception, Cognition, and Action. Additionally, we propose HOLMES, a multi-agent cooperation framework that allows LLMs to leverage MLLMs and APIs to gather multimodal information for informed decision-making. We compare end-to-end embodied decision-making and HOLMES on our benchmark and find that the GPT4-Vision model demonstrates strong end-to-end embodied decision-making abilities, outperforming GPT4-HOLMES in terms of average decision accuracy (+3%). However, this performance is exclusive to the latest GPT4-Vision model, surpassing the open-source state-of-the-art MLLM by 26%. Our results indicate that powerful MLLMs like GPT4-Vision hold promise for decision-making in embodied agents, offering new avenues for MLLM research. Code and data are open at https://github.com/pkunlp-icler/PCA-EVAL/.

研究の動機と目的

  • マルチモーダル環境における知覚、認知、行動の分野における体化意思決定を評価する包括的でないベンチマークの欠如に対処すること。
  • 最先端のマルチモーダル大規模言語モデル(MLLM)が、モality変換を経由せずにエンドツーエンドの体化意思決定を実行できるかどうかを調査すること。
  • マルチエージェントフレームワークを介してLLMとMLLMが協働することで意思決定パフォーマンスが向上するかどうかを検討すること。
  • 特に安全が重要な状況における人間の価値観とエージェントの意思決定の整合性を評価すること。

提案手法

  • 知覚、認知、行動の3分野—自動運転、家庭支援、ゲームプレイ—をカバーする300件のインスタンスを含むPCA-EVALを提案。6要素のタプル(画像、質問、行動候補、正解、推論、キーコンセプト)として構造化される。
  • 逐次的意思決定を1ステップ問題に分解できるように、タスク固有のトポロジー図を設計し、最終報酬を超える細分化された評価を可能にする。
  • LLMがマルチモーダルAPI(例:物体検出、ナビゲーション)のコールを調整するマルチエージェント協働フレームワークHOLMESを導入。
  • GPT-4をコアとなるLLM、GPT-4-VisionをMLLMとして採用し、API補強された意思決定とエンドツーエンド推論の両方を比較する。
  • 知覚、認知、行動スコアを評価指標として用い、モデルやドメイン間での比較を可能にするためにスコアを1.0に正規化する。
  • ケーススタディを通じて、モダリティギャップの低減、人間の価値観との意思決定整合性、マルチステップ推論における誤差伝播を分析する。
Figure 1: Domain and required ability distribution of PCA-EVAL.
Figure 1: Domain and required ability distribution of PCA-EVAL.

実験結果

リサーチクエスチョン

  • RQ1GPT-4-Visionのような最先端のマルチモーダル大規模言語モデルは、エンドツーエンドの体化意思決定を効果的に行えるか?
  • RQ2エンドツーエンドのMLLM推論は、マルチモーダル知覚にAPIを用いるLLMベースのマルチエージェントフレームワークと比べてどのように異なるか?
  • RQ3APIを介したLLMアプローチと比較して、MLLMはどれほどモダリティギャップと情報損失を低減できるか?
  • RQ4エージェントの意思決定は、横断歩道の通行など安全が重要な状況において、人間の価値観とどれほど整合しているか?

主な発見

  • GPT-4-Visionは知覚で平均0.84、認知で0.74、行動で0.74のスコアを達成し、GPT-4-HOLMESを平均精度+3%で上回った。
  • GPT-4-Visionは、オープンソースの最先端MLLMであるMMICLと比較して、行動スコアで26%の向上を示し、特許モデルとオープンソースモデルの間のパフォーマンス格差を裏付けた。
  • GPT-4-HOLMESは知覚スコア0.88を達成し、GPT-4-Visionの0.84を上回り、特定の視覚的タスクにおいてAPI補強された知覚がより正確である可能性を示した。
  • 高い知覚精度にもかかわらず、GPT-4-HOLMESは推論エラーの蓄積により、家庭およびゲーム分野で認知スコアが0.68にとどまり、GPT-4-Visionの0.74より低い水準にとどまった。
  • ケーススタディの結果、GPT-4-Visionは空間的関係(例:近隣の車両が存在するが安全な運転)を正しく識別する一方、GPT-4とAPIを用いたアプローチは空間的文脈の欠落により誤判断を示した。
  • 本研究では、深刻な不整合が特定された:GPT-4は歩行者がいない横断歩道で速度を維持するよう提案しており、人間の安全基準に反する。これは価値に基づいた意思決定の必要性を浮き彫りにした。
Figure 2: An instance of PCA-EVAL.
Figure 2: An instance of PCA-EVAL.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。