Skip to main content
QUICK REVIEW

[논문 리뷰] Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond

Liang Chen, Yichi Zhang|arXiv (Cornell University)|2023. 10. 03.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 인지, 인지, 행동 분야에서의 몸이 있는 의사결정을 평가하기 위한 다중 도메인 벤치마크인 PCA-EVAL을 소개하고, LLM이 다중 모odal API를 활용할 수 있도록 하는 다중 에이전트 프레임워크인 HOLMES를 제안한다. GPT-4-Vision은 종단 간 의사결정에서 GPT-4-HOLMES보다 평균 정확도 +3%를 기록하며 최신 기술 수준의 성능을 보이며, 특히 시각적 이해 분야에서 뛰어난 성능을 보이지만, 여전히 독점 모델에 국한되어 있다.

ABSTRACT

In this study, we explore the potential of Multimodal Large Language Models (MLLMs) in improving embodied decision-making processes for agents. While Large Language Models (LLMs) have been widely used due to their advanced reasoning skills and vast world knowledge, MLLMs like GPT4-Vision offer enhanced visual understanding and reasoning capabilities. We investigate whether state-of-the-art MLLMs can handle embodied decision-making in an end-to-end manner and whether collaborations between LLMs and MLLMs can enhance decision-making. To address these questions, we introduce a new benchmark called PCA-EVAL, which evaluates embodied decision-making from the perspectives of Perception, Cognition, and Action. Additionally, we propose HOLMES, a multi-agent cooperation framework that allows LLMs to leverage MLLMs and APIs to gather multimodal information for informed decision-making. We compare end-to-end embodied decision-making and HOLMES on our benchmark and find that the GPT4-Vision model demonstrates strong end-to-end embodied decision-making abilities, outperforming GPT4-HOLMES in terms of average decision accuracy (+3%). However, this performance is exclusive to the latest GPT4-Vision model, surpassing the open-source state-of-the-art MLLM by 26%. Our results indicate that powerful MLLMs like GPT4-Vision hold promise for decision-making in embodied agents, offering new avenues for MLLM research. Code and data are open at https://github.com/pkunlp-icler/PCA-EVAL/.

연구 동기 및 목표

  • 다중 모달 환경에서 인지, 인지, 행동 분야에서 몸이 있는 의사결정을 평가하기 위한 종합적인 벤치마크 부족 문제를 해결하기 위해.
  • 최신 기술 수준의 다중 모달 대규모 언어 모델(MLLM)이 모odal 전환 없이 종단 간 몸이 있는 의사결정을 수행할 수 있는지 조사하기 위해.
  • 다중 에이전트 프레임워크를 통해 LLM과 MLLM 간 협업이 의사결정 성능 향상에 기여하는지 탐색하기 위해.
  • 특히 안전이 중요한 상황에서 에이전트의 의사결정이 인간의 가치와 얼마나 일치하는지 평가하기 위해.

제안 방법

  • 자율 주행, 가정 보조, 게임 플레이 등 세 가지 도메인에서 구성된 300개의 인스턴스를 포함하는 벤치마크인 PCA-EVAL을 제안하며, 이미지, 질문, 행동 후보, 정답, 추론, 핵심 개념으로 구성된 6개 요소의 튜플로 구성된다.
  • 순차적 의사결정을 일단계 문제로 분해할 수 있도록 작업 전용 토폴로지 그래프를 설계하여 최종 보상 이외의 세분화된 평가를 가능하게 한다.
  • LLM이 시각적 및 환경 정보를 확보하기 위해 다중 모달 API 호출(예: 객체 탐지, 내비게이션)을 조율하는 다중 에이전트 협업 프레임워크인 HOLMES를 도입한다.
  • GPT-4와 GPT-4-Vision을 각각 핵심 LLM과 MLLM으로 사용하여 종단 간 추론과 API 보강된 추론의 의사결정 성능를 비교한다.
  • 평가 지표로 인지, 인지, 행동 점수를 사용하며, 다양한 모델과 도메인 간 비교를 위해 점수를 1.0으로 정규화한다.
  • 모달 갭 완화, 인간 가치와의 의사결정 일치도, 다단계 추론에서의 오류 전파 분석을 위한 사례 연구를 수행한다.
Figure 1: Domain and required ability distribution of PCA-EVAL.
Figure 1: Domain and required ability distribution of PCA-EVAL.

실험 결과

연구 질문

  • RQ1GPT-4-Vision과 같은 최신 기술 수준의 다중 모달 대규모 언어 모델이 종단 간 몸이 있는 의사결정을 효과적으로 수행할 수 있는가?
  • RQ2종단 간 MLLM 추론은 다중 모달 인식을 위해 API를 사용하는 LLM 기반 다중 에이전트 프레임워크와 비교해 어떻게 다른가?
  • RQ3API를 통한 LLM 접근 방식에 비해 MLLM이 얼마나 모달 갭과 정보 손실을 줄이는가?
  • RQ4특히 횡단보도 내비게이션과 같은 안전이 중요한 상황에서 에이전트의 의사결정은 인간의 가치와 얼마나 일치하는가?

주요 결과

  • GPT-4-Vision은 인지 분야에서 평균 정확도 0.84, 인지 분야에서 0.74, 행동 분야에서 0.74를 기록하며, GPT-4-HOLMES보다 평균 정확도 +3%를 확보한다.
  • GPT-4-Vision은 오픈소스 최신 기술 수준의 MLLM인 MMICL보다 행동 점수에서 26% 향상되어 독점 모델과 오픈소스 모델 간 성능 격차를 입증한다.
  • GPT-4-HOLMES는 인지 점수 0.88을 기록하며, GPT-4-Vision의 0.84를 초월하여 특정 시각적 작업에서 API 보강된 인지가 더 정확할 수 있음을 시사한다.
  • 높은 인지 정확도에도 불구하고 GPT-4-HOLMES는 추론 오류 누적으로 인해 가정 및 게임 도메인에서 인지 점수(0.68)가 GPT-4-Vision(0.74)보다 낮다.
  • 사례 연구 결과, GPT-4-Vision은 공간 관계(예: 주변 차량이 있더라도 안전한 주행)를 정확히 식별하는 반면, API를 통한 GPT-4는 공간적 맥락을 누락하여 잘못된 판단을 내린다.
  • 연구는 중요한 일치하지 않는 점을 밝혀내었는데, GPT-4는 보행자가 없는 횡단보도에서 속도를 유지하도록 권장하여 인간의 안전 기준과 배치된다. 이는 가치 기반 의사결정의 필요성을 강조한다.
Figure 2: An instance of PCA-EVAL.
Figure 2: An instance of PCA-EVAL.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.