Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Multi-Robot Collaboration with Large Language Models: Centralized or Decentralized Systems?

Yongchao Chen, Jacob Arkin|arXiv (Cornell University)|2023. 09. 27.
Natural Language Processing Techniques인용 수 7
한 줄 요약

이 논문은 확장 가능한 다중 로봇 작업 계획을 위한 LLM 기반 프레임워크 네 가지—중앙집중형, 분산형, 그리고 두 가지 하이브리드 변종—을 제안하고 평가한다. 하이브리드 프레임워크, 특히 로봇별로 국소 피드백을 중앙 계획자에게 제공하는 HMAS-2가 2D 및 3D 다중 로봇 환경 전반에서 더 높은 작업 성공률과 더 나은 확장성을 달성하며 순수 중앙집중형 또는 분산형 접근 방식을 능가한다.

ABSTRACT

A flurry of recent work has demonstrated that pre-trained large language models (LLMs) can be effective task planners for a variety of single-robot tasks. The planning performance of LLMs is significantly improved via prompting techniques, such as in-context learning or re-prompting with state feedback, placing new importance on the token budget for the context window. An under-explored but natural next direction is to investigate LLMs as multi-robot task planners. However, long-horizon, heterogeneous multi-robot planning introduces new challenges of coordination while also pushing up against the limits of context window length. It is therefore critical to find token-efficient LLM planning frameworks that are also able to reason about the complexities of multi-robot coordination. In this work, we compare the task success rate and token efficiency of four multi-agent communication frameworks (centralized, decentralized, and two hybrid) as applied to four coordination-dependent multi-agent 2D task scenarios for increasing numbers of agents. We find that a hybrid framework achieves better task success rates across all four tasks and scales better to more agents. We further demonstrate the hybrid frameworks in 3D simulations where the vision-to-text problem and dynamical errors are considered. See our project website https://yongchao98.github.io/MIT-REALM-Multi-Robot/ for prompts, videos, and code.

연구 동기 및 목표

  • 로봇 수와 작업 수평이 증가함에 따라 LLM 기반 다중 로봇 계획의 확장성 한계를 해결하기 위해.
  • 중앙집중형, 분산형, 하이브리드와 같은 다양한 통신 및 계획 아키텍처가 작업 성공률과 토큰 효율성에 미치는 영향을 조사하기 위해.
  • 문맥 길이와 이전 대화 기록이 다중 에이전트 협업에서 LLM 추론 성능에 미치는 영향을 평가하기 위해.
  • 2D 시뮬레이션된 창고 작업과 3D 조작 작업에서 하이브리드 프레임워크의 효과성을 입증하기 위해.
  • 에이전트 수가 증가함에 따라 성능를 유지하면서도 토큰 효율적이고 일반화 가능한 계획 프레임워크를 제공하기 위해.

제안 방법

  • 네 가지 프레임워크 제안: DMAS(분산형 다중 에이전트 시스템), CMAS(중앙집중형 다중 에이전트 시스템), HMAS-1(중앙 계획 프리밍이 있는 분산형), HMAS-2(로봇별로 국소 피드백을 받는 중앙집중형).
  • 각 계획 단계에서 모든 로봇의 다음 동작을 공동으로 결정하기 위해 LLM 에이전트 간 반복적이고 턴 기반 대화를 사용한다.
  • 이전 라운드의 상태-행동 기록만 유지하는 절단된 프롬프트 전략을 도입하여 문맥 길이를 줄이고 토큰 효율성을 향상시킨다.
  • 수동으로 정의된 함수를 사용하여 환경 관측치와 로봇 능력을 LLM 입력용 자연어 프롬프트로 매핑한다.
  • 사전 정의된 동작 매핑을 통해 LLM이 생성한 텍스트 출력을 실행 가능한 로봇 동작으로 변환한다.
  • 2D 창고 유사 작업과 3D PyBullet 시뮬레이션(비전 투 텍스트 인식(ViLD) 및 동적 실행 오류 포함)에서 프레임워크를 평가한다.
Figure 1: Simplified prompt example of the HMAS-1 local agent. The acquired ’Response1’ acts as the initial plan, or otherwise sent to the next local agent for further discussion.
Figure 1: Simplified prompt example of the HMAS-1 local agent. The acquired ’Response1’ acts as the initial plan, or otherwise sent to the next local agent for further discussion.

실험 결과

연구 질문

  • RQ1로봇 수가 증가함에 따라 중앙집중형, 분산형, 하이브리드 LLM 기반 계획 프레임워크는 작업 성공률과 확장성 측면에서 어떻게 비교되는가?
  • RQ2문맥 길이와 이전 대화 기록은 다중 로봇 협업에서 LLM 추론 성능에 어떤 영향을 미치는가?
  • RQ3중앙 계획과 국소 LLM 피드백을 결합한 하이브리드 프레임워크는 순수 중앙집중형 또는 분산형 시스템에 비해 성공률과 확장성 측면에서 향상되는가?
  • RQ43D 환경에서의 비전 투 텍스트 인식과 동적 오류는 LLM 기반 계획 프레임워크의 강건성에 어떤 영향을 미치는가?
  • RQ5절단된 프롬프트 전략은 성능 저하 없이 토큰 효율성을 얼마나 향상시키는가?

주요 결과

  • 로봇별로 국소 피드백을 받는 중앙 LLM을 사용하는 하이브리드 프레임워크 HMAS-2는 3D 시뮬레이션에서 3대 및 6대의 로봇을 대상으로 100%의 작업 성공률를 기록했다.
  • 6대의 로봇을 사용한 3D 시뮬레이션에서 CMAS는 평균 1.39의 정규화된 동작 단계를 필요로 했지만, HMAS-2는 단지 1.03으로 더 높은 계획 효율성을 보였다.
  • 6대 로봇 케이스에서 HMAS-2는 2.65의 정규화된 API 호출과 1.31의 정규화된 토큰을 사용했으며, CMAS(1.0과 1.18)에 비해 더 높은 복잡성에도 불구하고 더 나은 토큰 효율성을 보였다.
  • 하이브리드 HMAS-1 프레임워크는 모든 4개의 2D 작업에서 순수 분산형 DMAS보다 성공률가 향상되었고, 에이전트 수 증가에 따라 더 나은 확장성을 보였다.
  • 모든 프레임워크는 3D 시뮬레이션에서 동적 오류에 대해 강건성을 보였으며, 반복적 계획이 동작 실패 시 효과적인 재계획을 가능하게 했다.
  • 절단된 프롬프트 전략은 성능 저하 없이 문맥 길이를 효과적으로 줄였으며, 토큰 예산 제약 하에서의 확장성 지원에 기여했다.
Figure 2: Simplified prompt example of the HMAS-2 central agent. The generated ’Response1’ is sent to local agents for feedback. Once the central-local iteration terminates, the output plan is checked for syntactic correctness.
Figure 2: Simplified prompt example of the HMAS-2 central agent. The generated ’Response1’ is sent to local agents for feedback. Once the central-local iteration terminates, the output plan is checked for syntactic correctness.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.