Skip to main content
QUICK REVIEW

[논문 리뷰] Agent as Cerebrum, Controller as Cerebellum: Implementing an Embodied LMM-based Agent on Drones

Haoran Zhao, Fengxing Pan|arXiv (Cornell University)|2023. 11. 25.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 산업용 드론 응용을 위해 대규모 다중모态 모델(LMM) 기반 에이전트인 AeroAgent를 활용하는 새로운 '에이전트를 뇌로, 제어기를 소뇌로' 하는 아키텍처를 제안한다. 고수준 추론(에이전트)과 실시간 제어(제어기)를 분리하고, 고유의 ROSchain 프레임워크를 통해 통합함으로써, 검색 및 구조 작업과 같은 복잡한 실제 작업에서 DRL 기반 에이전트보다 뛰어난 성능을 달성한다. 시뮬레이션(Airgen) 및 실제 환경 시험 모두에서 슈퍼리어한 성능을 보였다.

ABSTRACT

In this study, we present a novel paradigm for industrial robotic embodied agents, encapsulating an 'agent as cerebrum, controller as cerebellum' architecture. Our approach harnesses the power of Large Multimodal Models (LMMs) within an agent framework known as AeroAgent, tailored for drone technology in industrial settings. To facilitate seamless integration with robotic systems, we introduce ROSchain, a bespoke linkage framework connecting LMM-based agents to the Robot Operating System (ROS). We report findings from extensive empirical research, including simulated experiments on the Airgen and real-world case study, particularly in individual search and rescue operations. The results demonstrate AeroAgent's superior performance in comparison to existing Deep Reinforcement Learning (DRL)-based agents, highlighting the advantages of the embodied LMM in complex, real-world scenarios.

연구 동기 및 목표

  • 엔드 투 엔드 딥 강화 학습(DRL) 기반 에이전트의 산업용 드론 응용에서의 한계, 즉 일반화 능력 부족, 느린 추론 속도, 시뮬레이션에서 실제 환경으로의 전이 문제를 해결하기 위해.
  • 대규모 다중모달 모델(LMM)을 활용해 드론에서 고수준 추론과 작업 계획 수립을 가능하게 하되, 실시간 제어는 기존의 로봇 제어기로 외부 위임하기 위해.
  • LMM 기반 에이전트와 실제 로봇 시스템 간의 격차를 해소하기 위해, ROS 통신을 원활하게 지원하는 전용 통합 프레임워크인 ROSchain을 개발하기 위해.
  • 특히 동적인 비정형 환경인 검색 및 구조 작업과 같은 실제 산업 환경에서 복잡한 작업을 수행하는 데 있어 제안된 아키텍처의 유효성을 검증하기 위해.

제안 방법

  • 고수준 추론과 작업 계획을 지원하기 위해 다중모달 메모리, 몸체화된 계획 생성기, 통합 동작 라이브러리로 구성된 에이전트 아키텍처인 AeroAgent를 설계한다.
  • LMM 기반 에이전트를 전략적 의사결정을 위한 '뇌'로, 드론의 내장 비행 제어기를 실시간 저수준 액추에이션을 위한 '소뇌'로 기능하도록 분리된 제어 철학을 적용한다.
  • LMM 기반 에이전트와 로봇 운영 체제(ROS) 간의 안전하고 저지연 통신을 가능하게 하는 커스터마이징된 미들웨어 프레임워크인 ROSchain을 개발한다. 이는 기존 드론 제어 스택과의 호환성을 보장한다.
  • 하이브리드 계획 수립 메커니즘을 활용: 에이전트가 다중모달 추론을 통해 고수준 웨이포인트와 작업 순서를 생성하고, 이를 드론의 내장 제어 시스템을 통해 실행한다.
  • 재학습 없이도 새로운 또는 알려지지 않은 시나리오에 적응하기 위해, 에이전트의 메모리 및 계획 모듈에서 소수의 예제 학습과 내성적 추론을 활용한다.
  • 장애물 회피 및 우선순위 관리를 비행 제어 레이어에 통합하여, 작업 실행 중 안전한 항로 확보를 보장한다.

실험 결과

연구 질문

  • RQ1LMM 기반 에이전트가 저수준 액추에이터를 직접 제어하지 않더라도 산업용 드론에서 복잡한 고수준 작업을 효과적으로 관리할 수 있는가?
  • RQ2분리된 에이전트-제어기 아키텍처는 엔드 투 엔드 DRL 기반 에이전트에 비해 실제 드론 응용에서 성능과 내구성을 어떻게 향상시키는가?
  • RQ3ROSchain 프레임워크는 LMM 에이전트와 ROS 기반 로봇 시스템 간의 신뢰성 있고 저지연 통합을 어느 정도 가능하게 하는가?
  • RQ4에이전트는 비정형이고 실제 환경에 가까운 설정, 예를 들어 검색 및 구조 작업에서 새로운 작업과 환경으로의 일반화 능력이 얼마나 뛰어난가?
  • RQ5에이전트의 다중모달 메모리와 계획 모듈이 소수의 예제 학습을 통한 적응력 향상과 작업 일반화에 기여하는 정도는 어느 정도인가?

주요 결과

  • AeroAgent는 시뮬레이션(Airgen) 및 실제 환경에서의 검색 및 구조 작업 모두에서 기존 DRL 기반 에이전트를 능가했으며, 더 높은 작업 완료율과 내구성을 입증했다.
  • 추가 실험을 통해 ROSchain가 시스템 안정성과 통신 효율성을 크게 향상시켜 지연을 감소시키고 실시간 반응성을 향상시킨다는 것이 확인되었다.
  • 에이전트의 다중모달 메모리는 새로운 작업에 대한 효과적인 소수의 예제 학습을 가능하게 하여 재학습이나 피팅 없이도 성공적인 실행을 이끌었다.
  • 분리된 아키텍처는 실시간 제어 성능(10ms 이내 응답)을 달성하여 직접 LMM 제어 방식의 지연 문제를 해결했다.
  • 실제 환경 시험에서 장애물 회피 및 작업 우선순위 설정이 안정적으로 작동하여 비행 안정성과 임무 무결성을 유지했다.
  • 이 프레임워크는 복잡하고 비정형 환경에서도 효과적으로 작동했으며, 전력선 점검 및 자율 드론 군집 제어와 같은 산업 응용 분야의 잠재력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.