Skip to main content
QUICK REVIEW

[논문 리뷰] Learning for Multi-robot Cooperation in Partially Observable Stochastic Environments with Macro-actions

Miao Liu, Kavinayan Sivakumar|arXiv (Cornell University)|2017. 07. 24.
Reinforcement Learning in Robotics참고 문헌 9인용 수 4
한 줄 요약

이 논문은 부분적으로 관찰 가능한 확률적 환경에서 이종 로봇의 다중로봇 조율을 위한 매크로액션 유한상태제어기(FSCs)를 궤적 데이터만을 사용하여 학습하는 반복적 샘플링 기반 기대최대화(EM) 알고리즘인 iSEM을 제안한다. 동적 자원 재할당과 함께 동시 EM 반복을 통해 이전 방법들인 PoEM의 국소 수렴 문제를 극복하여 시뮬레이션 및 하드웨어 기반의 구조물 붕괴 후 구조 작업에서 뛰어난 성능을 달성한다.

ABSTRACT

This paper presents a data-driven approach for multi-robot coordination in partially-observable domains based on Decentralized Partially Observable Markov Decision Processes (Dec-POMDPs) and macro-actions (MAs). Dec-POMDPs provide a general framework for cooperative sequential decision making under uncertainty and MAs allow temporally extended and asynchronous action execution. To date, most methods assume the underlying Dec-POMDP model is known a priori or a full simulator is available during planning time. Previous methods which aim to address these issues suffer from local optimality and sensitivity to initial conditions. Additionally, few hardware demonstrations involving a large team of heterogeneous robots and with long planning horizons exist. This work addresses these gaps by proposing an iterative sampling based Expectation-Maximization algorithm (iSEM) to learn polices using only trajectory data containing observations, MAs, and rewards. Our experiments show the algorithm is able to achieve better solution quality than the state-of-the-art learning-based methods. We implement two variants of multi-robot Search and Rescue (SAR) domains (with and without obstacles) on hardware to demonstrate the learned policies can effectively control a team of distributed robots to cooperate in a partially observable stochastic environment.

연구 동기 및 목표

  • 모델이 알려져 있지 않은 부분적으로 관찰 가능한 확률적 환경에서 다중로봇 조율을 위한 강건하고 확장 가능한 기반 학습 방법의 부족을 해결하기 위해.
  • 복잡한 실제 도메인에서 PoEM와 같은 기존 강화학습 방법의 국소 최적성 및 초기화 민감성 문제를 극복하기 위해.
  • 전체 시뮬레이터나 Dec-POMDP 모델에 대한 사전 지식 없이 궤적 데이터로부터 효과적으로 학습할 수 있도록 하기 위해.
  • 장기간의 계획 수평 동안 이종 로봇(UGV 및 UAV 포함) 대규모 팀을 대상으로 하드웨어에서 학습된 정책의 실현 가능성과 효과성을 입증하기 위해.
  • 제안된 방법이 복잡한 구조물 붕괴 후 구조 시나리오에서 최신 기반 학습 접근법보다 더 높은 기대 보상을 달성할 수 있음을 검증하기 위해.

제안 방법

  • iSEM은 궤적 데이터(관측값, 매크로액션, 보상)로부터 MacDec-POMDP에서 매크로액션을 위한 유한상태제어기(FSCs)를 반복적 샘플링 기반 기대최대화 프레임워크를 사용해 학습한다.
  • 알고리즘은 피드백을 공유하고 수렴이 불량한 스레드에 대해 계산 자원을 동적으로 재할당하는 동시(다중 스레드) EM 반복을 구현한다.
  • 다른 스레드로부터 피드백을 기반으로 정책 파라미터의 재샘플링을 도입하여 정책 공간 탐색을 향상시키고 국소 최적해를 피한다.
  • 배치 학습 설정에서 적용 가능하여 시범 학습에 적합하며, 장기간의 계획 수평을 포함한 대규모 복잡한 도메인으로 확장 가능하도록 설계되어 있다.
  • iSEM은 지상 및 항공 차량을 포함한 다중로봇 구조물 붕괴 후 구조 도메인에서 시뮬레이션 및 하드웨어 실험을 통해 평가되었다.
  • 운동 캡처 시스템과 투영 기반 시각화를 사용한 맞춤형 시뮬레이션 환경을 활용하여 정책 성능를 검증하고 시연하였다.

실험 결과

연구 질문

  • RQ1알려진 모델이나 전체 시뮬레이터가 없이도 EM 기반 학습 알고리즘이 부분적으로 관찰 가능한 확률적 환경에서 고품질의 다중로봇 정책을 효과적으로 학습할 수 있는가?
  • RQ2동적 자원 할당을 통한 동시 EM 반복은 표준 EM 기반 방법(예: PoEM)에 비해 수렴성과 해의 품질을 어떻게 향상시키는가?
  • RQ3제안된 방법은 이종 로봇과 장기간의 계획 수평을 포함한 실제 하드웨어 구현에 일반화될 수 있는가?
  • RQ4복잡한 구조물 붕괴 후 구조 시나리오에서 iSEM은 기대 보상과 강건성 측면에서 최신 기반 학습 방법보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ5정책 초기화 및 샘플링 전략은 실제 로봇 작업에서 학습 알고리즘의 수렴성과 성능에 어떤 영향을 미치는가?

주요 결과

  • iSEM은 장기간의 계획 수평을 포함한 대규모 다중로봇 구조물 붕괴 후 구조 도메인에서 최신 기반 학습 방법인 PoEM보다 더 높은 기대 보상을 달성하였다.
  • 알고리즘은 더 적은 수의 시범 데이터로도 뛰어난 성능을 보이며, 복잡한 조율 정책 학습에서 샘플 효율성이 향상됨을 시사하였다.
  • Duckiebots(UGV)와 DJI F330 멀티로터 드론(UAV)으로 구성된 팀을 대상으로 한 하드웨어 실험에서 iSEM 정책은 대부분의 시험에서 모든 피해자를 구출하였으며, 피해자 초기 건강 상태가 매우 낮은 경우에만 한 명의 피해자를 잃었다.
  • 피해자 초기 건강 상태가 치명적이지 않은 경우, 정책은 항상 모든 피해자를 구출하였으며, 제한된 통신과 충돌 회피 제약 조건 하에서도 강건함을 확인하였다.
  • 피드백과 동적 자원 할당을 통한 동시 EM 스레드의 사용은 정책 공간 탐색을 향상시켜 초기화 민감성 감소 및 열악한 국소 최적해 회피에 기여하였다.
  • 하드웨어 시험의 영상 시연을 통해 학습된 정책이 부분적으로 관찰 가능한 확률적 환경에서 분산된 로봇 간 효과적인 협업을 가능하게 하여, 방법의 실제 적용 가능성을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.