Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Agent Reinforcement Learning with Multi-Step Generative Models

Orr Krupnik, Igor Mordatch|arXiv (Cornell University)|2019. 01. 29.
Reinforcement Learning in Robotics참고 문헌 34인용 수 7
한 줄 요약

이 논문은 연속 제어 과제에서 샘플 효율성을 향상시키고 협력적 및 경쟁적 행동을 학습할 수 있도록 분리된 다단계 생성 모델을 사용하는 다에이전트 강화학습 프레임워크를 제안한다. 궤적 세그먼트를 분리된 잠재 공간에서 모델링함으로써 방법은 에이전트 행동을 독립적으로 최적화할 수 있도록 분리시키며, 제한된 데이터 조건에서도 모델-프리 기반 보다 뛰어난 성능을 보인다.

ABSTRACT

We consider model-based reinforcement learning (MBRL) in 2-agent, high-fidelity continuous control problems -- an important domain for robots interacting with other agents in the same workspace. For non-trivial dynamical systems, MBRL typically suffers from accumulating errors. Several recent studies have addressed this problem by learning latent variable models for trajectory segments and optimizing over behavior in the latent space. In this work, we investigate whether this approach can be extended to 2-agent competitive and cooperative settings. The fundamental challenge is how to learn models that capture interactions between agents, yet are disentangled to allow for optimization of each agent behavior separately. We propose such models based on a disentangled variational auto-encoder, and demonstrate our approach on a simulated 2-robot manipulation task, where one robot can either help or distract the other. We show that our approach has better sample efficiency than a strong model-free RL baseline, and can learn both cooperative and adversarial behavior from the same data.

연구 동기 및 목표

  • 다에이전트 연속 제어 문제에 대한 모델 기반 강화학습(MBRL)에서 오차 누적이 발생하는 문제를 해결하기 위해.
  • 에이전트 간 상호작용을 포착하면서도 각 에이전트 행동의 별도 최적화를 가능하게 하는 생성 모델을 개발하기 위해.
  • 혼합된 협력 또는 경쟁 데이터로 훈련된 단일 다단계 생성 모델이 협력적 및 적대적 정책 학습을 모두 지원할 수 있음을 입증하기 위해.
  • 고정밀 로봇 조작 과제에서 모델-프리 RL 기반 보다 샘플 효율성을 향상시키기 위해.

제안 방법

  • 두 에이전트의 다단계 궤적 세그먼트를 모델링하기 위한 공동 잠재 공간을 학습하기 위해 분리된 변동형 오토인코더(VAE)를 사용한다.
  • 초기 상태와 행동을 기반으로 향후 궤적 세그먼트를 예측하기 위해 조건부 VAE를 사용하며, 잠재 공간은 각 에이전트의 '전략 공간'을 코딩한다.
  • 잠재 변수 간의 분리성을 강제하기 위해 상호정보량의 변동형 하한을 사용하여 두 에이전트의 잠재 변수 간의 분리성을 확보한다.
  • 모델 예측 제어(MPC)를 사용하여 잠재 공간에서 궤적 최적화를 수행하며, 환경에서 실행할 첫 번째 행동 세그먼트를 선택한다.
  • 모델은 협력적 및 경쟁적 시나리오의 데이터를 종합적으로 훈련하여 작업 간 공유된 모델 학습을 가능하게 한다.
  • 추론 중 보상 재가중을 통해 동일한 데이터셋에서 협력적 및 적대적 행동 학습을 모두 지원한다.

실험 결과

연구 질문

  • RQ1다단계 생성 모델은 다에이전트 연속 제어 과제로 확장 가능할 수 있으며, 에이전트 간의 분리성이 유지되는가?
  • RQ2에이전트 행동의 독립적 최적화가 가능하도록 하면서도 잠재 공간에 에이전트 간 상호작용을 어떻게 포착할 수 있는가?
  • RQ3혼합된 협력 및 경쟁 데이터로 훈련된 단일 모델이 협력적 및 적대적 정책 학습을 모두 지원할 수 있는가?
  • RQ4제안된 방법은 다에이전트 환경에서 모델-프리 RL 기반 보다 더 뛰어난 샘플 효율성을 달성하는가?
  • RQ5분리된 잠재 표현은 다에이전트 환경에서 전략적 행동을 효과적으로 인코딩할 수 있는가?

주요 결과

  • 제안된 MBRL 방법은 협력적 및 경쟁적 2로봇 조작 과제에서 모두 MFRL 기반 보다 뛰어난 성능을 보였으며, 평균 보상이 더 높았다.
  • 단지 650,000 훈련 스텝만으로도 협력 과제에서 MBRL 모델은 평균 보상 -0.72 ± 0.44를 기록했으며, 이는 MADDPG의 -1.79 ± 0.76보다 뛰어났다.
  • 경쟁 과제에서 협력 데이터로 훈련된 MBRL 모델(co-op)은 'keep' 과제에서 7.77 ± 3.12의 점수를 기록했으며, MADDPG 기반 보다 뛰어났다.
  • 경쟁 데이터로 훈련된 MBRL 모델(comp)은 'keep' 과제에서 8.26 ± 2.81의 점수를 기록했으며, MADDPG 기반 보다 뚜렷이 뛰어났다.
  • 이 방법은 샘플 효율성이 향상되었으며, 더 적은 데이터로 훈련했을 때도 뚜렷한 성능 우위를 보였다.
  • 생성된 궤적의 시각화 결과는 잠재 공간이 명확한 전략을 인코딩하고 있음을 확인했으며, 이는 잠재 공간이 전략 공간으로 해석될 수 있음을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.