Skip to main content
QUICK REVIEW

[논문 리뷰] Agent Modelling under Partial Observability for Deep Reinforcement Learning

Georgios Papoudakis, Filippos Christianos|arXiv (Cornell University)|2020. 06. 16.
Reinforcement Learning in Robotics인용 수 13
한 줄 요약

이 논문은 국소적 관측과 행동만을 사용하여 다른 에이전트의 행동을 추론할 수 있도록 하는 딥 강화학습 방법인 국소정보에이전트모델링(LIAM)을 제안한다. 이 방법은 다른 에이전트의 궤적에 직접 접근할 필요 없이도 작동한다. 제어되는 에이전트의 국소 데이터로부터 모델링된 에이전트의 관측과 행동을 재구성하도록 인코더-디코더 네트워크를 훈련시킴으로써, 협동적, 경쟁적, 혼합된 다중에이전트 환경에서 정책 성능을 향상시키며, 전체 관측 가능성을 가진 기준 모델과 유사한 성과를 달성한다.

ABSTRACT

Modelling the behaviours of other agents is essential for understanding how agents interact and making effective decisions. Existing methods for agent modelling commonly assume knowledge of the local observations and chosen actions of the modelled agents during execution. To eliminate this assumption, we extract representations from the local information of the controlled agent using encoder-decoder architectures. Using the observations and actions of the modelled agents during training, our models learn to extract representations about the modelled agents conditioned only on the local observations of the controlled agent. The representations are used to augment the controlled agent's decision policy which is trained via deep reinforcement learning; thus, during execution, the policy does not require access to other agents' information. We provide a comprehensive evaluation and ablations studies in cooperative, competitive and mixed multi-agent environments, showing that our method achieves higher returns than baseline methods which do not use the learned representations.

연구 동기 및 목표

  • 실행 중 다른 에이전트의 관측과 행동에 접근 가능하다는 가정을 하는 기존의 에이전트 모델링 방법의 한계를 해결하기 위해.
  • 에이전트가 제한된 인지 능력과 통신 능력을 가진 부분 관측 환경에서 효과적인 에이전트 모델링을 가능하게 하기 위해.
  • 제어되는 에이전트의 국소적 관측과 행동에서만 다른 에이전트 행동의 표현을 학습하는 방법을 개발하기 위해.
  • 이러한 학습된 표현을 딥 강화학습을 통해 제어 에이전트의 의사결정 정책에 통합하기 위해.
  • 협동적, 경쟁적, 혼합된 다양한 다중에이전트 환경에서 방법의 성능을 평가하기 위해.

제안 방법

  • 이 방법은 제어되는 에이전트의 국소적 관측과 행동에서 모델링된 에이전트의 궤적을 압축 표현으로 학습하기 위해 인코더-디코더 아키텍처를 사용한다.
  • 훈련 중에 디코더는 인코딩된 표현을 사용하여 모델링된 에이전트의 관측과 행동을 재구성하며, 인코더는 재구성 오차를 최소화하도록 훈련된다.
  • 훈련 후에는 오직 인코더만 유지되어 제어되는 에이전트의 국소 상태와 행동 이력 기반으로 표현을 생성한다.
  • 이 표현들은 제어되는 에이전트의 정책을 조건화하는 데 사용되며, 이 정책은 에이전트 모델과 함께 딥 강화학습(예: A2C)을 통해 함께 훈련된다.
  • 변동형 하한 경계 없이 재구성 손실을 사용하여 β-VAE나 MMD 정규화의 복잡성을 피한다.
  • 이 방법은 이중 스피커-리스너, 레벨 기반 포식자-도용자, 수정된 고양이-쥐 게임의 세 가지 환경에서 평가된다.

실험 결과

연구 질문

  • RQ1실행 중 제어되는 에이전트가 가용한 국소 정보만으로 효과적인 에이전트 모델링을 달성할 수 있는가?
  • RQ2다른 에이전트의 궤적에 대한 전체 관측 가능성을 가정하는 방법과 비교해, 국소 관측 기반의 에이전트 모델링은 어떤가?
  • RQ3학습된 표현은 협동적, 경쟁적, 혼합된 다중에이전트 환경에서 제어되는 에이전트의 성능 향상에 기여하는가?
  • RQ4인코더의 표현 품질이 후속 정책 성능에 어떤 영향을 미치는가?
  • RQ5모델링된 에이전트가 제어되는 에이전트의 행동에 반응하지 않을 경우, 이 방법의 성능은 어떻게 되는가?

주요 결과

  • LIAM은 기존의 에이전트 모델링을 사용하지 않는 기준 방법에 비해 다중에이전트 환경에서 에피소드 수익을 크게 향상시킨다.
  • 일부 환경에서는 A2C에 LIAM을 적용한 평균 수익이, 실행 중 모델링된 에이전트의 전체 궤적에 접근 가능한 이상적인 기준(FIAM)과 거의 유사한 성능을 달성한다.
  • 이중 스피커-리스너 환경에서 제어되는 에이전트의 색상 자체를 관측하는 모델링된 에이전트의 반응을 통해 스스로의 색상을 추론하는 데 성공한다.
  • 디코더의 제어되는 에이전트의 색상 재구성은 시간이 지남에 따라 변화한다: 초기에는 불확실한 상태(값 ~0.3), t=7에서 파랑 쪽으로 이동, 이후 일관성 없는 반응을 관측한 후 빨간색으로 수정된다.
  • 이 방법은 협동적, 경쟁적, 혼합 환경 모두에서 잘 작동하며, 특정 작업 유형을 초월한 일반화 능력을 보여준다.
  • 모델링된 에이전트가 제어되는 에이전트의 행동에 반응하지 않을 경우, LIAM은 실패한다. 이는 모델링된 에이전트의 궤적을 추론할 수 있는 정보가 없기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.