Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-agent Deep Reinforcement Learning with Extremely Noisy Observations

Ozsel Kilinc, Giovanni Montana|arXiv (Cornell University)|2018. 12. 03.
Reinforcement Learning in Robotics참고 문헌 21인용 수 21
한 줄 요약

이 논문은 극도로 노이즈가 많고 부분적인 관찰 조건에서 동시에 최적의 정책과 통신 전략을 학습할 수 있는 다중 에이전트 강화학습 알고리즘인 MADDPG-M을 제안한다. 내재된 보상 신호와 계층적 정책 학습을 통합한 이중 수준 학습 메커니즘을 통해 에이전트는 정보성 있는 관찰을 선택적으로 공유할 수 있으며, 복잡하고 비정상적인 환경에서 오라클 기반 성능과 유사한 성능을 달성한다. 가장 도전적인 시나리오에서는 통신 정확도가 최대 88.82%에 이르렀다.

ABSTRACT

Multi-agent reinforcement learning systems aim to provide interacting agents with the ability to collaboratively learn and adapt to the behaviour of other agents. In many real-world applications, the agents can only acquire a partial view of the world. Here we consider a setting whereby most agents' observations are also extremely noisy, hence only weakly correlated to the true state of the environment. Under these circumstances, learning an optimal policy becomes particularly challenging, even in the unrealistic case that an agent's policy can be made conditional upon all other agents' observations. To overcome these difficulties, we propose a multi-agent deep deterministic policy gradient algorithm enhanced by a communication medium (MADDPG-M), which implements a two-level, concurrent learning mechanism. An agent's policy depends on its own private observations as well as those explicitly shared by others through a communication medium. At any given point in time, an agent must decide whether its private observations are sufficiently informative to be shared with others. However, our environments provide no explicit feedback informing an agent whether a communication action is beneficial, rather the communication policies must also be learned through experience concurrently to the main policies. Our experimental results demonstrate that the algorithm performs well in six highly non-stationary environments of progressively higher complexity, and offers substantial performance gains compared to the baselines.

연구 동기 및 목표

  • 에이전트가 환경에 대해 약한 상관관계를 가지며 부분적인 시각만을 제공하는 극도로 노이즈가 많은 관찰 조건에서 다중 에이전트 강화학습의 과제를 해결하기 위해.
  • 에이전트가 통신의 질에 대한 명시적 피드백 없이도, 언제 무엇을 공유할지 학습할 수 있도록 보장하기 위해.
  • 비정상적이고 부분적으로 관찰 가능한 환경에서 행동 정책과 통신 전략을 동시에 최적화하는 동시 학습 프레임워크를 개발하기 위해.
  • 독립적 학습 및 기준선 방법이 높은 노이즈와 복잡성 조건에서 실패하는 데 기인한 한계를 극복하기 위해.
  • 노이즈가 많고 협업적인 다중 에이전트 시스템에서 임의의 작업 성공을 위해 학습된 통신을 통한 지능적인 정보 필터링이 필수적임을 입증하기 위해.

제안 방법

  • 에이전트가 관찰을 공유할 수 있는 통신 매체를 MADDPG 프레임워크에 통합함으로써, 개인적 정보와 공유된 정보를 기반으로 공동 정책 학습을 가능하게 한다.
  • 이중 정책 아키텍처를 적용: 하나는 행동(μ)을 위한 정책이고, 다른 하나는 통신 결정(ν)을 위한 정책이며, 양자 모두 딥 결정적 정책 그라디언트를 사용해 동시에 학습된다.
  • 통신 정책 학습을 이끄는 데 내재된 보상 신호를 사용하여, 공유된 관찰치가 향후 결과를 향상시키는지 여부에 대한 피드백을 제공한다.
  • 행동과 통신 결정 간의 계층적 의존성 문제를 다루기 위해 학습 과정의 다양한 수준에서 시간 추상화를 적용한다.
  • 통신 정책은 노이즈가 많은 관찰치를 필터링하여 정보성 있고 집단 성능 향상에 기여할 가능성이 높은 관찰만을 공유하도록 학습한다.
  • 중앙 집중적 훈련, 분산 실행(CTDE) 파라다임을 사용하여 훈련 시 모든 에이전트의 관찰에 완전히 액세스할 수 있도록 하되, 테스트 시에는 분산성을 유지한다.

실험 결과

연구 질문

  • RQ1통신 품질에 대한 명시적 피드백이 제공되지 않는 환경에서, 극도로 노이즈가 많고 부분적인 관찰 조건에서 다중 에이전트 강화학습이 성공할 수 있는가?
  • RQ2행동 정책과 통신 전략을 동시에 학습하는 것이 독립적 또는 고정된 통신 기반 대비 성능을 어떻게 향상시키는가?
  • RQ3높은 노이즈와 비정상성 조건 하에서 에이전트가 관찰을 필터링하고 선택적으로 공유함으로써 집단 작업 성능을 얼마나 향상시킬 수 있는가?
  • RQ4통신 정확도가 작업 성공에 어떤 영향을 미치며, 감독 없이도 근접 최적의 통신 행동을 달성할 수 있는가?
  • RQ5환경의 복잡도(예: 동적 대 정적, 브로드캐스트 대 유니캐스트)는 효과적인 통신 전략 학습에 어떤 영향을 미치는가?

주요 결과

  • MADDPG-M는 모든 6개 환경에서 오라클 DDPG-OC 기반 성능과 유사한 성능을 달성했으며, 특히 가장 복잡한 동적 및 유니캐스트 시나리오에서도 성능을 유지를 하였다.
  • 가장 도전적인 브로드캐스트 시나리오에서 MADDPG-M는 최적의 통신 행동을 88.82%의 비율로 선택했으며, 이는 작업 수행에 충분했다.
  • 동적-유니캐스트 시나리오에서는 전체 최적 통신 패턴을 식별하는 데 정확도가 28.98%에 그쳤지만, 개별 통신 행동의 정확도가 64.23%에 이르러 에이전트들은 여전히 성공을 달성했다.
  • IQL 및 메타에이전트와 같은 기준선 방법은 노이즈가 많은 관찰로 인한 보상 신호의 열화로 인해 복잡하거나 동적 환경에서 합리적인 행동을 학습하지 못했다.
  • 알고리즘은 환경의 복잡도 증가에 대해 뛰어난 내성적 안정성을 보였으며, 특히 충돌과 협업 요구가 더 높은 유니캐스트 설정에서 기준선이 붕괴되는 동안 성능이 안정을 유지했다.
  • 내재된 보상 신호의 사용은 통신 정책이 완전히 최적화되기 이르기 전에도 환경의 동역학을 조기에 학습할 수 있게 했으며, 행동과 통신 학습 간에 상호 긍정적 피드백 루프를 형성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.