Skip to main content
QUICK REVIEW

[논문 리뷰] What is the Solution for State-Adversarial Multi-Agent Reinforcement Learning?

Songyang Han, Sanbao Su|arXiv (Cornell University)|2022. 12. 06.
Adversarial Robustness in Machine Learning인용 수 11
한 줄 요약

이 논문은 표준적인 해법 개념(최적 정책 또는 강건한 내쉬 균형 등)이 존재하지 않을 수 있는 공격적인 상태 변형이 존재하는 다중 에이전트 강화 학습 환경을 모델링하기 위해 상태-적대적 마르코프 게임(State-Adversarial Markov Game, SAMG)을 제안한다. 새로운 해법 개념인 강건한 에이전트 정책을 제안하여 공격적인 상태 변형 하에서의 최악의 경우 기대 수익을 최대화하고, 기울기 하강-상승 기반의 RMA3C 알고리즘을 개발하여 이러한 정책을 학습한다. 실험 결과, 상태 공격에 대해 뛰어난 강건성을 확보함을 입증한다.

ABSTRACT

Various methods for Multi-Agent Reinforcement Learning (MARL) have been developed with the assumption that agents' policies are based on accurate state information. However, policies learned through Deep Reinforcement Learning (DRL) are susceptible to adversarial state perturbation attacks. In this work, we propose a State-Adversarial Markov Game (SAMG) and make the first attempt to investigate different solution concepts of MARL under state uncertainties. Our analysis shows that the commonly used solution concepts of optimal agent policy and robust Nash equilibrium do not always exist in SAMGs. To circumvent this difficulty, we consider a new solution concept called robust agent policy, where agents aim to maximize the worst-case expected state value. We prove the existence of robust agent policy for finite state and finite action SAMGs. Additionally, we propose a Robust Multi-Agent Adversarial Actor-Critic (RMA3C) algorithm to learn robust policies for MARL agents under state uncertainties. Our experiments demonstrate that our algorithm outperforms existing methods when faced with state perturbations and greatly improves the robustness of MARL policies. Our code is public on https://songyanghan.github.io/what_is_solution/.

연구 동기 및 목표

  • 공격적인 상태 변형이 존재하는 다중 에이전트 강화 학습의 문제를 체계화하여, 기존의 표준 MARL 가정이 실패하는 상황을 정의한다.
  • 상태 불확실성 하에서 기존의 해법 개념(예: 최적의 에이전트 정책, 강건한 내쉬 균형 등)의 근본적인 한계를 규명한다.
  • 공격적인 상태 변형 하에서 최악의 경우 기대 상태 가치를 최대화하는 새로운 해법 개념인 강건한 에이전트 정책을 제안한다.
  • 기울기 하강-상승 기반의 최소화-최대화 프레임워크에서 동시에 에이전트와 적대자(공격자)를 학습하는 알고리즘인 RMA3C를 설계하고 평가한다.
  • 랜덤 및 공격적인 상태 변형 상황에서 RMA3C가 기존의 기준 대비 강건성을 높이는 것으로 실험적으로 검증한다.

제안 방법

  • 최악의 경우 상태 변형이 존재하는 MARL 환경을 모델링하기 위해 상태-적대적 마르코프 게임(SAMG)을 체계화한다.
  • 공격적인 상태 변형에 대한 최악의 경우 기대 상태 가치를 최대화하는 방식으로 정의된 새로운 해법 개념인 강건한 에이전트 정책을 도입한다.
  • 고정점 추론을 사용하여 유한 상태 및 유한 행동을 가진 SAMG에 대해 강건한 에이전트 정책의 존재를 증명한다.
  • 기울기 하강-상승(GDA) 최적화기를 사용하여 에이전트와 적대자(공격자)를 동시에 학습하는 강건한 다중 에이전트 적대적 액터-크리틱(RMA3C) 알고리즘을 제안한다.
  • 중앙집중식 크리틱을 활용하여 최악의 경우 수익을 추정하고, 적대적인 상태 변형에 기반해 액터 네트워크를 업데이트한다.
  • 에이전트가 최악의 경우 수익을 최대화하고, 적대자가 이를 최소화하는 최소-최대 학습 목표를 사용하여 최악의 상태 공격를 시뮬레이션한다.

실험 결과

연구 질문

  • RQ1공격적인 상태 변형이 존재할 경우, 최적의 에이전트 정책이나 강건한 내쉬 균형과 같은 표준 MARL 해법 개념이 존재하는가?
  • RQ2최악의 상태 불확실성 하에서 다중 에이전트 강화 학습을 위한 잘 정의된 해법 개념을 도출할 수 있는가?
  • RQ3공격적인 상태 변형 하에서도 성능을 유지하는 강건한 정책을 학습하는 것이 가능한가?
  • RQ4다중 에이전트 환경에서 적대적인 상태 공격가 존재할 경우, 최소-최대 학습 목표를 효과적으로 최적화할 수 있는가?
  • RQ5제안된 RMA3C 알고리즘이 공격적인 상태 변형 하에서 기존의 MARL 기준 대비 얼마나 강건성을 향상시키는가?

주요 결과

  • 최적의 에이전트 정책과 강건한 내쉬 균형은 상태-적대적 마르코프 게임(SAMG)에서는 항상 존재하지 않으며, 이는 공격적인 상태 불확실성 하에서 기존 해법 개념의 근본적 한계를 드러낸다.
  • 최악의 경우 기대 상태 가치를 최대화하는 것으로 정의된 제안된 강건한 에이전트 정책은 유한 상태 및 유한 행동을 가진 SAMG에 대해 존재함을 증명하였다.
  • 6에이전트 CN 환경에서 잘 훈련된 공격적인 상태 변형 하에서 RMA3C는 기준 대비 평균 에피소드 보상이 최대 9.57% 높게 기록하였다.
  • 실험 결과, RMA3C는 기존의 MARL 방법에 비해 랜덤 및 공격적인 상태 변형 상황에서 정책의 강건성을 크게 향상시킴을 보였다.
  • 협동적 환경 외에도 비협동적 및 혼합 협동-경쟁 환경에서도 뛰어난 성능을 보이며, 순수 협동적 설정을 넘어서 보다 광범위한 적용 가능성을 시사한다.
  • RMA3C에서 GDA 최적화기를 사용함으로써 효과적인 최소-최대 학습이 가능했지만, 비볼록 비볼록 설정에서의 수렴 문제로 인해 향후 알고리즘 개선의 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.