Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Multi-Agent Inverse Reinforcement Learning via Actor-Attention-Critic

Wonseok Jeon, Paul Barde|arXiv (Cornell University)|2020. 02. 24.
Reinforcement Learning in Robotics참고 문헌 27인용 수 7
한 줄 요약

이 논문은 다수의 에이전트 환경에서 훈련 효율성과 확장성을 향상시키기 위해 다중에이전트 액터-어텐션-크리틱(MAAC)을 활용한 확장 가능하고 샘플 효율적인 다중에이전트 역강화학습(MA-DAAC) 방법을 제안한다. 분산형 디스criminator와 어텐션 기반 크리틱을 사용함으로써, MA-DAAC는 환경 상호작용 횟수를 크게 줄이고 전문가 행동을 더 잘 모방하면서도 소규모 및 대규모 다중에이전트 환경에서 기존 방법들보다 뛰어난 성능을 달성한다.

ABSTRACT

Multi-agent adversarial inverse reinforcement learning (MA-AIRL) is a recent approach that applies single-agent AIRL to multi-agent problems where we seek to recover both policies for our agents and reward functions that promote expert-like behavior. While MA-AIRL has promising results on cooperative and competitive tasks, it is sample-inefficient and has only been validated empirically for small numbers of agents -- its ability to scale to many agents remains an open question. We propose a multi-agent inverse RL algorithm that is more sample-efficient and scalable than previous works. Specifically, we employ multi-agent actor-attention-critic (MAAC) -- an off-policy multi-agent RL (MARL) method -- for the RL inner loop of the inverse RL procedure. In doing so, we are able to increase sample efficiency compared to state-of-the-art baselines, across both small- and large-scale tasks. Moreover, the RL agents trained on the rewards recovered by our method better match the experts than those trained on the rewards derived from the baselines. Finally, our method requires far fewer agent-environment interactions, particularly as the number of agents increases.

연구 동기 및 목표

  • 기존의 다중에이전트 역강화학습(MA-AIRL) 방법들이 겪는 샘플 비효율성과 낮은 확장성 문제를 해결하기 위해.
  • 기본 방법의 MACK 알고리즘을 더 효율적인 다중에이전트 강화학습(MARL) 프레임워크로 대체하여 다중에이전트 IRL의 샘플 효율성과 확장성을 향상시키기 위해.
  • 분산형 훈련 환경에서 어텐션 기반 중심 크리틱을 활용해 더 적은 전문가 예시로도 강건한 역학습을 가능하게 하기 위해.
  • MA-DAAC에서 학습된 보상 함수가 이전 방법들보다 더 뛰어난 정책 성능을 낼 수 있음을 보여주기 위해.
  • 중앙집중적 관측 접근 없이도 분산형 디스criminator가 협업 패턴을 효과적으로 포착할 수 있는지 검증하기 위해.

제안 방법

  • 이 방법은 다수의 에이전트에 스케일링 가능한 오프-폴리시 다중에이전트 강화학습(MARL) 알고리즘인 다중에이전트 액터-어텐션-크리틱(MAAC)을 사용한다. 이는 공유 어텐션 메커니즘을 통해 대규모 에이전트 수에 대응한다.
  • 에이전트가 생성한 궤적과 전문가 궤적을 구분하는 적대적 역강화학습 프레임워크를 통합한다. 이때 연합 관측값과 행동을 사용한다.
  • MAAC의 크리틱 네트워크는 다중 헤드 자기어텐션을 사용하여 에이전트 간의 의존성을 모델링함으로써 고차원 연합 행동 공간에서 효율적인 가치 함수 근사가 가능해진다.
  • 정책은 디스criminator에서 유도된 보상 신호를 사용해 정책 그래디언트 업데이트를 통해 최적화되며, 디스criminator는 전문가 행동 분포와 에이전트 행동 분포 간의 차이를 최소화하도록 훈련된다.
  • 이 프레임워크는 개별 에이전트의 관측값과 행동을 기반으로 작동하는 분산형 디스criminator를 사용하여 입력 차원을 감소시키고 확장성을 향상시킨다.
  • 이 방법은 복구된 보상 함수의 품질을 평가하기 위해 새로운 성능 지표인 재훈련 점수(NSS)를 사용하여 평가된다.

실험 결과

연구 질문

  • RQ1다양한 수의 에이전트에서 최신 기술 대비 더 뛰어난 샘플 효율성을 달성할 수 있는 다중에이전트 IRL 방법이 존재하는가?
  • RQ2분산형 MARL 프레임워크 내에서 어텐션 기반 크리틱을 사용할 경우 다중에이전트 역강화학습의 확장성과 성능이 향상되는가?
  • RQ3제한된 전문가 예시 수에서 MA-DAAC의 성능은 MA-AIRL에 비해 모방 품질과 보상 복구 측면에서 어떻게 다른가?
  • RQ4특히 부분관측 환경에서 중앙집중적 관측 접근 없이도 분산형 디스criminator가 협업 패턴을 효과적으로 학습할 수 있는가?
  • RQ5역강화학습에서 전문가 수준의 행동을 달성하기 위해 학습된 보상과 진정한 보상 간의 높은 상관관계가 필수 조건인가?

주요 결과

  • MA-DAAC는 모든 작업에서 MA-AIRL보다 유의미하게 높은 재훈련 점수(NSS)를 달성하여, 복구된 보상 기반으로 훈련된 정책이 전문가 행동을 더 잘 모방함을 시사한다.
  • 에이전트 수가 증가함에 따라 MA-AIRL 대비 최대 50%까지 에이전트-환경 상호작용 횟수를 줄일 수 있다.
  • MA-DAAC는 전문가 예시가 단 10개일 때도 MA-AIRL보다 뛰어난 성능을 유지한다. 반면 MA-AIRL는 저자료 환경에서 급격히 성능이 저하된다.
  • 학습된 보상과 진정한 보상 간 피어슨 상관계수는 성능을 신뢰할 만한 지표가 아니며, 높은 상관계수라도 전문가 수준의 모방을 보장하지는 않는다.
  • 어 attention 기반 크리틱을 갖춘 분산형 디스criminator는 부분관측 환경(예: 협동 통신)에서도 다중에이전트 작업에서 협업 패턴을 효과적으로 포착한다.
  • 어텐션 메커니즘의 사용은 에이전트 상호작용 간 일반화를 가능하게 하여 샘플 효율성을 유지하면서도 확장성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.