Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Cooperation in Sequential Prisoner's Dilemmas: a Deep Multiagent Reinforcement Learning Approach

Weixun Wang, Jianye Hao|arXiv (Cornell University)|2018. 03. 01.
Evolutionary Game Theory and Cooperation참고 문헌 25인용 수 16
한 줄 요약

이 논문은 협력이 시간적으로 연장되고 등급화되는 순차적 도덕적 딜레마(Sequential Prisoner’s Dilemma, SPD) 게임에서 상호 협력을 달성하기 위한 딥 다중에이전트 강화학습 접근법을 제안한다. 이 방법은 협력 수준가 다양한 정책을 생성하고 LSTM 기반 인코딩을 통해 협력도 탐지 네트워크를 훈련하기 위해 오프라인 단계를 수행하며, 이후 온라인 단계에서 탐지된 상대방의 협력 수준에 따라 정책을 적응적으로 선택함으로써, 자가대결 및 동적 상대방 상황에서 모두 탄력적인 협력을 달성하면서도 악용을 방지한다.

ABSTRACT

The Iterated Prisoner's Dilemma has guided research on social dilemmas for decades. However, it distinguishes between only two atomic actions: cooperate and defect. In real-world prisoner's dilemmas, these choices are temporally extended and different strategies may correspond to sequences of actions, reflecting grades of cooperation. We introduce a Sequential Prisoner's Dilemma (SPD) game to better capture the aforementioned characteristics. In this work, we propose a deep multiagent reinforcement learning approach that investigates the evolution of mutual cooperation in SPD games. Our approach consists of two phases. The first phase is offline: it synthesizes policies with different cooperation degrees and then trains a cooperation degree detection network. The second phase is online: an agent adaptively selects its policy based on the detected degree of opponent cooperation. The effectiveness of our approach is demonstrated in two representative SPD 2D games: the Apple-Pear game and the Fruit Gathering game. Experimental results show that our strategy can avoid being exploited by exploitative opponents and achieve cooperation with cooperative opponents.

연구 동기 및 목표

  • 협력이 원자적이지 않고 시간적으로 연장되고 등급화되는 현실 세계의 사회적 딜레마를 모델링하여, 고전적 반복적 도덕적 딜레마 게임을 넘어서는 것.
  • 직접 상대방 행동을 관찰할 수 없는 대규모 상태공간 환경에서 직접 관찰 가능한 정책을 갖는 다중에이전트 강화학습의 확장 가능하고 적응형 전략을 개발하는 것.
  • 순차적 행동 기록으로부터 상대방의 협력 수준을 탐지하고, 상호 협력을 촉진하기 위해 적절한 정책을 선택할 수 있도록 하는 것.
  • 필요한 경우에 탈락으로 전환하여 악용자에 대한 탄력성을 확보하고 장기적 손실을 방지하는 것.

제안 방법

  • 실제 사회적 딜레마를 모델링하기 위해 시간적으로 연장되고 등급화된 협력 행동을 갖는 순차적 도덕적 딜레마(SPD) 프레임워크를 제안한다.
  • 오프라인 단계에서 가중치가 부여된 목표 보상과 두 가지 방법(IAC 및 JAC)을 사용하여 다양한 협력 수준을 갖는 기본 정책을 훈련시킨다.
  • 기본 정책에서 정책 생성 방법을 활용하여 연속적인 협력 수준 정책의 집합을 합성한다.
  • 순차적 행동 기록으로부터 상대방의 협력 수준을 추론하기 위해 인코더-디코더 구조를 갖는 LSTM 기반 협력도 탐지 네트워크를 훈련시킨다.
  • 온라인 단계에서 탐지된 협력 수준을 기반으로 합성된 정책 집합에서 적절한 정책을 선택하여 상대 행동에 적응한다.
  • 실시간 협력도 추정에 기반해 타이트-포-타트 원칙을 SPD에 확장하여 적응형 정책 전환을 가능하게 한다.

실험 결과

연구 질문

  • RQ1협력이 이진적이지 않고 등급화된 시간적으로 연장된 사회적 딜레마에서 상호 협력을 어떻게 달성할 수 있는가?
  • RQ2직접 상대방의 정책을 관찰하지 못하는 상황에서 딥 다중에이전트 강화학습 에이전트가 순차적 행동 기반으로 상대방의 협력 수준을 탐지할 수 있는가?
  • RQ3동적 환경에서 정책을 전환하는 상대방이 존재할 경우, 어떻게 협력을 유지하면서도 악용에 대한 저항력을 확보할 수 있는가?
  • RQ4탐지된 협력 수준에 기반한 적응형 정책 선택 전략이 순수 협력 또는 순수 배신 전략보다 우월한가?

주요 결과

  • 자기대결 상황에서, 모든 초기 정책 조건(특히 둘 다 배신 정책에서 시작하는 가장 도전적인 케이스 포함)에서 에이전트들이 완전한 상호 협력으로 수렴하였다.
  • 사과-배 게임에서, 과일 수확에 따른 강력한 시각적 및 행동적 신호 덕분에 몇 에피소드 내로 완전한 협력으로 수렴하였다.
  • 과일 수거 게임에서는 협력 신호로 빔 방출 빈도에 의존하기 때문에 더 오랜 관찰 시간이 필요하여 수렴까지 더 오래 걸렸다.
  • 전략이 변화하는 상대방과의 대결에서, 순수 협력 전략과 순수 배신 전략보다 높은 평균 보상을 기록하여 효과적인 적응 능력을 입증하였다.
  • 상대방의 정책 전환이 빠를 경우 탐지 정확도가 감소했지만, 장기적인 상호작용 기간에서는 여전히 고정 전략보다 뛰어난 성능를 보였다.
  • 모든 시험 환경에서 제안된 방법의 사회적 복지(보상의 합계)는 순수 협력 전략과 순수 배신 전략 모두를 초월하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.