Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Reciprocity in Complex Sequential Social Dilemmas

Tom Eccles, Edward Hughes|arXiv (Cornell University)|2019. 03. 19.
Evolutionary Game Theory and Cooperation참고 문헌 50인용 수 22
한 줄 요약

이 논문은 복잡한 순차적 사회적 딜레마에서 상호 행동을 학습하는 온라인 강화학습 알고리즘을 제안한다. 학습된 '정중함 네트워크'를 통해 다른 이의 사회적 영향을 평가하고, 상대의 협력 수준을 따라하려는 내재적 동기를 통해 작용한다. 이 방법은 사전에 정의된 협력/배신 정책이 없이도, 사전에 정의된 협력/배신 정책가 없는 복잡한 환경에서 조율된 사회적 결과를 이끌어내며, 2명과 5명의 마르코프 게임에서 모두 이타적 기반선수보다 뛰어난 성능을 보였다.

ABSTRACT

Reciprocity is an important feature of human social interaction and underpins our cooperative nature. What is more, simple forms of reciprocity have proved remarkably resilient in matrix game social dilemmas. Most famously, the tit-for-tat strategy performs very well in tournaments of Prisoner's Dilemma. Unfortunately this strategy is not readily applicable to the real world, in which options to cooperate or defect are temporally and spatially extended. Here, we present a general online reinforcement learning algorithm that displays reciprocal behavior towards its co-players. We show that it can induce pro-social outcomes for the wider group when learning alongside selfish agents, both in a $2$-player Markov game, and in $5$-player intertemporal social dilemmas. We analyse the resulting policies to show that the reciprocating agents are strongly influenced by their co-players' behavior.

연구 동기 및 목표

  • 간단한 행렬 게임을 초월한 복잡하고 시간이 지속되는 사회적 딜레마에서 작동하는 확장 가능한 온라인 강화학습 접근법을 개발하는 것.
  • 기존의 계획 기반 상호 행동 모델의 한계를 해결하는 것, 예를 들어 사전 훈련된 정책에 의존하거나 이산 전략 전환, 명시적 보상 관찰에 의존하는 것.
  • 협력과 배신이 이진 선택이 아닌 연속적인 행동 환경에서 상호 행동을 학습할 수 있도록 하는 것.
  • 직접 상대의 보상을 관찰하지 못하더라도 내재적 동기를 통해 상대의 사회성 수준을 따라하려는 행동이 유기적으로 발생할 수 있음을 보여주는 것.
  • 이러한 상호 행동을 하는 에이전트가 이타적인 동료와의 협력 관계를 유도하여 다에이전트 환경에서 그룹 수준의 성과를 향상시킬 수 있음을 보여주는 것.

제안 방법

  • 이중 에이전트(혁신자: 이타적, 모방자: 상호 행동)를 동시에 훈련하기 위해 VTrace 보정이 적용된 A3C 기반 강화학습 프레임워크를 사용한다.
  • 모방자는 한 에이전트의 행동이 다른 이의 향후 수익에 미치는 영향을 추정하는 데 사용되는 학습된 '정중함 네트워크'를 활용한다. 이는 사회적 영향의 연속적 측정 기준이 된다.
  • 내재적 동기가 모방자의 행동을 동료의 사회성 수준과 일치시키도록 이끈다. 이는 정중함 네트워크를 통해 측정된다.
  • 정중함 네트워크는 에이전트 자신의 수익과 타인에 미치는 영향을 기반으로 한 자기지도 학습 목표를 통해 훈련되며, 협력의 온라인 평가가 가능해진다.
  • 이 방법은 하드코딩된 전략 전환을 피하고, 타인의 행동에 대해 연속적이고 적응적인 반응을 학습함으로써 복잡한 환경에 대한 확장성을 확보한다.
  • 두 가지 변형을 평가: 사회성에 대한 수작업 특징 사용 버전과 학습된 정중함 네트워크 사용 버전. 후자가 더 뛰어난 일반화 성능을 보였다.

실험 결과

연구 질문

  • RQ1사전 정의된 협력/배신 정책가 없는 복잡한 순차적 사회적 딜레마에서 온라인 강화학습 에이전트가 상호 행동을 학습할 수 있는가?
  • RQ2정중함 네트워크를 통한 사회적 영향 측정이 수작업 특징에 비해 상호 행동을 어떻게 향상시키는가?
  • RQ3상호 행동을 하는 에이전트가 2명과 5명의 마르코프 게임에서 이타적 동료의 이타적 행동을 이끌어낼 수 있는가?
  • RQ4타인의 사회성 수준을 따라하려는 내재적 동기가 시간이 지속되는 사회적 딜레마에서 그룹 수준의 성과를 얼마나 향상시키는가?
  • RQ5연속적인 행동과 지연된 보상이 존재하는 환경에서, 제안된 방법은 amTFT와 같은 계획 기반 접근법에 비해 어떻게 확장 가능한가?

주요 결과

  • 2명 플레이어 환경인 Coins에서 정중함 네트워크 모방자는 협력률 0.994 ± 0.003을 기록했으며, 이는 이타적 기반선수의 0.007 ± 0.001보다 유의미하게 뛰어났다.
  • 정중함 네트워크는 이타적 행동을 정확하게 예측했으며, 동료 플레이어의 동전에 더 가까이 다가가는 행동에 대해 낮은 Q-값을 할당함으로써 사회적 비용을 인식했다.
  • 5명 플레이어 환경인 Cleanup에서 모방자는 협력 성향으로의 전환을 유도했으며, 혁신자(리더)가 상호 행동을 하는 에이전트와 함께 강을 청소하는 경향을 보였다.
  • 이 방법은 협력이 이진 선택이 아닌 환경에서도 상호 행동을 학습했으며, 타인의 협력 수준에 따라 조정 가능한 반응을 가능하게 했다.
  • 정중함 네트워크는 메트릭 매칭 기반선수보다 성능이 뛰어나고, 계획 기반 방법(예: amTFT)이 불가능한 루프아웃으로 인해 어려움을 겪는 복잡한 연속적 행동 환경에서도 강건성을 보였다.
  • 이 방법은 2명 플레이어 게임을 넘어서 일반화되며, 타인의 보상이나 사전 훈련된 정책에 대한 명시적 지식 없이도 확장 가능한 온라인 학습을 통해 상호 행동을 학습할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.