Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Incentivize Other Learning Agents

Jiachen Yang, Ang Li|arXiv (Cornell University)|2020. 06. 10.
Reinforcement Learning in Robotics참고 문헌 42인용 수 17
한 줄 요약

이 논문은 강화학습 에이전트가 다른 에이전트의 행동을 형성하고 공동 성과를 향상시키기 위해 보상을 주는 방식으로 상호작용하는 데 초점을 맞춘 Learning to Incentivize Others (LIO)를 제안한다. 다른 에이전트의 학습에 미치는 영향을 명시적으로 모델링함으로써 자신의 성과에 영향을 주는 방식으로, LIO 에이전트는 일반합 Markov 게임에서 거의 최적에 가까운 협업을 달성하며, Escape Room 및 Cleanup 환경과 같은 과제에서 표준 강화학습과 대상형성 기반 기준보다 뚜렷하게 뛰어난 성능을 보인다.

ABSTRACT

The challenge of developing powerful and general Reinforcement Learning (RL) agents has received increasing attention in recent years. Much of this effort has focused on the single-agent setting, in which an agent maximizes a predefined extrinsic reward function. However, a long-term question inevitably arises: how will such independent agents cooperate when they are continually learning and acting in a shared multi-agent environment? Observing that humans often provide incentives to influence others' behavior, we propose to equip each RL agent in a multi-agent environment with the ability to give rewards directly to other agents, using a learned incentive function. Each agent learns its own incentive function by explicitly accounting for its impact on the learning of recipients and, through them, the impact on its own extrinsic objective. We demonstrate in experiments that such agents significantly outperform standard RL and opponent-shaping agents in challenging general-sum Markov games, often by finding a near-optimal division of labor. Our work points toward more opportunities and challenges along the path to ensure the common good in a multi-agent future.

연구 동기 및 목표

  • 공유 환경에서 목적을 다르게 하는 독립적으로 학습하는 강화학습 에이전트 간의 협업 문제를 해결하기 위해.
  • 고정된 보상 함수의 한계를 극복하기 위해 에이전트가 다른 이의 행동에 영향을 주기 위해 보상을 주는 방식으로 학습할 수 있도록 하기 위해.
  • 보상 수혜자의 학습과 자신의 외부 목표에 대한 장기적 영향을 고려한 방법을 개발하기 위해.
  • 학습된 인센티브 함수를 통해 협업 과제에서 효율적인 노동 분담을 발견할 수 있도록 하기 위해.
  • 표준 강화학습과 대상형성 접근 방식에 비해 학습된 인센티브가 개인 및 집단 성과를 향상시키는지 입증하기 위해.

제안 방법

  • 에이전트는 다른 학습 중인 에이전트에게 보상을 주는 인센티브 함수를 학습하며, 이 보상이 수혜자의 정책 업데이트에 미치는 영향을 명시적으로 모델링한다.
  • 에이전트의 외부 목표에 대한 기울기를 인센티브 함수의 파라미터에 대해 유도함으로써, 정책 기반 방법을 통한 엔드 투 엔드 학습이 가능해진다.
  • 편향을 줄이고 학습 안정성을 향상시키기 위해 인센티브 업데이트와 정책 업데이트를 별도의 에피소드로 분리한다.
  • 인센티브와 정책 업데이트가 동일한 에피소드에서 발생할 경우 분포 이탈을 완화하기 위해 중요도 샘플링 보정을 사용한다.
  • 에이전트는 정책 기반 최적화를 통해 훈련되며, 인센티브 함수는 에이전트의 총 외부 수익을 최대화하도록 함께 최적화된다.
  • 이 프레임워크는 Escape Room 및 Cleanup과 같은 일반합 Markov 게임에 적용되며, 에이전트들이 더 높은 공동 수익을 달성하기 위해 협력해야 한다.

실험 결과

연구 질문

  • RQ1에이전트가 다른 이의 학습에 간접적인 영향을 주기 위해 보상을 주는 방식으로 장기적으로 자신의 외부 성과를 햖थ기할 수 있는가?
  • RQ2학습된 인센티브는 다중 에이전트 협업 환경에서 표준 독립적 강화학습과 대상형성 방법에 비해 어떻게 비교되는가?
  • RQ3고정된 보상 형상화 없이 학습된 인센티브를 통해 효율적인 노동 분담을 발견할 수 있는가?
  • RQ4인센티브 업데이트와 정책 업데이트를 분리하는 것이 학습 안정성과 성능에 어떤 영향을 미치는가?
  • RQ5복잡하고 비대칭적인 환경에서 다른 이의 학습을 보상으로 형상화할 수 있는 능력이 집단 및 개인의 수익을 높이는가?

주요 결과

  • 2명의 에이전트가 참여하는 Escape Room 게임에서 LIO 에이전트는 조합 수익이 약 9.0에 가까워지며 전역 최대값에 도달했고, 표준 PG 및 PG-rewards 에이전트는 전역 최소값에 갇혀 있었다.
  • LIO는 LOLA 및 2-TS 방법보다 뛰어난 성능을 보였으며, 훨씬 더 많은 훈련 단계가 필요로 하고 수렴 안정성도 낮았다.
  • 3명의 에이전트가 참여하는 Escape Room 게임에서 LIO는 한 에이전트가 주요 보상 제공자가 되어 다른 이들이 레버를 당기도록 유도함으로써 성공적인 협업을 이끌었다.
  • 7x7 Cleanup 환경에서 LIO 에이전트들은 안정적인 노동 분담을 학습했다: 한 명은 사과를 수확하는 데 집중하고, 다른 한 명은 쓰레기를 청소하는 데 전념했으며, 이는 수확자로부터 유도된 인센티브에 의해 이뤄졌다.
  • LIO 에이전트는 AC 에이전트보다 평균적으로 더 높은 보상을 받았는데, 이는 AC 에이전트가 청소 후 사과를 두고 경쟁했기 때문에 공동적으로 최적의 결과를 내지 못했기 때문이다.
  • 10x10 지도에서 LIO 에이전트는 스크립트된 상대 정책에 대해 유연하게 인센티브를 적응시켜 동적 환경에서의 강건성과 적응 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.