Skip to main content
QUICK REVIEW

[논문 리뷰] Emergent Bartering Behaviour in Multi-Agent Reinforcement Learning

Michael Bradley Johanson, Edward Hughes|arXiv (Cornell University)|2022. 05. 13.
Complex Systems and Time Series Analysis인용 수 8
한 줄 요약

이 논문은 공급과 수요에 대응하여 생산, 거래, 소비를 통해 자율적으로 바ter 행위를 개발하는 다중 에이전트 강화학습 설정인 Fruit Market 환경을 소개한다. 주요 결과로는 국지적 가격 형성, 지역 간 이동을 통한 아르비트, 적응적 생산/소비와 같은 탄생한 미세경제 현상이 관찰되었으며, 이는 복잡한 경제 행동이 도메인 특화 코드 없이도 강화학습에서 자연스럽게 유도될 수 있음을 보여준다.

ABSTRACT

Advances in artificial intelligence often stem from the development of new environments that abstract real-world situations into a form where research can be done conveniently. This paper contributes such an environment based on ideas inspired by elementary Microeconomics. Agents learn to produce resources in a spatially complex world, trade them with one another, and consume those that they prefer. We show that the emergent production, consumption, and pricing behaviors respond to environmental conditions in the directions predicted by supply and demand shifts in Microeconomics. We also demonstrate settings where the agents' emergent prices for goods vary over space, reflecting the local abundance of goods. After the price disparities emerge, some agents then discover a niche of transporting goods between regions with different prevailing prices -- a profitable strategy because they can buy goods where they are cheap and sell them where they are expensive. Finally, in a series of ablation experiments, we investigate how choices in the environmental rewards, bartering actions, agent architecture, and ability to consume tradable goods can either aid or inhibit the emergence of this economic behavior. This work is part of the environment development branch of a research program that aims to build human-like artificial general intelligence through multi-agent interactions in simulated societies. By exploring which environment features are needed for the basic phenomena of elementary microeconomics to emerge automatically from learning, we arrive at an environment that differs from those studied in prior multi-agent reinforcement learning work along several dimensions. For example, the model incorporates heterogeneous tastes and physical abilities, and agents negotiate with one another as a grounded form of communication.

연구 동기 및 목표

  • 거래, 가격 형성, 전문화와 같은 미세경제 행동의 탄생을 가능하게 하는 다중 에이전트 강화학습 환경을 개발하는 것.
  • 딥 강화학습 에이전트가 무작위 초기화 상태에서 아르비트 및 공급-수요 조정과 같은 복잡한 경제 행동을 자율적으로 발견할 수 있는지 조사하는 것.
  • 다중 에이전트 시스템에서 사회적 및 경제적 행동의 탄생 여부를 결정짓는 환경 설계 선택 사항을 규명하는 것.
  • 다중 에이전트 강화학습과 에이전트 기반 계산 경제학 간 격차를 메우기 위해, 최신 기술의 강화학습 에이전트가 기초 경제 현상을 학습하는 것을 보여주는 것.

제안 방법

  • 에이전트는 개별적인 선호도와 생산 능력에 따라 자원(예: 사과, 바나나)을 생산, 소비, 거래하는 공간적으로 복잡한 세계에서 운영된다.
  • 이동, 제안, 교환 행동의 조합을 통해 무역을 협상하며, 가격은 공급과 수요 동역학에서 유기적으로 탄생한다.
  • 실제 세계의 경제 다양성을 모델링하기 위해 이질적인 에이전트 특성, 즉 다릅니다 생산 기술과 소비 선호도를 환경에 통합한다.
  • 강화학습은 V-MPO라는 딥 강화학습 알고리즘을 사용하며, 소비 및 굶주림 감소와 연결된 희박한 보상 구조를 적용한다.
  • 에이전트는 분산 학습을 통해 학습하며, 무역에 대한 명시적 보상 조정 없이 소비와 기회비용에서 유도된 잠재적 인centives에 의존한다.
  • 환경는 Melting Pot 스위트 내에서 오픈소스로 공개되어 재현 가능성과 다중 에이전트 강화학습 및 계산 경제학 분야의 추가 연구를 지원한다.

실험 결과

연구 질문

  • RQ1다중 에이전트 강화학습 에이전트가 무역에 대한 명시적 보상 조정 없이도 자율적으로 바ter 행동을 개발할 수 있는가?
  • RQ2환경 내 공급과 수요의 변화가 탄생한 가격 형성 및 생산/소비 행동에 어떻게 영향을 미치는가?
  • RQ3자원의 풍부함에 따른 공간적 변동성이 국지적 가격 형성과 아르비트 전략의 탄생을 이끌어내는가?
  • RQ4거래와 전문화와 같은 복잡한 경제 행동의 탄생을 위해 필요한 환경 및 아키텍처 설계 선택 사항은 무엇인가?
  • RQ5에이전트는 가격 격차가 있는 지역 간에 물품을 운반하여 아르비트를 수익성 있는 전략으로 발견할 수 있는가?

주요 결과

  • 에이전트는 지역 자원의 풍부함을 반영하는 국지적 가격 형성이 자발적으로 발생시켰으며, 공급과 수요의 변화에 따라 자연스럽게 가격 격차가 발생했다.
  • 지역 간 가격 격차가 형성되었을 때 일부 에이전트는 저가 지역에서 고가 지역으로 물품을 운반하여 아르비트를 통해 보다 높은 보상을 달성하는 전략을 발견하고 전문화했다.
  • 거래의 탄생은 환경 설계에 민감하게 영향을 받았다: 굶주림 페널티를 제거하거나 무역 메커니즘(예: 버리기/기부 행동)을 변경하면 거래가 탄생하는 것을 크게 저해하거나 방지했다.
  • 에이전트가 '버리기 및 기부' 행동만으로는 거래를 학습하지 못했으며, 이는 공동 탐색을 위한 더 체계적 또는 신뢰할 수 있는 의사소통 메커니즘이 필요함을 시사한다.
  • 절단 실험을 통해 에이전트 아키텍처, 이동 페널티, 보상 조정(예: 굶주림 페널티)이 경제 행동의 탄생 여부에 결정적인 영향을 미친다는 것이 확인되었다.
  • Fruit Market 환경은 최신 기술의 딥 강화학습 에이전트가 도메인 특화 코드나 사전 지식 없이도 생산, 소비, 거래, 아르비트와 같은 인간과 유사한 복잡한 경제 행동을 학습하는 데 성공적으로 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.