Skip to main content
QUICK REVIEW

[논문 리뷰] Emergence of Theory of Mind Collaboration in Multiagent Systems

Luyao Yuan, Zipeng Fu|arXiv (Cornell University)|2021. 09. 30.
Reinforcement Learning in Robotics참고 문헌 41인용 수 9
한 줄 요약

이 논문은 다중에이전트 시스템이 상대방의 정신 상태에 대한 1차 belief(믿음)만 모델링함으로써, 전체 재귀적 중첩 없이도 상호 협동적으로 사고의 이론(ToM)을 학습할 수 있도록 하는 적응형 학습 알고리즘을 제안한다. 중심적 학습과 belief 감독을 활용하고 분산 실행을 적용함으로써, 두 개의 비완전 정보 게임에서 이전의 모든 분산 알고리즘을 능가하는 우수한 성능을 달성하며, 다양한 에이전트 그룹 할당 상황에서도 강력하고 보편적인 프로토콜을 가능하게 한다.

ABSTRACT

Currently, in the study of multiagent systems, the intentions of agents are usually ignored. Nonetheless, as pointed out by Theory of Mind (ToM), people regularly reason about other's mental states, including beliefs, goals, and intentions, to obtain performance advantage in competition, cooperation or coalition. However, due to its intrinsic recursion and intractable modeling of distribution over belief, integrating ToM in multiagent planning and decision making is still a challenge. In this paper, we incorporate ToM in multiagent partially observable Markov decision process (POMDP) and propose an adaptive training algorithm to develop effective collaboration between agents with ToM. We evaluate our algorithms with two games, where our algorithm surpasses all previous decentralized execution algorithms without modeling ToM.

연구 동기 및 목표

  • 직접적인 통신 없이도 상대방의 정신 상태를 추론해야 하는 부분 관측 다중에이전트 시스템에서 효과적인 협업을 가능하게 하는 데 도전한다.
  • 다중에이전트 계획 및 의사결정에서 고차수 재귀적 belief(예: 믿음의 믿음의 믿음) 모델링의 비가역성 문제를 해결한다.
  • 중앙집중적 학습과 belief 감독을 활용하여 효과적이고 확장 가능한 ToM 기반 협업 전략을 학습할 수 있는 분산 실행 알고리즘을 개발한다.
  • 에이전트가 새로운 그룹으로 재할당되어도 성능을 유지할 수 있는 보편적이고 그룹에 종속되지 않는 통신 프로토콜의 유도를 목표로 한다.

제안 방법

  • 에이전트가 자신의 상태에 대한 belief와 상대방의 비공개 상태에 대한 1차 belief를 유지하는 다중에이전트 부분 관측 마르코프 결정 과정(POMDP) 프레임워크를 도입한다.
  • 대체 가능한 추론을 사용하여 파artner의 자신의 비공개 상태에 대한 belief를 추정함으로써, 첫 번째 단계의 재귀적 수준에서 믿음의 믿음 모델링을 가능하게 한다.
  • 에이전트들이 자신의 belief 추정치를 공유함으로써 중심적 학습 단계에서 각 에이전트의 belief 추정 함수를 학습하기 위한 감독 정보를 제공한다.
  • 하나의 에이전트를 고정하고 다른 하나만 학습하는 동적이고 적응형 학습 스케줄을 적용하여 안정적인 학습을 위한 정적 환경을 확보한다.
  • 예측된 belief 벡터와 진짜 belief 벡터 간의 L2-노름 손실을 사용하여, 이산화된 감독을 위한 belief 추정 함수를 최적화한다.
  • 메시지 공간 제약 조건을 도입하여 잘못되거나 오해의 소지가 있는 통신을 방지하고, 메시지당 비용을 설정하여 긴 무의미한 교환을 억제한다.

실험 결과

연구 질문

  • RQ1완전한 재귀적 belief 모델링 없이도, 1차 사고의 이론(ToM, 즉 타인의 믿음에 대한 믿음)이 분산 다중에이전트 시스템에서 효과적으로 학습될 수 있는가?
  • RQ2적응형 belief 추정을 통한 ToM 통합이, 비관측 환경에서 비-ToM 기반 베이스라인 대비 협업 성능을 향상시키는가?
  • RQ3ToM 기반 에이전트가 태스크 수준에서 보편적인 통신 프로토콜을 개발하여, 파트너가 다른 그룹으로 이동하더라도 효과를 유지할 수 있는가?
  • RQ4공유 모듈(예: 공유 Q-함수 또는 메타에이전트)이 있는 중심적 학습 접근법과 비교했을 때, 제안된 방법은 성능 및 일반화 능력 측면에서 어떻게 다른가?

주요 결과

  • 제안된 ToM 기반 알고리즘이 두 개의 비완전 정보 게임에서 이전의 모든 분산 실행 알고리즘을 능가하며, 최첨단 중심적 모델에 근접한 성능을 달성한다.
  • 약속 일정 조율 게임에서, 무작위 기반 베이스라인(25%)과 자기 기반 제안 기반 베이스라인(50%)을 크게 초월한 성공률을 기록했으며, 표본 결과는 표 2와 그림 2(b)에 기재되어 있다.
  • 다양한 그룹 할당 실험에서 성능 저하가 가장 적었으며, 에이전트 재할당 시 심각한 성능 저하를 겪는 중심적 기반 모델(BAD 및 COMA)을 능가했다.
  • ToM로 학습된 에이전트들은 보편적이고 태스크 수준의 프로토콜을 개발하여, 예상치 못한 파트너와도 효과적인 협업을 가능하게 하여, 그룹에 종속된 암묵적 합의를 넘어서는 강건성을 보였다.
  • 중앙집중적 학습 단계에서의 belief 감독 덕분에 파트너의 belief를 정확하게 추정할 수 있었으며, 이는 언어적 의사소통 없이도 고차원적 협업을 가능하게 하는 데 핵심이 되었다.
  • 하나의 에이전트를 고정하고 학습을 진행하는 적응형 학습 절차는 비정적 환경 문제를 효과적으로 완화하고, 공동 학습 동역학에도 불구하고 안정적인 수렴을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.