[논문 리뷰] Theory of Mind as Intrinsic Motivation for Multi-Agent Reinforcement Learning
이 논문은 다중 에이전트 강화 학습에서 타 에이전트의 믿음(2차 이론의 마음)을 예측하는 것을 내재적 보상 신호로 사용하는 방법을 제안한다. 정보 이론적 잔차 방법을 통해 의미적으로 유의미한 믿음을 기반으로 함으로써, 협력-경쟁 혼합 환경에서의 협력과 속임수 능력을 향상시킨다. 실험 결과는 첫 번째 차수의 믿음만 사용하거나 믿음이 없는 기준 모델 대비 유의미한 성능 향상을 보였다.
The ability to model the mental states of others is crucial to human social intelligence, and can offer similar benefits to artificial agents with respect to the social dynamics induced in multi-agent settings. We present a method of grounding semantically meaningful, human-interpretable beliefs within policies modeled by deep networks. We then consider the task of 2nd-order belief prediction. We propose that ability of each agent to predict the beliefs of the other agents can be used as an intrinsic reward signal for multi-agent reinforcement learning. Finally, we present preliminary empirical results in a mixed cooperative-competitive environment.
연구 동기 및 목표
- 딥 강화 학습 정책 내에서 의미적으로 유의미하고 인간이 이해할 수 있는 믿음을 기반으로 하는 방법을 개발하는 것.
- 다른 에이전트의 정신 상태(이론의 마음)를 예측하는 것이 다중 에이전트 강화 학습에서 내재적 보상 신호로 기능할 수 있는지 조사하는 것.
- 2차 믿음 예측에서 유래한 내재적 동기를 통해 협력-경쟁 혼합 환경에서의 다중 에이전트 성능을 향상시키는 것.
- 이러한 접근이 복잡한 사회 전략, 예를 들어 속임수와 협력적 회피와 같은 전략의 유도에 얼마나 효과적인지 평가하는 것.
제안 방법
- 개념 볼트론 학습의 정보 이론적 잔차 변형을 사용하여 입력 관측치와 믿음 표현 간의 상호정보량을 최소화함으로써 의미 기반 기반을 강화한다.
- 각 에이전트는 환경에 대한 1차 믿음(예: 목표 위치, 보상 계수)과 다른 에이전트의 1차 믿음에 대한 2차 믿음을 유지한다.
- 내재적 보상은 다른 에이전트의 믿음 예측 정확도로 계산되며, 에이전트들이 타자의 정신 상태를 모델링하도록 유도한다.
- 중앙집중적 훈련과 분산 실행(CTDE)을 사용한 다중 에이전트 프록실 패러미터 최적화(MAPPO)를 훈련에 사용한다.
- 매 100만 티스텝마다 좋은 에이전트와 악성 에이전트를 교차로 최적화하며, 다른 쪽의 가중치는 고정한다.
- 믿음 예측 작업을 잔차 연결을 통해 정책 네트워크에 통합하여 분리되고 해석 가능한 표현을 강제한다.

실험 결과
연구 질문
- RQ1다른 에이전트가 무엇을 믿는지 모델링하는 2차 믿음 예측이 다중 에이전트 강화 학습에서 효과적인 내재적 보상 신호로 기능할 수 있는가?
- RQ2의미적으로 유의미한 개념에 기반한 믿음의 기반화가 다중 에이전트 정책의 해석 가능성과 성능을 향상시키는가?
- RQ3상태의 새로운 성질이나 행동 영향에 기반한 내재적 보상과 비교할 때, 이론의 마음을 통한 내재적 동기는 협력-경쟁 혼합 환경에서 어떻게 성능을 발휘하는가?
- RQ4이러한 접근이 복잡한 사회 전략, 예를 들어 속임수와 협력적 회피의 유도를 가능하게 하는가?
주요 결과
- 2차 믿음 내재적 보상으로 훈련된 좋은 에이전트는 기준 모델 대비 유의미하게 뛰어난 성능을 보였으며, 물리적 속임수 작업에서 더 높은 평균 에피소드 보상 수준을 달성했다.
- 악성 에이전트 역시 2차 믿음 내재적 보상으로 훈련되었을 때 더 나은 성능을 보였으며, 결정적인 행동을 보이고 목표지점에 더 빨리 도달하는 경향을 보였다.
- 정성적 분석 결과, 2차 내재적 보상이 적용된 에이전트는 기준 모델 및 1차 믿음 설정에서 관찰되지 않은 바, 랜드마크 전환과 협력적 회피와 같은 더 복잡하고 적응적인 전략을 보였다.
- 2차 믿음 내재적 보상은 이론의 마음이 없는 모델에서 관찰되지 않는, 의도적인 오도 및 협력적 이동과 같은 더 전략적인 행동을 이끌어냈다.
- 이 방법은 믿음 예측에 기반한 내재적 동기가 사전 작업 설계 없이도 사회지능적 행동의 유도를 가능하게 함을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.