Skip to main content
QUICK REVIEW

[논문 리뷰] Intent-aware Multi-agent Reinforcement Learning

Siyuan Qi, Song‐Chun Zhu|arXiv (Cornell University)|2018. 03. 06.
Reinforcement Learning in Robotics참고 문헌 40인용 수 3
한 줄 요약

이 논문은 기대 효용을 최대화하기 위해 다른 에이전트의 의도와 내재적 가치를 모델링함으로써 목표 공간에서 계획을 수행하는 의도 인식 다중에이전트 강화학습 프레임워크를 제안한다. 이 방법은 효율적이고 수렴 가능한 학습을 위해 선형 함수 근사법을 사용하며, 실제 전이 가능성과 함께 동적인 비단일기반 다중에이전트 시나리오에서 인간과 유사한 협업과 뛰어난 성능을 보여준다.

ABSTRACT

This paper proposes an intent-aware multi-agent planning framework as well as a learning algorithm. Under this framework, an agent plans in the goal space to maximize the expected utility. The planning process takes the belief of other agents' intents into consideration. Instead of formulating the learning problem as a partially observable Markov decision process (POMDP), we propose a simple but effective linear function approximation of the utility function. It is based on the observation that for humans, other people's intents will pose an influence on our utility for a goal. The proposed framework has several major advantages: i) it is computationally feasible and guaranteed to converge. ii) It can easily integrate existing intent prediction and low-level planning algorithms. iii) It does not suffer from sparse feedbacks in the action space. We experiment our algorithm in a real-world problem that is non-episodic, and the number of agents and goals can vary over time. Our algorithm is trained in a scene in which aerial robots and humans interact, and tested in a novel scene with a different environment. Experimental results show that our algorithm achieves the best performance and human-like behaviors emerge during the dynamic process.

연구 동기 및 목표

  • 의도 추론을 통합하여 향상된 의사결정을 위한 계산적으로 타당하고 수렴 가능한 다중에이전트 강화학습 프레임워크를 개발하는 것.
  • 고수준 계획에서 의도 예측을 분리하여 기존 알고리즘과의 통합을 가능하게 하고 POMDP의 복잡성을 피하는 것.
  • 동적인 비정적 환경에서 협업과 경쟁과 같은 인간과 유사한 사회적 행동의 탄생을 가능하게 하는 것.
  • 희소 피드백에 강건하고 다양한 수의 에이전트 및 목표에 적응 가능한 학습 방법을 설계하는 것.

제안 방법

  • 프레임워크는 다른 에이전트의 의도와 내재적 가치에 대한 믿음을 바탕으로 목표의 기대 효용을 추정함으로써 목표 공간에서 계획을 수행한다.
  • 효용 함수의 선형 함수 근사법을 적용하며, 이는 U(g, b) = θᵀφ(g, b)로 정의되며, 여기서 φ는 목표와 믿음 표현을 조합한 특징 벡터이다.
  • 학습 알고리즘은 Sarsa와 ϵ-탐욕 탐색을 사용하여 건물에 에이전트가 들어오는 것에서 발생하는 희소 보상에 기반해 파라미터 벡터 θ를 갱신한다.
  • 의도 믿음은 관찰된 행동을 바탕으로 갱신되며, 베이지안 방법, 최대우도 추정 또는 통신을 통해 계산될 수 있다.
  • 저수준 계획, 의도 예측, 고수준 추론을 분리함으로써 기존 알고리즘의 모듈러 통합을 가능하게 한다.
  • 믿음 갱신과 정책 학습을 분리함으로써 POMDP의 계산 비가역성을 피한다.

실험 결과

연구 질문

  • RQ1다중에이전트 강화학습이 의도 추론을 통합하면서도 계산적으로 타당하게 유지될 수 있는가?
  • RQ2의도 인식 계획은 동적인 환경에서 인간과 유사한 협동적·경쟁적 행동의 탄생을 이끌 수 있는가?
  • RQ3기존의 의도 예측 및 저수준 계획 알고리즘은 어떻게 통합된 학습 프레임워크에 효과적으로 통합될 수 있는가?
  • RQ4행동 공간에서의 희소 피드백 문제를 목표 공간에서의 계획이 완화할 수 있는가?
  • RQ5학습된 정책은 다른 수의 에이전트와 목표를 가진 새로운 환경으로 일반화될 수 있는가?

주요 결과

  • 제안된 방법은 3개의 로봇 에이전트로 5개의 건물을 모니터링할 때 60%의 포획률을 기록하여 RNN-POMDP(20%) 및 탐욕/무작위 정책과 같은 베이스라인을 크게 능가했다.
  • 알고리즘이 300회의 학습 반복 후 전역 최적해에 수렴하여 안정적이고 효율적인 학습을 보였다.
  • 에이전트들은 모니터링되지 않은 건물을 스스로 발견하고 서로 다른 건물을 커버하기 위해 협력함으로써 자연스럽게 협업이 탄생하는 것을 학습했다.
  • 정책 파rameter θ에 의해 학습된 가치 지도는 핵심 과제 가치를 반영했다: 모니터링되지 않은 건물을 점검하는 것은 보상이었고, 다른 이들과 동일한 건물을 모니터링하는 것은 벌점이었다.
  • 새로운 환경에서의 전이 테스트에서도 명시적인 레이아웃 지식 없이도 최고의 성능을 기록하여 성공적으로 전이되었으며, 이는 실제 적용 가능성의 증거였다.
  • 성공적인 포획에만 보상을 부여하는 보상 형상화가 팀 전반의 보상보다 더 나은 협업을 이끌었으며, 이는 인간 팀의 행동 패턴을 그대로 반영했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.