Skip to main content
QUICK REVIEW

[논문 리뷰] Task-Based Information Compression for Multi-Agent Communication Problems with Channel Rate Constraints.

Arsham Mostaani, Thang X. Vu|arXiv (Cornell University)|2020. 05. 28.
Distributed Control Multi-Agent Systems참고 문헌 50인용 수 4
한 줄 요약

이 논문은 통신 비율 제약 조건 하에서 다중 에이전트 시스템에 대한 작업 기반 정보 압축을 제안하며, 강화 학습을 통한 학습 기반 정보 압축(LBIC)과 분석적 설계를 통한 상태 집합을 통한 정보 압축(SAIC)이라는 두 가지 기법을 사용한다. 이 방법들은 관측치를 압축적으로 공유함으로써 보상 손실을 최소화하며, SAIC는 특정 조건 하에서 최적 성능을 조건적으로 달성하여 랜드마크 임무에서 벤치마크를 능가한다.

ABSTRACT

A collaborative task is assigned to a multiagent system (MAS) in which agents are allowed to communicate. The MAS runs over an underlying Markov decision process and its task is to maximize the averaged sum of discounted one-stage rewards. Although knowing the global state of the environment is necessary for the optimal action selection of the MAS, agents are limited to individual observations. The inter-agent communication can tackle the issue of local observability, however, the limited rate of the inter-agent communication prevents the agent from acquiring the precise global state information. To overcome this challenge, agents need to communicate their observations in a compact way such that the MAS compromises the minimum possible sum of rewards. We show that this problem is equivalent to a form of rate-distortion problem which we call the task-based information compression. We introduce two schemes for task-based information compression (i) Learning-based information compression (LBIC) which leverages reinforcement learning to compactly represent the observation space of the agents, and (ii) State aggregation for information compression (SAIC), for which a state aggregation algorithm is analytically designed. The SAIC is shown, conditionally, to be capable of achieving the optimal performance in terms of the attained sum of discounted rewards. The proposed algorithms are applied to a rendezvous problem and their performance is compared with two benchmarks; (i) conventional source coding algorithms and the (ii) centralized multiagent control using reinforcement learning. Numerical experiments confirm the superiority of the proposed algorithms.

연구 동기 및 목표

  • 부분 관측 가능한 다중 에이전트 시스템(MAS)에서 제한된 상호 에이전트 간 통신 비율 문제를 해결하기 위해.
  • 채널 비율 제약 조건 하에서 압축된 통신으로 인한 할인 보상 합의 손실을 최소화하기 위해.
  • 에이전트 관측치를 압축적으로 표현하면서도 작업에 관련된 전역 상태 정보를 유지하는 통신 전략을 개발하기 위해.
  • 특정 조건 하에서 최적 성능을 달성할 수 있는 이론적으로 탄탄한 방법(SAIC)을 설계하기 위해.
  • 기존의 소스 코딩 및 중심화된 강화 학습 벤치마크와의 성능을 평가하고 비교하기 위해.

제안 방법

  • 왜곡을 보상 손실로 측정하는 작업 기반 비율-왜곡 문제로 통신 문제를 공식화한다.
  • 딥 강화 학습을 사용해 에이전트 관측치의 압축 표현을 학습하는 학습 기반 정보 압축(LBIC)을 도입한다.
  • 비율 제약 조건 하에서 정보 손실을 최소화하기 위해 상태를 분석적으로 군집화하는 정보 압축을 위한 상태 집합(SAIC)을 제안한다.
  • 기본 MDP가 작업에 관련된 정보를 유지할 수 있도록 충분한 상태 집합을 허용할 수 있다고 가정하여 SAIC를 적용한다.
  • 에이전트들이 할인 보상의 합을 최대화하는 MDP 프레임워크를 사용하여 MAS를 모델링한다.
  • LBIC를 훈련하고 성능을 평가하기 위해 중심화된 훈련과 분산 실행(CTDE) 파라다임을 사용한다.

실험 결과

연구 질문

  • RQ1작업 기반 정보 압축은 통신 비율 제약 조건 하에서 다중 에이전트 시스템의 보상 손실을 줄일 수 있는가?
  • RQ2강화 학습을 통해 훈련된 LBIC는 기존의 소스 코딩 기법과 비교해 통신 효율성과 보상 성능에서 어떻게 다른가?
  • RQ3SAIC는 할인 보상 측면에서 어떤 조건에서 최적 성능을 달성할 수 있는가?
  • RQ4제안된 기법들의 성능은 중심화된 다중 에이전트 강화 학습과 어떻게 비교되는가?
  • RQ5다중 에이전트 조율 작업에서 통신 비율과 보상 손실 사이의 상충 관계는 어떠한가?

주요 결과

  • 제안된 작업 기반 정보 압축 프레임워크는 통신 비율 제약 조건 하에서도 보상 손실을 효과적으로 줄인다.
  • 특정 MDP의 구조적 가정 하에서 SAIC는 할인 보상 합 측면에서 최적 성능을 조건적으로 달성한다.
  • LBIC는 통신 효율성과 보상 달성 측면에서 기존의 소스 코딩 알고리즘을 모두 능가한다.
  • LBIC와 SAIC 모두 통신 비율 제약 조건 하에서 중심화된 다중 에이전트 강화 학습보다 통신 효율성과 보상 성능에서 뚜렷이 뛰어나다.
  • 랜드마크 임무에 대한 수치 실험 결과, 제안된 기법들이 보상 손실 최소화 측면에서 기존 벤치마크를 뛰어넘는 것으로 확인된다.
  • 문제의 비율-왜곡 공식화는 통신 비용과 작업 성능 사이의 체계적인 상충 관계를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.