Skip to main content
QUICK REVIEW

[논문 리뷰] IntelligentCrowd: Mobile Crowdsensing via Multi-Agent Reinforcement Learning

Yize Chen, Hao Wang|arXiv (Cornell University)|2018. 09. 20.
Mobile Crowdsensing and Crowdsourcing참고 문헌 24인용 수 4
한 줄 요약

이 논문은 불확실하고 동적인 환경에서 이동형 커뮤니티 센싱 참가자가 자율적으로 최적의 센싱 정책을 학습할 수 있도록 하는 다중 에이전트 강화학습(MARL) 프레임워크인 IntelligentCrowd를 제안한다. 사용자 상호작용을 분산형 다중 에이전트 마르코프 결정 과정으로 모델링함으로써, 각 사용자는 오직 국지적 관측만을 사용하여 개인의 보상을 최대화할 수 있으며, 다양한 센싱 역학에서 기준 방법보다 유의미하게 높은 보상을 달성한다.

ABSTRACT

The prosperity of smart mobile devices has made mobile crowdsensing (MCS) a promising paradigm for completing complex sensing and computation tasks. In the past, great efforts have been made on the design of incentive mechanisms and task allocation strategies from MCS platform's perspective to motivate mobile users' participation. However, in practice, MCS participants face many uncertainties coming from their sensing environment as well as other participants' strategies, and how do they interact with each other and make sensing decisions is not well understood. In this paper, we take MCS participants' perspective to derive an online sensing policy to maximize their payoffs via MCS participation. Specifically, we model the interactions of mobile users and sensing environments as a multi-agent Markov decision process. Each participant cannot observe others' decisions, but needs to decide her effort level in sensing tasks only based on local information, e.g., its own record of sensed signals' quality. To cope with the stochastic sensing environment, we develop an intelligent crowdsensing algorithm IntelligentCrowd by leveraging the power of multi-agent reinforcement learning (MARL). Our algorithm leads to the optimal sensing policy for each user to maximize the expected payoff against stochastic sensing environments, and can be implemented at individual participant's level in a distributed fashion. Numerical simulations demonstrate that IntelligentCrowd significantly improves users' payoffs in sequential MCS tasks under various sensing dynamics.

연구 동기 및 목표

  • 참가자가 확률적 센싱 환경에 노출되어 있으며, 다른 이들의 행동에 대해 완전한 지식이 없을 때도 분산형 의사결정을 해결하는 데 도전한다.
  • 다른 이들의 행동을 완전히 알지 못하는 개별 사용자가 센싱 노력을 최적화할 수 있도록 확장 가능하고 분산된 학습 알고리즘을 개발한다.
  • 정보 품질(QoI) 역학이 정현파, 선형, 마르코프, 혼합 패턴 등 다양한 형태로 변화하는 순차적 센싱 과제에서 개인 참가자의 보상을 최대화한다.
  • 플랫폼 중심의 인cent라이브 메커니즘과 단일 에이전트 RL의 한계를 극복하기 위해 실시간 센싱 환경에서 협력적 다중 에이전트 상호작용을 모델링한다.
  • 모델 예측 제어(MPC)와 단일 에이전트 RL에 비해 다이나믹한 센싱 조건에서 보상 성능과 내구성 면에서 MARL의 우수성을 입증한다.

제안 방법

  • 각 에이전트가 국지적 관측에 기반하여 행동하고 자신의 예상 누적 보상을 최대화하는 방식으로, 이동형 커뮤니티 센싱 환경을 다중 에이전트 마르코프 결정 과정(MAMP)으로 모델링한다.
  • 전체 관측이 불가능한 상황에서 조율된 학습이 가능하도록, 각 에이전트에 대해 독립적인 액터-크리틱 네트워크를 사용하는 중심집중형 훈련 분산실행(CTDE) 프레임워크를 구현한다.
  • 딥 Q러닝과 정책 그래디언트 방법을 다중 에이전트 강화학습(MARL) 프레임워크 내에서 활용하여, 국지적 신호 품질과 이력 데이터에 대응하는 최적의 센싱 노력 수준을 학습한다.
  • 신호 품질의 시간적 상관관계를 포착하기 위해 과거 센싱 상태의 기억(가변 길이 K)을 통합함으로써, 다이나믹한 QoI 조건 하에서 의사결정을 향상시킨다.
  • 가치 함수를 추정하고 정책 업데이트를 안내하기 위해 크리틱 네트워크를 사용하여, 에이전트들이 공유된 보상 신호를 통해 암묵적으로 협력할 수 있도록 한다.
  • 추론 시점에 시스템을 완전히 분산형 방식으로 훈련하여, 각 에이전트가 오직 자신의 국지적 상태와 학습된 정책에 기반해 결정을 내린다.

실험 결과

연구 질문

  • RQ1확률적 센싱 환경과 다른 이들의 행동에 대한 정보가 불완전한 상황에서 이동형 커뮤니티 센싱 참가자는 어떻게 최적의 센싱 전략을 학습할 수 있는가?
  • RQ2다이나믹하고 불확실한 센싱 환경에서 다중 에이전트 강화학습이 단일 에이전트 RL이나 모델 예측 제어(MPC)에 비해 어떤 성능 향상을 보이는가?
  • RQ3과거 센싱 상태의 기억 길이가 학습 효율성과 개인 참가자의 보상 성능에 어떤 영향을 미치는가?
  • RQ4순차적 MCS 과제에서 중심집중형 또는 독립적 학습 기반의 베이스라인에 비해 분산형 MARL 접근 방식이 더 높은 개인 보상을 달성할 수 있는가?
  • RQ5정현파, 선형, 마르코프, 혼합 패턴과 같은 다양한 정보 품질(QoI) 역학에서 알고리즘이 어떻게 성능을 발휘하는가?

주요 결과

  • IntelligentCrowd는 모든 QoI 역학에서 가장 높은 평균 누적 보상을 달성했으며, 메모리 길이 K=50일 때 선형 역학 하에서 최고 보상 50.01을 기록했다.
  • 혼합 역학 하에서 IntelligentCrowd는 평균 보상 36.91을 달성하여 MPC(-43.52)와 단일 에이전트 RL(11.95)를 크게 앞서며, 복잡하고 비정상적인 환경에서도 뛰어난 내구성을 입증했다.
  • 알고리즘이 10~20개의 훈련 에피소드 내에 안정적이고 고보상 정책으로 수렴했으며, 4에이전트 및 8에이전트 시스템 모두 보상 분포에서 일관된 수렴을 보였다.
  • K=50일 때, 알고리즘이 모든 역학에서 최적의 성능을 달성하여, 과거 상태에 대한 장기 기억이 신호 품질의 시간적 패턴 학습에 도움이 된다는 것을 시사했다.
  • 모델 예측 제어(MPC)는 성능이 열악했고, 특히 혼합 역학 하에서 두드러지게 떨어졌지만, IntelligentCrowd는 정확한 시스템 모델에 의존하지 않고 협력 전략을 학습할 수 있어 더 뛰어난 적응성을 보였다.
  • 긴 기억(K=100)을 가진 단일 에이전트 RL조차도 MARL에 비해 성능이 열등하여, 다참여자 센싱 과제에서의 상호작용 조율의 중요성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.