Skip to main content
QUICK REVIEW

[論文レビュー] IntelligentCrowd: Mobile Crowdsensing via Multi-Agent Reinforcement Learning

Yize Chen, Hao Wang|arXiv (Cornell University)|Sep 20, 2018
Mobile Crowdsensing and Crowdsourcing参考文献 24被引用数 4
ひとこと要約

本稿では、不確実で動的な環境において、モバイルクラウドセンシング参加者が自律的かつ最適なセンシング方策を学習できる、マルチエージェント強化学習(MARL)フレームワークであるIntelligentCrowdを提案する。ユーザー間の相互作用を分散型マルチエージェントマルコフ決定過程としてモデル化することで、各ユーザーは局所的観測のみを用いて自身の報酬を最大化でき、多様なセンシングダイナミクスにおいて、ベースライン手法と比較して著しく高い報酬を達成する。

ABSTRACT

The prosperity of smart mobile devices has made mobile crowdsensing (MCS) a promising paradigm for completing complex sensing and computation tasks. In the past, great efforts have been made on the design of incentive mechanisms and task allocation strategies from MCS platform's perspective to motivate mobile users' participation. However, in practice, MCS participants face many uncertainties coming from their sensing environment as well as other participants' strategies, and how do they interact with each other and make sensing decisions is not well understood. In this paper, we take MCS participants' perspective to derive an online sensing policy to maximize their payoffs via MCS participation. Specifically, we model the interactions of mobile users and sensing environments as a multi-agent Markov decision process. Each participant cannot observe others' decisions, but needs to decide her effort level in sensing tasks only based on local information, e.g., its own record of sensed signals' quality. To cope with the stochastic sensing environment, we develop an intelligent crowdsensing algorithm IntelligentCrowd by leveraging the power of multi-agent reinforcement learning (MARL). Our algorithm leads to the optimal sensing policy for each user to maximize the expected payoff against stochastic sensing environments, and can be implemented at individual participant's level in a distributed fashion. Numerical simulations demonstrate that IntelligentCrowd significantly improves users' payoffs in sequential MCS tasks under various sensing dynamics.

研究の動機と目的

  • 参加者が確率的センシング環境に直面し、他者の行動について完全に把握できない状況において、分散型意思決定の課題に対処すること。
  • 他の参加者の行動を完全に把握しない状況下でも、個々のユーザーが自身のセンシング努力を最適化できる、スケーラブルで分散型の学習アルゴリズムを開発すること。
  • 情報品質(QoI)ダイナミクスが正弦波、線形、マルコフ、および混合パターンを含む多様な状況下でも、順次的センシングタスクにおいて個々の参加者の報酬を最大化すること。
  • プラットフォーム中心のインcentiveメカニズムや単一エージェントRLの限界を克服し、リアルタイムのセンシング環境において協調的でマルチエージェントの相互作用をモデル化すること。
  • モデル予測制御(MPC)や単一エージェントRLと比較して、報酬性能および動的センシング条件下での頑健性においてMARLの優位性を実証すること。

提案手法

  • 各エージェントが局所的観測に基づいて行動し、自身の期待累積報酬を最大化することを目的とする、マルチエージェントマルコフ決定過程(MAMP)としてモバイルクラウドセンシング環境をモデル化する。
  • 完全観測ができない状況下でも協調的学習が可能となるように、各エージェントに独立したアクターキャリブレーター・ネットワークを用いた集中学習・分散実行(CTDE)フレームワークを実装する。
  • 深層Q学習とポリシー勾配法をマルチエージェント強化学習(MARL)フレームワーク内に統合し、局所的な信号品質と履歴データに応じた最適なセンシング努力レベルを学習する。
  • 信号品質の時間的相関を捉えるために、過去のセンシング状態(設定可能な長さK)の記憶を活用し、変動するQoI条件下での意思決定を向上させる。
  • 価値関数を推定し、ポリシー更新をガイドするためのクリティックネットワークを用い、エージェントが共有報酬信号を通じて間接的に協調する。
  • 推論時に完全に分散型に学習を実行し、各エージェントが自身の局所状態と学習済みポリシーのみに依存して意思決定を行う。

実験結果

リサーチクエスチョン

  • RQ1確率的センシング環境および他者の行動に関する不完全情報が存在する中で、モバイルクラウドセンシング参加者が最適なセンシング戦略をどのように学習できるか?
  • RQ2動的で不確実なセンシング環境下で、マルチエージェント強化学習(MARL)が単一エージェントRLやモデル予測制御(MPC)よりも報酬性能でどれほど優れているか?
  • RQ3過去のセンシング状態の記憶長さが、学習効率および個々の参加者の報酬パフォーマンスにどのように影響するか?
  • RQ4分散型MARLアプローチは、集中型または独立学習ベースラインと比較して、順次的MCSタスクでより高い個別報酬を達成できるか?
  • RQ5正弦波、線形、マルコフ、および混合パターンを含む多様な情報品質(QoI)ダイナミクスにおいて、アルゴリズムのパフォーマンスはどの程度か?

主な発見

  • IntelligentCrowdは、すべてのQoIダイナミクスにおいて最高の平均蓄積報酬を達成し、線形ダイナミクス下で記憶長K=50のとき、ピーク報酬50.01を記録した。
  • 混合ダイナミクス下では、平均報酬36.91を達成し、MPC(-43.52)と単一エージェントRL(11.95)を著しく上回り、複雑で非定常な環境に対しても頑健であることを示した。
  • アルゴリズムは10〜20回の訓練エピソード以内に安定した高報酬ポリシーに収束し、4エージェントおよび8エージェント系の両方で報酬分布に一貫性が見られた。
  • K=50のとき、すべてのダイナミクスで最適なパフォーマンスが達成された。これは、過去状態の長期間記憶が信号品質の時間的パターンの学習を向上させることを示している。
  • MPCは特に混合ダイナミクス下で著しく性能が低く、不正確なシステムモデルに依存するのに対し、IntelligentCrowdは誤ったモデルに依存せず、協調戦略を学習できる柔軟性を示した。
  • 長期間記憶(K=100)を備えた単一エージェントRLでも、MARLに比べて性能が劣った。これは、複数参加者センシングタスクにおいてエージェント間連携の重要性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。