Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent Deep Reinforcement Learning enabled Computation Resource Allocation in a Vehicular Cloud Network

Shilin Xu, Caili Guo|arXiv (Cornell University)|Aug 14, 2020
Vehicular Ad Hoc Networks (VANETs)被引用数 6
ひとこと要約

本稿では、インフラ構造のない車両クラウドネットワークにおける計算リソース割り当て方式を、分散型仮想クラウドネットワーク(VCN)を活用して動的オフロードを実現する、マルチエージェント深層強化学習(MADDPG)に基づくものとして提案する。問題をマルコフゲームとしてモデル化し、集中学習と分散実行を組み合わせることで、非定常な環境下でも効率的でリアルタイムなリソース割り当てを達成する。シミュレーションにより、動的で変化し続ける車両環境下での有効性が確認された。

ABSTRACT

In this paper, we investigate the computational resource allocation problem in a distributed Ad-Hoc vehicular network with no centralized infrastructure support. To support the ever increasing computational needs in such a vehicular network, the distributed virtual cloud network (VCN) is formed, based on which a computational resource sharing scheme through offloading among nearby vehicles is proposed. In view of the time-varying computational resource in VCN, the statistical distribution characteristics for computational resource are analyzed in detail. Thereby, a resource-aware combinatorial optimization objective mechanism is proposed. To alleviate the non-stationary environment caused by the typically multi-agent environment in VCN, we adopt a centralized training and decentralized execution framework. In addition, for the objective optimization problem, we model it as a Markov game and propose a DRL based multi-agent deep deterministic reinforcement learning (MADDPG) algorithm to solve it. Interestingly, to overcome the dilemma of lacking a real central control unit in VCN, the allocation is actually completed on the vehicles in a distributed manner. The simulation results are presented to demonstrate our scheme's effectiveness.

研究の動機と目的

  • 集中型インfraストラクチャのないアドホックな車両ネットワークにおける、動的で分散型の計算リソース割り当ての課題に対処すること。
  • 車両クラウドネットワーク(VCN)における計算リソースの時間変動特性をモデル化し、その統計的分布特性を分析すること。
  • 車両間でのリソース可用性の変動に適応可能なリソース指向の組み合わせ最適化目的関数を設計すること。
  • 極めて動的で変化し続ける車両環境におけるリアルタイムリソース割り当てのスケーラブルで分散型のソリューションを開発すること。
  • マルチエージェント環境の非定常性を克服するため、集中学習と分散実行のフレームワークを採用すること。

提案手法

  • 複数の自律的車両間の相互作用を捉えるために、リソース割り当て問題をマルコフゲームとしてモデル化する。
  • マルコフゲームを解き、リソース割り当てを最適化するため、マルチエージェント深層決定的方策勾配(MADDPG)アルゴリズムを提案する。
  • 非定常なマルチエージェント環境における学習の安定化を図るため、集中学習と分散実行(CTDE)フレームワークを実装する。
  • 利用可能な計算リソースの統計的分布を考慮したリソース指向の組み合わせ最適化目的関数を設計する。
  • 近隣の車両間で分散型仮想クラウドネットワーク(VCN)を構築し、ピアツーピアの計算オフロードを可能にする。
  • 個々の車両上で完全に分散型に割り当て方策を実行できるようにし、中央制御ユニットへの依存を排除する。

実験結果

リサーチクエスチョン

  • RQ1集中型インfraストラクチャのない分散型車両クラウドネットワークにおいて、計算リソースをどのように効率的に割り当てることができるか?
  • RQ2時間変動する計算リソースの可用性が、車両ネットワークにおけるリソース割り当て性能に与える影響は何か?
  • RQ3非定常な車両環境において、マルチエージェント強化学習を効果的に適用して安定性と収束性を維持できるか?
  • RQ4集中学習と分散実行のフレームワークは、車両リソース割り当てにおける学習効率とスケーラビリティを向上させることができるか?
  • RQ5提案手法のMADDPGベースの方式は、ベースライン手法と比較してリソース利用効率やオフロード成功確率において優れているか?

主な発見

  • 提案手法のMADDPGベースの方式は、動的で変化する車両ネットワークの非定常環境において、安定した学習と収束を達成した。
  • リソース指向の組み合わせ最適化目的関数は、利用可能な計算リソースの統計的分布に効果的に適応した。
  • 集中学習と分散実行のフレームワークにより、完全な分散型のポリシー実行を維持しつつ、高い性能を達成した。
  • シミュレーション結果から、ベースライン手法と比較してリソース利用効率とオフロード効率の両方が向上した。
  • 中央制御ユニットを必要とせず、リアルタイムかつ分散型の計算オフロードを成功裏に実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。